TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
VG: VideoLab & Self-Motivated Learning

6 Feb, 17:05

Открыть в Telegram Поделиться Пожаловаться

Господа!

Одна из наиболее интересных бенчмарков последнего времени, это METR Time Horizon (про который я писал тык, тык), неделю назад без особой помпы обновился до версии 1.1.

Этот бенчмарк интересен тем, что построен на закрытом датасете (сегодня такие бенчмарки хотя бы относительно что-то показывают), т.е. в первой версии 64 задачи (из 189) было открыто и 125 закрыто. Суммарно на его разметку было потрачено 1500 часов работы людей и он неплохо показывает скорость усложнения задач, с которыми справляются модели.

В Time Horizon 1.1 они:
* на 34% увеличили число задач (до 228)
* удалили 15 задач (посчитанных неудачными)
* обновили 53 задачи (описание, либо уточнена оценка по времени).
* на графике выше видно, что существенно выросло число длинных задач, с одной стороны наиболее дорогих в разметке, с другой — наиболее интересных с текущей скоростью развития агентов.

Увы статьи еще нет, только пост, поэтому неизвестно, сколько новых задач будет раскрыто (есть ссылка на гитхаб, но я его не парсил).

Также много мелких (но важных для точности и удобства оценки) изменений в методике, типа того, что они сменили фреймворк оценки с самописного на получивший популярность. Это явно удешевит развитие.

У меня впечатление, что они прямо старались остаться в рамках старых доверительных интервалов, но в любом случае:

* Общий тренд с 2019 года: время удвоения горизонта ~196 дней (≈7 месяцев), что соответствует предыдущим оценкам

* С 2023 года: время удвоения сократилось со 165 дней (TH1) до 131 дня (TH1.1) — прогресс на 20% быстрее

* С 2024 года: время удвоения составляет всего 89 дней (TH1.1) против 109 дней (TH1)

Это означает, что они констатируют УВЕЛИЧЕНИЕ ВРЕМЕНИ УСПЕШНО РЕШАЕМЫХ ЗАДАЧ БОЛЬШЕ, ЧЕМ В 16 РАЗ ЗА ГОД последние два года! 😲

Важная оговорка — они рассматривают 50% и 80% success rate, что в большинстве задач заметно ниже типичных требований работодателя. Но 80% растет примерно с той же скоростью!

В этой новостью хорошо рифмуется вчерашняя новость, как команда агентов на Opus 4.6 Антропиков за неделю написала полноценный С-компилятор на Rust под платформы x86, ARM и RISC-V (собирать под несколько платформ это очень круто, кто понимает). Агенты потратили 20000$ через API, написали 100000 строк кода компилятора, который может собрать ядро Linux 6.9! Я когда-то пересобирал ручками ядро Linux под не самое стандартное железо, тогда даже на gcc это было эпопеей. Заняло неделю... Кроме этого у них собрались SQLite и Doom (код которых не самый тривиальный из-за оптимизаций).

Здесь впечатляет именно быстрый рост сложности задачи. Если бы в начале 2023 после выхода GPT сказали, что через 3 года агенты будут писать компилятор ядра Линукса за неделю, то крутили бы пальцем у виска примерно все, кто хоть сколько-нибудь понимает в теме. А создатели моделей достигли этого и продолжают увеличивать сложность задач.

Что у них будет следующей планкой по уровню? 🤔

Смотрю на ситуацию в легком обалдении! Пока скорость наступления будущего растет.

Больше материалов на тему:
#speed_of_progress@vgcourse

@vgcourse

876 0 6 19 3
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot