Господа!
Одна из наиболее интересных бенчмарков последнего времени, это METR Time Horizon (про который я писал тык, тык), неделю назад без особой помпы обновился до версии 1.1.
Этот бенчмарк интересен тем, что построен на закрытом датасете (сегодня такие бенчмарки хотя бы относительно что-то показывают), т.е. в первой версии 64 задачи (из 189) было открыто и 125 закрыто. Суммарно на его разметку было потрачено 1500 часов работы людей и он неплохо показывает скорость усложнения задач, с которыми справляются модели.
В Time Horizon 1.1 они:
* на 34% увеличили число задач (до 228)
* удалили 15 задач (посчитанных неудачными)
* обновили 53 задачи (описание, либо уточнена оценка по времени).
* на графике выше видно, что существенно выросло число длинных задач, с одной стороны наиболее дорогих в разметке, с другой — наиболее интересных с текущей скоростью развития агентов.
Увы статьи еще нет, только пост, поэтому неизвестно, сколько новых задач будет раскрыто (есть ссылка на гитхаб, но я его не парсил).
Также много мелких (но важных для точности и удобства оценки) изменений в методике, типа того, что они сменили фреймворк оценки с самописного на получивший популярность. Это явно удешевит развитие.
У меня впечатление, что они прямо старались остаться в рамках старых доверительных интервалов, но в любом случае:
* Общий тренд с 2019 года: время удвоения горизонта ~196 дней (≈7 месяцев), что соответствует предыдущим оценкам
* С 2023 года: время удвоения сократилось со 165 дней (TH1) до 131 дня (TH1.1) — прогресс на 20% быстрее
* С 2024 года: время удвоения составляет всего 89 дней (TH1.1) против 109 дней (TH1)
Это означает, что они констатируют УВЕЛИЧЕНИЕ ВРЕМЕНИ УСПЕШНО РЕШАЕМЫХ ЗАДАЧ БОЛЬШЕ, ЧЕМ В 16 РАЗ ЗА ГОД последние два года! 😲
Важная оговорка — они рассматривают 50% и 80% success rate, что в большинстве задач заметно ниже типичных требований работодателя. Но 80% растет примерно с той же скоростью!
В этой новостью хорошо рифмуется вчерашняя новость, как команда агентов на Opus 4.6 Антропиков за неделю написала полноценный С-компилятор на Rust под платформы x86, ARM и RISC-V (собирать под несколько платформ это очень круто, кто понимает). Агенты потратили 20000$ через API, написали 100000 строк кода компилятора, который может собрать ядро Linux 6.9! Я когда-то пересобирал ручками ядро Linux под не самое стандартное железо, тогда даже на gcc это было эпопеей. Заняло неделю... Кроме этого у них собрались SQLite и Doom (код которых не самый тривиальный из-за оптимизаций).
Здесь впечатляет именно быстрый рост сложности задачи. Если бы в начале 2023 после выхода GPT сказали, что через 3 года агенты будут писать компилятор ядра Линукса за неделю, то крутили бы пальцем у виска примерно все, кто хоть сколько-нибудь понимает в теме. А создатели моделей достигли этого и продолжают увеличивать сложность задач.
Что у них будет следующей планкой по уровню? 🤔
Смотрю на ситуацию в легком обалдении! Пока скорость наступления будущего растет.
Больше материалов на тему:
#speed_of_progress@vgcourse
@vgcourse
Одна из наиболее интересных бенчмарков последнего времени, это METR Time Horizon (про который я писал тык, тык), неделю назад без особой помпы обновился до версии 1.1.
Этот бенчмарк интересен тем, что построен на закрытом датасете (сегодня такие бенчмарки хотя бы относительно что-то показывают), т.е. в первой версии 64 задачи (из 189) было открыто и 125 закрыто. Суммарно на его разметку было потрачено 1500 часов работы людей и он неплохо показывает скорость усложнения задач, с которыми справляются модели.
В Time Horizon 1.1 они:
* на 34% увеличили число задач (до 228)
* удалили 15 задач (посчитанных неудачными)
* обновили 53 задачи (описание, либо уточнена оценка по времени).
* на графике выше видно, что существенно выросло число длинных задач, с одной стороны наиболее дорогих в разметке, с другой — наиболее интересных с текущей скоростью развития агентов.
Увы статьи еще нет, только пост, поэтому неизвестно, сколько новых задач будет раскрыто (есть ссылка на гитхаб, но я его не парсил).
Также много мелких (но важных для точности и удобства оценки) изменений в методике, типа того, что они сменили фреймворк оценки с самописного на получивший популярность. Это явно удешевит развитие.
У меня впечатление, что они прямо старались остаться в рамках старых доверительных интервалов, но в любом случае:
* Общий тренд с 2019 года: время удвоения горизонта ~196 дней (≈7 месяцев), что соответствует предыдущим оценкам
* С 2023 года: время удвоения сократилось со 165 дней (TH1) до 131 дня (TH1.1) — прогресс на 20% быстрее
* С 2024 года: время удвоения составляет всего 89 дней (TH1.1) против 109 дней (TH1)
Это означает, что они констатируют УВЕЛИЧЕНИЕ ВРЕМЕНИ УСПЕШНО РЕШАЕМЫХ ЗАДАЧ БОЛЬШЕ, ЧЕМ В 16 РАЗ ЗА ГОД последние два года! 😲
Важная оговорка — они рассматривают 50% и 80% success rate, что в большинстве задач заметно ниже типичных требований работодателя. Но 80% растет примерно с той же скоростью!
В этой новостью хорошо рифмуется вчерашняя новость, как команда агентов на Opus 4.6 Антропиков за неделю написала полноценный С-компилятор на Rust под платформы x86, ARM и RISC-V (собирать под несколько платформ это очень круто, кто понимает). Агенты потратили 20000$ через API, написали 100000 строк кода компилятора, который может собрать ядро Linux 6.9! Я когда-то пересобирал ручками ядро Linux под не самое стандартное железо, тогда даже на gcc это было эпопеей. Заняло неделю... Кроме этого у них собрались SQLite и Doom (код которых не самый тривиальный из-за оптимизаций).
Здесь впечатляет именно быстрый рост сложности задачи. Если бы в начале 2023 после выхода GPT сказали, что через 3 года агенты будут писать компилятор ядра Линукса за неделю, то крутили бы пальцем у виска примерно все, кто хоть сколько-нибудь понимает в теме. А создатели моделей достигли этого и продолжают увеличивать сложность задач.
Что у них будет следующей планкой по уровню? 🤔
Смотрю на ситуацию в легком обалдении! Пока скорость наступления будущего растет.
Больше материалов на тему:
#speed_of_progress@vgcourse
@vgcourse