TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
VG: VideoLab & Self-Motivated Learning

23 Mar 2025, 20:10

Открыть в Telegram Поделиться Пожаловаться

Prev Next
Господа!

Тут довольно любопытная статья выложена на архиве несколько дней назад "Measuring AI Ability to Complete Long Tasks".

Несложно заметить, что модели работают все лучше и лучше. А в каких попугаях измерять улучшение?

Их ключевая идея, это размечать задачи во времени, которое на них тратит средний человек. И дальше смотреть, как справляются модели с задачами в терминах времени.

Короче! На верхнем графике указано с каким количеством задач по сложности во времени модель справляется в 50% случаев.

По вертикали шкала логарифмическая и получилась сравнительно красивая почти линейная зависимость, из которой следует оценка экспоненциального роста: примерно каждые 7 месяцев модели справляются с вдвое более сложными по времени задачами. 🤔🙂

В подтверждение своего подхода они на подобную шкалу переложили данные любимого мной в этом сезоне SWE-bench (там тоже есть разметка во времени). И получили тоже очень близкую оценку даже для 80% success rate (нижний график).

Статья на 45 страниц и там есть на чем позалипать.

В качестве критики:

* 169 задач — выглядит маловато (с другой стороны они, похоже, взяли минимальное число, при котором доверительные интервалы на что-то разумное похожи), но в любом случае основной черрипик (если он есть ради красоты идеи) может быть именно в этом.

* Фундаментальная проблема подхода: Очевидно, с увеличением сложности задач разметка времени решения человеком будет становиться заметно дороже и сложнее, а в ближайшее время ровно такие задачи интересны. На задачах, которые требовали больше 4 часов, у них human success rate ниже 30%... 🤷‍♂️

* Взять за основу графика 50% или даже 80% success rate модели — это по сути оценивать "тех, кто допрыгнул". Не думаю, что сотрудник, который ошибается в 50% будет очень полезен. 😉 Очевидно, процентиль была взята для удобства прогноза на данный момент и судя по supplementary для 100% на данный момент график не такой красивый 😉

С другой стороны авторы явно понимают проблемы и спешат застолбить сам подход к предсказанию скорости прогресса, явно проговаривая, что еще нужно сделать, чтобы его улучшить. Там 25 авторов и работа выглядит очень неплохо проработанной.

В целом при текущем тренде условно к концу 2027 года модели будут с 50% success rate справляться с задачами, требующими 8 часов работы человека (возможно больше!), а к концу десятилетия — требующими недели работы человека (возможно раньше!). 100% success rate будет подтягиваться, видимо, медленнее, так что время у нас, дорогие кожаные, пока точно есть 😁 вопрос на что его потратить

Интересная работа. Надо будет найти ее на openreview через какое-то время и почитать, как ее покритиковали 😉

#speed_of_progress

1.3k 0 9 6
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot