Господа!
Тут довольно любопытная статья выложена на архиве несколько дней назад "Measuring AI Ability to Complete Long Tasks".
Несложно заметить, что модели работают все лучше и лучше. А в каких попугаях измерять улучшение?
Их ключевая идея, это размечать задачи во времени, которое на них тратит средний человек. И дальше смотреть, как справляются модели с задачами в терминах времени.
Короче! На верхнем графике указано с каким количеством задач по сложности во времени модель справляется в 50% случаев.
По вертикали шкала логарифмическая и получилась сравнительно красивая почти линейная зависимость, из которой следует оценка экспоненциального роста: примерно каждые 7 месяцев модели справляются с вдвое более сложными по времени задачами. 🤔🙂
В подтверждение своего подхода они на подобную шкалу переложили данные любимого мной в этом сезоне SWE-bench (там тоже есть разметка во времени). И получили тоже очень близкую оценку даже для 80% success rate (нижний график).
Статья на 45 страниц и там есть на чем позалипать.
В качестве критики:
* 169 задач — выглядит маловато (с другой стороны они, похоже, взяли минимальное число, при котором доверительные интервалы на что-то разумное похожи), но в любом случае основной черрипик (если он есть ради красоты идеи) может быть именно в этом.
* Фундаментальная проблема подхода: Очевидно, с увеличением сложности задач разметка времени решения человеком будет становиться заметно дороже и сложнее, а в ближайшее время ровно такие задачи интересны. На задачах, которые требовали больше 4 часов, у них human success rate ниже 30%... 🤷♂️
* Взять за основу графика 50% или даже 80% success rate модели — это по сути оценивать "тех, кто допрыгнул". Не думаю, что сотрудник, который ошибается в 50% будет очень полезен. 😉 Очевидно, процентиль была взята для удобства прогноза на данный момент и судя по supplementary для 100% на данный момент график не такой красивый 😉
С другой стороны авторы явно понимают проблемы и спешат застолбить сам подход к предсказанию скорости прогресса, явно проговаривая, что еще нужно сделать, чтобы его улучшить. Там 25 авторов и работа выглядит очень неплохо проработанной.
В целом при текущем тренде условно к концу 2027 года модели будут с 50% success rate справляться с задачами, требующими 8 часов работы человека (возможно больше!), а к концу десятилетия — требующими недели работы человека (возможно раньше!). 100% success rate будет подтягиваться, видимо, медленнее, так что время у нас, дорогие кожаные, пока точно есть 😁 вопрос на что его потратить
Интересная работа. Надо будет найти ее на openreview через какое-то время и почитать, как ее покритиковали 😉
#speed_of_progress
Тут довольно любопытная статья выложена на архиве несколько дней назад "Measuring AI Ability to Complete Long Tasks".
Несложно заметить, что модели работают все лучше и лучше. А в каких попугаях измерять улучшение?
Их ключевая идея, это размечать задачи во времени, которое на них тратит средний человек. И дальше смотреть, как справляются модели с задачами в терминах времени.
Короче! На верхнем графике указано с каким количеством задач по сложности во времени модель справляется в 50% случаев.
По вертикали шкала логарифмическая и получилась сравнительно красивая почти линейная зависимость, из которой следует оценка экспоненциального роста: примерно каждые 7 месяцев модели справляются с вдвое более сложными по времени задачами. 🤔🙂
В подтверждение своего подхода они на подобную шкалу переложили данные любимого мной в этом сезоне SWE-bench (там тоже есть разметка во времени). И получили тоже очень близкую оценку даже для 80% success rate (нижний график).
Статья на 45 страниц и там есть на чем позалипать.
В качестве критики:
* 169 задач — выглядит маловато (с другой стороны они, похоже, взяли минимальное число, при котором доверительные интервалы на что-то разумное похожи), но в любом случае основной черрипик (если он есть ради красоты идеи) может быть именно в этом.
* Фундаментальная проблема подхода: Очевидно, с увеличением сложности задач разметка времени решения человеком будет становиться заметно дороже и сложнее, а в ближайшее время ровно такие задачи интересны. На задачах, которые требовали больше 4 часов, у них human success rate ниже 30%... 🤷♂️
* Взять за основу графика 50% или даже 80% success rate модели — это по сути оценивать "тех, кто допрыгнул". Не думаю, что сотрудник, который ошибается в 50% будет очень полезен. 😉 Очевидно, процентиль была взята для удобства прогноза на данный момент и судя по supplementary для 100% на данный момент график не такой красивый 😉
С другой стороны авторы явно понимают проблемы и спешат застолбить сам подход к предсказанию скорости прогресса, явно проговаривая, что еще нужно сделать, чтобы его улучшить. Там 25 авторов и работа выглядит очень неплохо проработанной.
В целом при текущем тренде условно к концу 2027 года модели будут с 50% success rate справляться с задачами, требующими 8 часов работы человека (возможно больше!), а к концу десятилетия — требующими недели работы человека (возможно раньше!). 100% success rate будет подтягиваться, видимо, медленнее, так что время у нас, дорогие кожаные, пока точно есть 😁 вопрос на что его потратить
Интересная работа. Надо будет найти ее на openreview через какое-то время и почитать, как ее покритиковали 😉
#speed_of_progress