Господа!
Целых полтора месяца не писал про SWE-bench, а там за это время небезызвестная компания OpenAI декларирует скачек с 53% до 71.7% 😲
В прошлый я восторгался прогрессу 7.6% за месяц с небольшим. А тут 17.7% за полтора месяца... Упс... Это что ж деется то 🤯🤯🤯
Напомню, бенчмарк создан год назад и основан на разметке реальных issues (багрепортов) гитхаба, позволяющих автоматически проверять что баг пофиксили и сложность багов варьируется от 15 минут до 4 часов работы программиста.
Развитие бенчмарка за год:
* Март 2024 — SWE-bench Lite: сокращенная версия бенчмарка, позволяющая быстрее проводить тестирование, что особенно полезно для предварительной оценки моделей (ускорение разработки).
* Июнь 2024 — Docker-версия: обеспечивает простоту установки и воспроизводимость тестирования в различных средах (снова ускорение разработки).
* Август 2024 — SWE-bench Verified: в сотрудничестве с OpenAI был создан SWE-bench Verified — поднабор из 500 задач, более глубоко проверенных разработчиками (пофиксили возможность моделей читерить при исправлении багов).
* Октябрь 2024 — SWE-bench Multimodal: позволяет оценивать способность ИИ-систем анализировать и исправлять ошибки, используя как текстовую, так и визуальную информацию (критично для интерфейсов и не только).
При этом очень похоже, что 2 года бенчмарк "не продержится" (будет решен чуть меньше, чем полностью и потеряет смысл).
Следующими шагами логично ожидать:
* Более сложный бенчмарк, куда соберут только задачи, требующие от 3+ часов работы программиста на багфикс (но такой довольно дорого собирать и размечать, хотя все крупные участники гонки типа OpenAI, Amazon, Bytedance etc в этом заинтересованы и шанс есть).
* Появление аналога Арены, например, когда репозиториям гитхаба будет предложено поучаствовать в арене сабмитами issues, под требование за ограниченное время проверять пул-реквест с багфиксом и давать обратную связь по качеству багфикса (если люди не будут за короткое время давать обратную связь по багфиксу, компаниям не будет иметь смысла финансировать участие в такой арене, но для того же гитхаба это вполне реально решить, например, отправляя новые issues на багфикс в первую очередь для тех, кто быстрее и детальнее проверил прошлые).
Именно проверка на реальных примерах (а не на ограниченных датасетах бенчмарков) позволить по опыту существенно забустить область, но ситуация для этого должна "созреть". Тут она дозревает поразительно быстро.
Сейчас Github Issues Arena выглядит как фантастика, но честно говоря текущие достижения о3 выглядели нереально фантастично всего 3 года назад, поэтому ждать, вангую, недолго.
Традиционно напомню, что CEO NVIDIA в феврале 2024 призывал не отдавать детей учиться программированию. Вы уже учитесь. Ваши действия? 😉 Мы ищем тех, кто хочет оставаться конкурентоспособным и через 10, и через 20 лет (что будет очень непросто, похоже, но победитель получит много, очень много). 😁
Ну и про второй график:
Подробнее тут: GPT-o3 can become a red coder? Там прикольные комментарии ред-кодеров, их жестко рвет, конечно...
Картинка отсюда
#SWE_benchmarking
#speed_of_progress
Целых полтора месяца не писал про SWE-bench, а там за это время небезызвестная компания OpenAI декларирует скачек с 53% до 71.7% 😲
В прошлый я восторгался прогрессу 7.6% за месяц с небольшим. А тут 17.7% за полтора месяца... Упс... Это что ж деется то 🤯🤯🤯
Напомню, бенчмарк создан год назад и основан на разметке реальных issues (багрепортов) гитхаба, позволяющих автоматически проверять что баг пофиксили и сложность багов варьируется от 15 минут до 4 часов работы программиста.
Развитие бенчмарка за год:
* Март 2024 — SWE-bench Lite: сокращенная версия бенчмарка, позволяющая быстрее проводить тестирование, что особенно полезно для предварительной оценки моделей (ускорение разработки).
* Июнь 2024 — Docker-версия: обеспечивает простоту установки и воспроизводимость тестирования в различных средах (снова ускорение разработки).
* Август 2024 — SWE-bench Verified: в сотрудничестве с OpenAI был создан SWE-bench Verified — поднабор из 500 задач, более глубоко проверенных разработчиками (пофиксили возможность моделей читерить при исправлении багов).
* Октябрь 2024 — SWE-bench Multimodal: позволяет оценивать способность ИИ-систем анализировать и исправлять ошибки, используя как текстовую, так и визуальную информацию (критично для интерфейсов и не только).
При этом очень похоже, что 2 года бенчмарк "не продержится" (будет решен чуть меньше, чем полностью и потеряет смысл).
Следующими шагами логично ожидать:
* Более сложный бенчмарк, куда соберут только задачи, требующие от 3+ часов работы программиста на багфикс (но такой довольно дорого собирать и размечать, хотя все крупные участники гонки типа OpenAI, Amazon, Bytedance etc в этом заинтересованы и шанс есть).
* Появление аналога Арены, например, когда репозиториям гитхаба будет предложено поучаствовать в арене сабмитами issues, под требование за ограниченное время проверять пул-реквест с багфиксом и давать обратную связь по качеству багфикса (если люди не будут за короткое время давать обратную связь по багфиксу, компаниям не будет иметь смысла финансировать участие в такой арене, но для того же гитхаба это вполне реально решить, например, отправляя новые issues на багфикс в первую очередь для тех, кто быстрее и детальнее проверил прошлые).
Именно проверка на реальных примерах (а не на ограниченных датасетах бенчмарков) позволить по опыту существенно забустить область, но ситуация для этого должна "созреть". Тут она дозревает поразительно быстро.
Сейчас Github Issues Arena выглядит как фантастика, но честно говоря текущие достижения о3 выглядели нереально фантастично всего 3 года назад, поэтому ждать, вангую, недолго.
Традиционно напомню, что CEO NVIDIA в феврале 2024 призывал не отдавать детей учиться программированию. Вы уже учитесь. Ваши действия? 😉 Мы ищем тех, кто хочет оставаться конкурентоспособным и через 10, и через 20 лет (что будет очень непросто, похоже, но победитель получит много, очень много). 😁
Ну и про второй график:
o3 scores a 2727 ELO on Codeforces which places it 175th in the global ranking. That's better than ~99.9% of humans on the website (who already tend to be far above average)
Подробнее тут: GPT-o3 can become a red coder? Там прикольные комментарии ред-кодеров, их жестко рвет, конечно...
Картинка отсюда
#SWE_benchmarking
#speed_of_progress