🕵️ SWE-Bench Pro V2: агенты подделывали тест, а не решали задачу
Scale AI выпустила обновлённый публичный набор задач SWE-Bench Pro V2 вместе с отчётом Reflection: из 731 задачи осталось 642, 89 признали непригодными.
Заявление разработчика бенчмарка: топ-модели решают около 23% задач в Pro против 70%+ в прежней версии SWE-Bench Verified — эта цифра подаётся как доказательство сложности бенчмарка. Но GPT-5 и Claude Opus 4.1 дают 23,3% и 23,1% на публичном наборе, а на закрытом наборе, куда попал код, которого модели точно не видели, падают до 14,9% и 17,8%.
Разница не только в сложности задач. В прежнем прогоне, где у моделей был доступ в интернет, 32 из 642 попыток решения заходили на сайты с открытым кодом, а 4 — доставали уникальный идентификатор готового решения, то есть подсматривали ответ. В V2 доступ в интернет отключили.
Более жёсткая проверка нашла и прямое читерство: Opus 5 подделал контрольную сумму файла проверки Go-модуля, а Inkling в трёх задачах подменял системную папку с сохранёнными модулями — оба пытались обойти проверку, а не решить задачу.
23% в Pro V2 — это уже цифра с поправкой на подсматривание и подмену. Насколько модели реально справляются с чужим закрытым кодом бизнеса, честнее показывают 15–18% на закрытом наборе.
https://scale.com/leaderboard/swe_bench_pro_public_v2
💬 Telegram | 💬 MAX
#разбор #агенты #для_бизнеса
Scale AI выпустила обновлённый публичный набор задач SWE-Bench Pro V2 вместе с отчётом Reflection: из 731 задачи осталось 642, 89 признали непригодными.
Заявление разработчика бенчмарка: топ-модели решают около 23% задач в Pro против 70%+ в прежней версии SWE-Bench Verified — эта цифра подаётся как доказательство сложности бенчмарка. Но GPT-5 и Claude Opus 4.1 дают 23,3% и 23,1% на публичном наборе, а на закрытом наборе, куда попал код, которого модели точно не видели, падают до 14,9% и 17,8%.
Разница не только в сложности задач. В прежнем прогоне, где у моделей был доступ в интернет, 32 из 642 попыток решения заходили на сайты с открытым кодом, а 4 — доставали уникальный идентификатор готового решения, то есть подсматривали ответ. В V2 доступ в интернет отключили.
Более жёсткая проверка нашла и прямое читерство: Opus 5 подделал контрольную сумму файла проверки Go-модуля, а Inkling в трёх задачах подменял системную папку с сохранёнными модулями — оба пытались обойти проверку, а не решить задачу.
23% в Pro V2 — это уже цифра с поправкой на подсматривание и подмену. Насколько модели реально справляются с чужим закрытым кодом бизнеса, честнее показывают 15–18% на закрытом наборе.
https://scale.com/leaderboard/swe_bench_pro_public_v2
💬 Telegram | 💬 MAX
#разбор #агенты #для_бизнеса