GPT уверенно уделывает Opus по очкам, стоимости и времени выполнения!
Datacurve (молодая команда из YC W24, которая делает дорогие и сложные coding-датасеты) выпустила DeepSWE: новый бенчмарк для coding-агентов.
Создатели утверждают: SWE-Bench и подобные уже не отражают реальности. Модели их заучили, задачи слишком мелкие, а оценка полна погрешностей.
Все модели тестировали на одном и том же mini-swe-agent (минималистичный harness на ~100 строк кода).
Результаты можете лицезреть на картинках. Разрыв между топами получился гораздо шире, чем на старых бенчмарках.
@ai_for_devs
Datacurve (молодая команда из YC W24, которая делает дорогие и сложные coding-датасеты) выпустила DeepSWE: новый бенчмарк для coding-агентов.
Создатели утверждают: SWE-Bench и подобные уже не отражают реальности. Модели их заучили, задачи слишком мелкие, а оценка полна погрешностей.
Что внутри DeepSWE:
– 113 полностью новых задач из 91 активного open-source репозитория.
– Пять языков: TypeScript, Go, Python, JavaScript и Rust.
– Среднее решение составляет 668 строк кода в 7 файлах (против ~120 строк и 5 файлов в SWE-Bench Pro).
– Короткие естественные промпты.
– Verifier проверяет реальное поведение, а не структуру авторского решения.
Все модели тестировали на одном и том же mini-swe-agent (минималистичный harness на ~100 строк кода).
Результаты можете лицезреть на картинках. Разрыв между топами получился гораздо шире, чем на старых бенчмарках.
@ai_for_devs