За последний месяц сделали несколько апдейтов SWE-rebench Leaderboard:
https://swe-rebench.com/
> собрали новые задачи и прогнали кучу моделей на свежем срезе
> обновили интерфейс, сделали его более понятным и красивым
> добавили rebench в HarborHub: теперь бенчмарк можно запускать в Harbor
Мы немного поменяли формат апдейтов: теперь делаем их не каждый месяц, а примерно раз в два месяца. Зато в каждом таком обновлении сразу прогоняем много моделей на пачке из примерно 100 свежих задач.
Ещё один интересный момент: независимый исследователь прогнал наши задачи и задачи SWE-bench Pro на предмет качества. По его оценке, в нашем бенчмарке оказалось меньше задач с явными проблемами, чем в SWE-bench Pro. Это приятно, учитывая, что в последнем апдейте мы не смотрели задачи вручную: всё было собрано автоматически, тогда как в SWE-bench Pro было много ручной разметки.
> SWE-rebench audit: 7 / 110 ≈ 6% unsolvable tasks
> SWE-bench-PRO audit: 172 / 728 ≈ 24% unsolvable tasks
Ещё я записал прямой эфир с ребятами про бенчмаркинг кодинговых агентов.
@etechlead
@ai_driven
Очень классно поговорили о том, как всё устроено, какие есть проблемы в оценке моделей и как вообще стоит смотреть на такие бенчмарки.
https://youtu.be/a5jf-kyV12Y
https://swe-rebench.com/
> собрали новые задачи и прогнали кучу моделей на свежем срезе
> обновили интерфейс, сделали его более понятным и красивым
> добавили rebench в HarborHub: теперь бенчмарк можно запускать в Harbor
Мы немного поменяли формат апдейтов: теперь делаем их не каждый месяц, а примерно раз в два месяца. Зато в каждом таком обновлении сразу прогоняем много моделей на пачке из примерно 100 свежих задач.
Ещё один интересный момент: независимый исследователь прогнал наши задачи и задачи SWE-bench Pro на предмет качества. По его оценке, в нашем бенчмарке оказалось меньше задач с явными проблемами, чем в SWE-bench Pro. Это приятно, учитывая, что в последнем апдейте мы не смотрели задачи вручную: всё было собрано автоматически, тогда как в SWE-bench Pro было много ручной разметки.
> SWE-rebench audit: 7 / 110 ≈ 6% unsolvable tasks
> SWE-bench-PRO audit: 172 / 728 ≈ 24% unsolvable tasks
Ещё я записал прямой эфир с ребятами про бенчмаркинг кодинговых агентов.
@etechlead
@ai_driven
Очень классно поговорили о том, как всё устроено, какие есть проблемы в оценке моделей и как вообще стоит смотреть на такие бенчмарки.
https://youtu.be/a5jf-kyV12Y