SWE-rebench давно не обновлялся. Все потому, что каждый месяц прогонять новые модели, да ещё усложнять задачи, контролировать качество, детектить читинг со стороны моделей становится всё сложнее и сложнее. Но наконец сделали первичный релиз сразу за 2.5 месяца, со 110 задачами. В среднем они стали качественнее и при этом сложнее, теперь мы видим разницу между фронтирными моделями и разными reasoning_efforts. В этот раз к нам пришёл Cursor с просьбой поэвалить Composer 2.5. С учетом цены в 23 цента на задачу модель выглядит очень хорошо.
А первичным я назвал релиз потому, что сейчас там всего 13 моделей. В ближайшие недели добавим сильно больше – DeepSeek V4, Qwen-ы, Gemini Flash 3.5 и тд. Пишите, что хотелось бы увидеть еще.
Upd: В список моделей на добавление уже добавился Opus 4.8 😳
А первичным я назвал релиз потому, что сейчас там всего 13 моделей. В ближайшие недели добавим сильно больше – DeepSeek V4, Qwen-ы, Gemini Flash 3.5 и тд. Пишите, что хотелось бы увидеть еще.
Upd: В список моделей на добавление уже добавился Opus 4.8 😳