🐱 GitHub выпустил ReviewBench — открытый бенчмарк для AI-ревьюеров кода
Проверяют на 219 PR из 187 open source репозиториев на 19 языках. Подбирали по распределению 103,9 млн реальных PR на GitHub, но мелких однофайловых правок взяли меньше. Эталонные находки собрали из комментариев людей, статических анализаторов и фронтир-моделей, разметили по критичности и категориям. Судит Claude Sonnet 5 по опубликованной рубрике, а сеньоры независимо перепроверили результаты и они совпали в 96,6% случаев.
Своего агента можно прогнать самому. Есть контейнер + и нужен свой ключ к модели для оценки.
Топ лидерборда:
🏆 Copilot Code Review — 40,1
🥈 Devin AI — 37,0
🥉 Qodo — 35,1
Бенчмарк от GitHub, и по классике первое место у Copilot от GitHub. Неожиданно 😁 Прогоны конкурентов делала сама команда, вендоры их не проверяли. Но интереснее другое: даже лидер находит только ~26% известных проблем. Так что живой ревьюер пока без работы не останется.
🔗 Анонс в блоге GitHub
🏆 Лидерборд
🐱 GitHub
#AI #CodeReview #GitHub
Проверяют на 219 PR из 187 open source репозиториев на 19 языках. Подбирали по распределению 103,9 млн реальных PR на GitHub, но мелких однофайловых правок взяли меньше. Эталонные находки собрали из комментариев людей, статических анализаторов и фронтир-моделей, разметили по критичности и категориям. Судит Claude Sonnet 5 по опубликованной рубрике, а сеньоры независимо перепроверили результаты и они совпали в 96,6% случаев.
Своего агента можно прогнать самому. Есть контейнер + и нужен свой ключ к модели для оценки.
Топ лидерборда:
🏆 Copilot Code Review — 40,1
🥈 Devin AI — 37,0
🥉 Qodo — 35,1
Бенчмарк от GitHub, и по классике первое место у Copilot от GitHub. Неожиданно 😁 Прогоны конкурентов делала сама команда, вендоры их не проверяли. Но интереснее другое: даже лидер находит только ~26% известных проблем. Так что живой ревьюер пока без работы не останется.
🔗 Анонс в блоге GitHub
🏆 Лидерборд
🐱 GitHub
#AI #CodeReview #GitHub