Новый бенчмарк DeepSWE.
Конечно, хочется иметь линейку, чтобы можно было померить, какой AI-инструмент лучше. Вот ребята представили DeepSWE, как утверждают, новый бенчмарк для тестирования агентного программирования.
Вообще они хотят показать, в чем они модели, и хотят отражать «реальный опыт» разработчиков в повседневной работе. Посмотрим, что из этого выйдет.
Конечно, хочется иметь линейку, чтобы можно было померить, какой AI-инструмент лучше. Вот ребята представили DeepSWE, как утверждают, новый бенчмарк для тестирования агентного программирования.
Вообще они хотят показать, в чем они модели, и хотят отражать «реальный опыт» разработчиков в повседневной работе. Посмотрим, что из этого выйдет.