Сегодня продолжу рассказывать про свои недавние статьи. Вот, например, порекламирую работу моего аспиранта Вадима Ломшакова и ещё одного моего аспиранта (правда, больше формального) Андрея Подивилова:
AgentLens: Production-Assessed Trajectory Reviews for Coding Agent Evaluation
Почти все бенчмарки для LLM-агентов сводят прогон к одному биту: решил задачу или нет. Для лидерборда это, может, и неизбежно, но человек, который работает с агентом целый день, видит всю траекторию: как агент следует инструкциям, как пользуется инструментами, проверяет ли за собой, как исправляет ошибки и что вообще пишет пользователю.
Агент может пройти формальную проверку, но быть невыносимым в "рабочей коммуникации"; а может в итоге так и не написать проходящую тесты программу, но по дороге сделать кучу полезного. А для задач вроде "напиши документацию" бинарного критерия успеха и вовсе не существует.
AgentLens — это попытка сделать систему, которая оценивает именно траектории. Каждый прогон получает формальную верификацию там, где она возможна (тесты, проверки состояния репозитория и т.д.), плюс отзывы LLM-судей по пяти измерениям: итоговый результат, следование инструкциям, разные ловушки (pitfalls), в которые можно попасться, качество работы с инструментами и просто насколько приятно человеку с агентом взаимодействовать.
Одна из главных идей в том, что LLM-судья не только ставит оценку, но и пишет связный текстовый отзыв со ссылками на конкретные места в траектории, так что любой балл хорошо мотивирован, и эту мотивацию можно реально прочитать. Пользователя в нашей статье, кстати, тоже симулирует LLM — с разными персонами, включая пользователя слегка токсичного.
В полученном лидерборде на первом месте Opus 4.7, но это довольно скучный результат. Самое интересное — что по отзывам часто видны важные подробности. Например, Kimi K2.6 оказался на последнем месте, и по цифрам это выглядит как "слабая модель"; но отзыв судьи по tool calls показывает, что почти все ошибки — это один и тот же баг парсинга аргументов на стороне OpenRouter, а когда аргументы доходили нормально, агент работал вполне прилично;
Ещё один любопытный результат — self-preference судей: если сравнивать GPT-5.5 и Sonnet 4.6 их же собственными судьями, каждый судья заметно чаще предпочитает свою модель. Это ожидаемо, но забавно, что половина этого эффекта — в той самой крайне субъективной метрике Pleasantness.) Впрочем, победителя в среднем это не меняет.
Весь код выложен в соответствующем репозитории, и есть даже отдельная страничка про AgentLens и пост от авторов из Explyt.
Спасибо Вадиму Ломшакову, Андрею Подивилову и другим соавторам! Надеюсь, ещё поработаем вместе.
#research #publications #ai
AgentLens: Production-Assessed Trajectory Reviews for Coding Agent Evaluation
Почти все бенчмарки для LLM-агентов сводят прогон к одному биту: решил задачу или нет. Для лидерборда это, может, и неизбежно, но человек, который работает с агентом целый день, видит всю траекторию: как агент следует инструкциям, как пользуется инструментами, проверяет ли за собой, как исправляет ошибки и что вообще пишет пользователю.
Агент может пройти формальную проверку, но быть невыносимым в "рабочей коммуникации"; а может в итоге так и не написать проходящую тесты программу, но по дороге сделать кучу полезного. А для задач вроде "напиши документацию" бинарного критерия успеха и вовсе не существует.
AgentLens — это попытка сделать систему, которая оценивает именно траектории. Каждый прогон получает формальную верификацию там, где она возможна (тесты, проверки состояния репозитория и т.д.), плюс отзывы LLM-судей по пяти измерениям: итоговый результат, следование инструкциям, разные ловушки (pitfalls), в которые можно попасться, качество работы с инструментами и просто насколько приятно человеку с агентом взаимодействовать.
Одна из главных идей в том, что LLM-судья не только ставит оценку, но и пишет связный текстовый отзыв со ссылками на конкретные места в траектории, так что любой балл хорошо мотивирован, и эту мотивацию можно реально прочитать. Пользователя в нашей статье, кстати, тоже симулирует LLM — с разными персонами, включая пользователя слегка токсичного.
В полученном лидерборде на первом месте Opus 4.7, но это довольно скучный результат. Самое интересное — что по отзывам часто видны важные подробности. Например, Kimi K2.6 оказался на последнем месте, и по цифрам это выглядит как "слабая модель"; но отзыв судьи по tool calls показывает, что почти все ошибки — это один и тот же баг парсинга аргументов на стороне OpenRouter, а когда аргументы доходили нормально, агент работал вполне прилично;
Ещё один любопытный результат — self-preference судей: если сравнивать GPT-5.5 и Sonnet 4.6 их же собственными судьями, каждый судья заметно чаще предпочитает свою модель. Это ожидаемо, но забавно, что половина этого эффекта — в той самой крайне субъективной метрике Pleasantness.) Впрочем, победителя в среднем это не меняет.
Весь код выложен в соответствующем репозитории, и есть даже отдельная страничка про AgentLens и пост от авторов из Explyt.
Спасибо Вадиму Ломшакову, Андрею Подивилову и другим соавторам! Надеюсь, ещё поработаем вместе.
#research #publications #ai