TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Sinекура

19 Aug, 21:20

Открыть в Telegram Поделиться Пожаловаться

Prev Next
Сегодня продолжу рассказывать про свои недавние статьи. Вот, например, порекламирую работу моего аспиранта Вадима Ломшакова и ещё одного моего аспиранта (правда, больше формального) Андрея Подивилова:

AgentLens: Production-Assessed Trajectory Reviews for Coding Agent Evaluation

Почти все бенчмарки для LLM-агентов сводят прогон к одному биту: решил задачу или нет. Для лидерборда это, может, и неизбежно, но человек, который работает с агентом целый день, видит всю траекторию: как агент следует инструкциям, как пользуется инструментами, проверяет ли за собой, как исправляет ошибки и что вообще пишет пользователю.

Агент может пройти формальную проверку, но быть невыносимым в "рабочей коммуникации"; а может в итоге так и не написать проходящую тесты программу, но по дороге сделать кучу полезного. А для задач вроде "напиши документацию" бинарного критерия успеха и вовсе не существует.

AgentLens — это попытка сделать систему, которая оценивает именно траектории. Каждый прогон получает формальную верификацию там, где она возможна (тесты, проверки состояния репозитория и т.д.), плюс отзывы LLM-судей по пяти измерениям: итоговый результат, следование инструкциям, разные ловушки (pitfalls), в которые можно попасться, качество работы с инструментами и просто насколько приятно человеку с агентом взаимодействовать.

Одна из главных идей в том, что LLM-судья не только ставит оценку, но и пишет связный текстовый отзыв со ссылками на конкретные места в траектории, так что любой балл хорошо мотивирован, и эту мотивацию можно реально прочитать. Пользователя в нашей статье, кстати, тоже симулирует LLM — с разными персонами, включая пользователя слегка токсичного.

В полученном лидерборде на первом месте Opus 4.7, но это довольно скучный результат. Самое интересное — что по отзывам часто видны важные подробности. Например, Kimi K2.6 оказался на последнем месте, и по цифрам это выглядит как "слабая модель"; но отзыв судьи по tool calls показывает, что почти все ошибки — это один и тот же баг парсинга аргументов на стороне OpenRouter, а когда аргументы доходили нормально, агент работал вполне прилично;

Ещё один любопытный результат — self-preference судей: если сравнивать GPT-5.5 и Sonnet 4.6 их же собственными судьями, каждый судья заметно чаще предпочитает свою модель. Это ожидаемо, но забавно, что половина этого эффекта — в той самой крайне субъективной метрике Pleasantness.) Впрочем, победителя в среднем это не меняет.

Весь код выложен в соответствующем репозитории, и есть даже отдельная страничка про AgentLens и пост от авторов из Explyt.

Спасибо Вадиму Ломшакову, Андрею Подивилову и другим соавторам! Надеюсь, ещё поработаем вместе.

#research #publications #ai

1k 0 20 5 19
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot