TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Аналитик данных

19 Aug, 15:44

Открыть в Telegram Поделиться Пожаловаться

Как нормально тестировать AI-агента, если правильный ответ ещё ничего не доказывает

У обычного чат-бота можно проверить финальный ответ. С агентами этого уже мало: модель может выдать вполне убедительный текст, но перед этим выбрать не тот skill, вызвать неправильный tool, потерять контекст на втором сообщении или выполнить только половину задачи.

Ed Crewe описал, как они строили eval-фреймворк для агентного чат-бота вокруг Postgres AI Hybrid Manager.

Начали с простого routing eval: для каждого запроса проверяется, выбрал ли агент нужный skill или tool. Это быстро, детерминированно и удобно гонять в CI.

Следующий слой — Task Completion Rate. Здесь уже оценивается сам результат: выполнил ли агент задачу, использовал ли нужные данные, предложил ли адекватный следующий шаг. Для таких проверок используется LLM-as-a-judge и заранее заданная rubric.

Но и этого оказалось мало. Реальные задачи часто состоят из нескольких сообщений, поэтому тестировать приходится уже целые диалоги с сохранением conversation state и отдельными проверками каждого шага.

Финальный уровень — trajectory testing: смотреть не только на ответ, а на весь путь агента к нему: маршрутизацию, выбор skills, tool calls, промежуточные действия, состояние диалога и итоговый результат.

Получается уже почти классическое E2E-тестирование, только объект проверки здесь не HTTP-запрос или UI, а поведение AI-агента целиком.

В основе автор использует deepeval, поверх которого добавлены YAML goldens, CI, плагины, multi-turn evals и телеметрия через Langfuse.

https://edcrewe.blogspot.com/2026/08/from-routing-checks-to-trajectory.html

300 0 6 4
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot