🤖 AI-агент с нуля: Evaluation & Observability
До сих пор мы строили систему: инструменты, MCP, память, Guardrails, несколько агентов. Однако это ещё не ответ на вопрос, насколько система надёжна. Один удачный прогон показывает возможность, но не вероятность. Один и тот же запрос проходит через Retrieval, несколько model calls, Tool вызовов, Guardrails — и два запуска одной задачи могут закончиться по-разному.
⚡️ Это шестая часть видеокурса об AI-агентах от ML-инженера Artezio Антона Максимова!
Разберём Evaluation & Observability: как перейти от «работает в демо» к системе, качество которой можно воспроизводимо измерять и объяснять.
В этом выпуске:
— Почему классический тест input → expected output не работает для агентов
— Eval как pipeline: Task Suite → Infrastructure → Criteria → Grading
— Как выглядит валидный Task
— pass@k и pass^k: capability и reliability
— Graders: когда нужен code, когда LLM-as-a-Judge, когда человек
— Observability: Session, Trace, Span
— Production closes the loop: как превратить реальный failure в воспроизводимый Regression Task
🎬 Смотрите на YouTube или RuTube!
До сих пор мы строили систему: инструменты, MCP, память, Guardrails, несколько агентов. Однако это ещё не ответ на вопрос, насколько система надёжна. Один удачный прогон показывает возможность, но не вероятность. Один и тот же запрос проходит через Retrieval, несколько model calls, Tool вызовов, Guardrails — и два запуска одной задачи могут закончиться по-разному.
⚡️ Это шестая часть видеокурса об AI-агентах от ML-инженера Artezio Антона Максимова!
Разберём Evaluation & Observability: как перейти от «работает в демо» к системе, качество которой можно воспроизводимо измерять и объяснять.
В этом выпуске:
— Почему классический тест input → expected output не работает для агентов
— Eval как pipeline: Task Suite → Infrastructure → Criteria → Grading
— Как выглядит валидный Task
— pass@k и pass^k: capability и reliability
— Graders: когда нужен code, когда LLM-as-a-Judge, когда человек
— Observability: Session, Trace, Span
— Production closes the loop: как превратить реальный failure в воспроизводимый Regression Task
🎬 Смотрите на YouTube или RuTube!