Новая профессия ИИ – аудитор?
Многие уже внедрили RAG-поиск: сотрудники находят корпоративную информацию за секунды, а голосовые помощники консультируют по актуальным регламентам компании.
Но вопрос – можно ли полностью доверять ответам, которые выдает RAG-система?Чтобы на него ответить, RAG-модель тестируют – и это один из самых трудоемких этапов разработки.
Поэтому сегодня ИИ зачастую проверяет... другой ИИ. Системе устраивают экзамен, где для каждого документа ИИ-аудитор генерирует вопросы с вариантами ответов, один из которых правильный. Здесь все просто: оценка RAG = доля правильно отвеченных вопросов.
А чтобы понять, почему система работает хорошо или плохо,
разработали модель, которая позволяет оценить влияние каждого компонента на качество ответов:
🔘ИИ-модель
🔘механизм поиска и извлечения информации (retrieval)
🔘контекстное обучение – например, количество примеров в промпте
Так можно определить,
за счет чего именно улучшается качество RAG: более сильной модели, более точному поиску информации или более удачному промпту.
Microsoft при оценке RAG-моделей
рекомендует смотреть на такие критерии: насколько ответ подтверждается источниками, релевантен ли он вопросу, полностью ли отвечает на все его части, и корректен ли с точки зрения фактов.
По такому принципу и работают современные ИИ-аудиторы. Например,
в нашем инструменте для обучения моделей они автоматически оценивают:
✅ насколько ответ соответствует эталону
✅ насколько ответ корректен, даже если эталонного ответа нет
✅ действительно ли модель использовала релевантные фрагменты базы знаний
✅ не придумала ли она факты и не противоречит ли документам
При этом оценивать качество можно по-разному:
➡️ A/B-сравнение – когда два ответа разных моделей сравниваются между собой, и ИИ выбирает лучший
➡️ Категории – например, «полезный / частично полезный / неполезный ответ».
➡️ Рубрики – например, оценка по шкале от 0 до 1.
Так, для большинства продуктов обоснованность ответа документами должна быть около 0,8, а в финансовой, медицинской и других чувствительных сферах требования обычно – не менее 0,9.Такие ИИ-аудиторы становятся обязательным элементом обучения моделей – ведь важнее не получить ответ за секунду, а быть уверенным в его достоверности👍
Мы теперь и в MAX