Новая библиотека
SIRIN для оценки и мониторинга contextual
hallucinations в RAG и memory-based LLM системах (статья
arxiv +
github )
Идейно внутри три инструмента:
- probing по hidden states - легкий классификатор по hidden states генератора но нужно немного разметки
- LLM-as-a-judge. Есть response-level и span-level варианты, где модель пытается локализовать конкретные галлюцинированные фрагменты.
- uncertainty (entropy, perplexity, semantic uncertainty) - разные технические метрики как baseline, но обычно хуже чем LLM-as-a-judge
И два гейта:
1) до ответа: хватает ли контекста (Answerability gate)
2) после ответа: не наврал ли относительно контекста (Faithfulness gate)
- С учетом всего этого можно считать разные метрики качества. Еще у ребят неплохо получилось улучшить метрики на на memory-агенте повесив два гейта, и при непрохождения заставляя еще раз идти думать (метрики точности с 62.4% до 79.3%)
- Кастомный judge под задачу часто нужен все равно, но решение хороший baseline