TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Data Blog

30 Jul, 18:38

Открыть в Telegram Поделиться Пожаловаться

XAI для агентов: библиотеки

Консерватор с тревожкой, когда кто-то что-то делает за него (я), наконец докопался до XAI для агентов.

Что у нас есть:

С агентами, вместо модели, нас интересует действие и их последовательность. Отсюда мы ставим вопрос: «почему был выбран этот путь/тула/шаг?». На текущем этапе развития интерпретируемости мы бы умерли, если бы тащили для ответа Mech-Interp, потому что у нас появляется гамбургер:

Агенты что-то делають.
[агенты-тусят]
Агент что-то сделаль.
[шаги-действий]
Модель, задающая мозг агента.
[о-веса-если-они-открыты]

Поэтому агентский XAI работает как привыкли в классике и использует в основном SHAP (SHapley Additive exPlanations).

Что это:

SHAP — супер-фундаментальный-в-XAI — метод из кооперативной теории игр. Идея на аналогиях — решить задачу справедливого разделения выигрыша между игроками. На выходе всегда вклад каждого игрока, хитро взвешенный на его участие. Классический SHAP всегда требует 2ⁿ прогонов, где n — число игроков. Можно протыкать по нему урок в free курсе (на русском).


В игровом подходе нас интересует то, что игроками могут быть разные штуки: сами агенты (когда их много — мультиагентная система), то, что они юзают, если мучаем одного агента (его инструменты) и то, что агент подтянул в контекст (документы в RAG).

В такой парадигме сейчас есть две либы:

— AgentSHAP — Shapley-атрибуция важности инструментов агента через метод Монте-Карло (ММК). ММК оптимизирует 2ⁿ необходимость. Концептуально AgentSHAP дёргает только вход-выход и строит на этом распределение Shap. Проверок пока немного (по сути только в самой статье), и по людям кажется, ещё не разошлось. Плюс — без PyPI, надо клонировать локально (я уже; наиграюсь — сделаю туториал).

— LLMX — возможно, статья на rebuttal =). Тоже «Shapley-атрибуция для RAG на минималках»: ShapleyAttributor считает вклад каждого извлечённого документа/куска контекста в вероятность конкретного ответа — прямой ответ на «что из контекста реально сработало» в RAG и мультиагентных пайплайнах.

Чем отличается от AgentSHAP:
Другие игроки: там инструменты агента, тут куски контекста. Второе — что считаем «выигрышем»: AgentSHAP смотрит на падение качества ответа (семантическая близость), а LLMX — на вероятность (log-prob), которую модель даёт нужному ответу. Плюс аппроксимация не только ММК, а целых пять. В том числе две основанные на суррогатах — линейных модельках.

Суррогат мне показался тоже прикольным на подсвет:
Вместо перебора коалиций гонят LLM на ~X случайных «масках» (какие куски контекста включены/выключены) и записывают, какая вероятность ответа вышла. На этих X примерах учат лёгкую линейную модельку «маска → результат», и её веса по каждому куску — это и есть атрибуция. В классическом XAI так работает LIME.


Что есть ещё:

Это без SHAP, но и не про интерпретируемость (интерпретируемость предполагает всегда оценку вклада сколь угодно уточненную от эмпирики каким-то методом, а все, что ниже — отслеживание эмпирического почему).

— Docent — не вижу ничего лучше, чем назвать как "анализатор логов". Шага два:
DQL — фильтр-поиск по логам, типа «покажи все, где агент лез к файлам».
Reading-шаг — а на каждый вытащенный ран натравливается LLM, читает его и ставит метку / оценку / короткий пересказ (один ран = один запрос к модели).
Это всё Python-скрипты с кэшем. Я это делаю руками))

— Petri — pipeline-версия для богатых — агент-аудитор, изучающий поведение целевой модели. Схема из трёх ролей: auditor ведёт многоходовый диалог (до 30 шагов, с симуляцией инструментов и откатами), target отвечает, judge размечает транскрипт. Target — целевая модель, Judge — ещё одна LLM. Работает, красиво, но дорого и долго.

— AgentBoard — аналитическая eval-доска для multi-turn агентов: fine-grained progress rate, разбивка по сабскиллам и визуализация траекторий — видно, на каком шаге и почему агент сыпется, но без чиселки важности.
GitHub - GenAISHAP/TokenSHAP: A framework for interpreting modern AI systems using Monte Carlo Shapley value estimation. Model-agnostic explainability across language models, vision-language models, video understanding, and autonomous agents.
A framework for interpreting modern AI systems using Monte Carlo Shapley value estimation. Model-agnostic explainability across language models, vision-language models, video understanding, and aut...

1.3k 0 16 15
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot