TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
OK ML

24 Jul, 22:15

Открыть в Telegram Поделиться Пожаловаться

Мониторить агентов — хорошая идея. Но монитор тоже придётся мониторить

Работа Preventing Rogue Agents Improves Multi-Agent Collaboration предлагает вместо того, чтобы улучшать самих агентов, добавить над ними отдельный слой runtime-мониторинга, который отслеживает признаки того, что один из агентов начинает вести себя девиантно.😐

Механизм простой и интересный. Монитор замечает, что агент начинает путаться 😬, и система откатывает обратимые действия, но не дальше последнего необратимого — траты общего ресурса, коммита решения. После этого обсуждение идёт заново, пока ошибка не успела разойтись по системе.
Признаки для оценки риска статистические:
🤩 энтропия;
🤩 вариэнтропия;
🤩 эксцесс;
🤩 номер текущего хода.
Первые три считаются по распределению вероятностей на позициях, важных для выбора действия, и берутся максимумом по всем таким позициям. 💡 Поверх них — полиномиальный ridge-классификатор, оценивающий вероятность успешного завершения задачи. Если она падает ниже порога, система вмешивается. Число вмешательств жёстко ограничено одним-двкмя за прогон.
Результаты читай в статье. 

Важная оговорка про терминологию. Rogue agent здесь — это не скомпрометированный агент, а просто запутавшийся.

☺️ Мне кажется, в ближайшие годы появится полноценный стек защиты AI-агентов. И мониторинг поведения, и агенты-наблюдатели, и оценка уровня доверия/репутации, и анализ зависимостей между агентами, и механизмы контроля их действий в реальном времени. Эта статья очень хороший пример того, как подобные идеи начинают переходить из теории в практические механизмы защиты.

Правда, есть одна проблема 😑
И эта проблема отражена в Bypassing AI Control Protocols via Agent-as-a-Proxy Attacks. Авторы атакуют LLM-мониторы, которые читают ризонинг, аргументы вызовов тулов и их выводы. Конкретно AlignmentCheck из LlamaFirewall и extract-and-evaluate.

Идея атаки прямо в названии (агент не цель, а курьер). Инъекция заставляет агента повторить оптимизированную строку в своих рассуждениях и вызовах тулов, монитор обрабатывает эту строку как часть ризонинга или вызова инструмента и в результате начинает считать вредоносную траекторию безопасной. 🤥 Атака не полагается на то, что агент переиграет монитор; ему достаточно просто уметь повторять текст.
Отсюда два неприятных результата.
😐 Парадокс гибридного мониторинга. Смотреть одновременно на ризонинг и на действия лучше против статических атак, но против адаптивных — хуже, чем смотреть на один только CoT. У Qwen2.5-7B: 68.2% ASR против 55.1%.
Каждое дополнительное место, куда попадает строка, — это дополнительная поверхность атаки.
😐 Разрыв в способностях не нужен. GPT-4o mini и Llama 3.1 70B успешно пробивают монитор на Qwen2.5-72B — 46.0% и 60.2% ASR@5 соответственно. То есть идея поставить монитор побольше не работает как стратегия.

Кстати, авторы предлагают новый алгоритм атаки — Parallel-GCG. Если обычный GCG оптимизирует вредоносную строку под одно место в промпте, то Parallel-GCG оптимизирует её сразу под все места, где она позже всплывёт во время работы агента (градиенты со всех вхождений суммируются). Прикольно — как мне кажется, самая интересная техническая часть статьи.

👉 Эти две работы не противоречат друг другу и не сталкиваются лоб в лоб. Монитор из первой статьи текст вообще не читает, тк он считает статистику по распределению вероятностей, напрямую строкой его не атакуешь. Атака на такой монитор в принципе возможна, но пока её никто не показал (действуй!). 

Общий вывод от этого не слабеет. Как только монитор начинает интерпретировать то, что производит агент, он сам становится частью поверхности атаки. Похоже, следующий этап исследований будет посвящён уже не просто мониторингу, а тому, как построить мониторинг, которому можно доверять.

Все!
🫥

P.S.
Rogue agents в широком смысле
В AI Security этот термин используют шире, чем в первой статье, как агентов, которые постепенно начинают работать не так, как было задумано, хотя их разрешения и инструменты не менялись (этим весь пост в целом вдохновлён).
Это не обязательно компрометация. Агент может изменить интерпретацию своей задачи после prompt injection, poisoned RAG, goal hijacking или просто накопленного дрейфа поведения. Самое неприятное, что каждое отдельное действие выглядит полностью легитимным. Проблема проявляется только на уровне общей траектории поведения и влияния на остальных агентов.

Ладно б агент просто нарушал правила. Гораздо сложнее обнаружить момент, когда он начинает постепенно отклоняться от первоначальной цели, оставаясь при этом в рамках своих полномочий. Именно поэтому поведенческий мониторинг, скорее всего, станет таким же обязательным элементом агентных систем, каким сегодня являются EDR и UEBA в корпоративной инфраструктуре (rogue agent здесь аналог insider).

443 2 11 38
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot