TGStat
TGStat
Qidiruv uchun matnni kiriting
Ilg‘or kanal qidiruvi
  • flag Uzbek
    Sayt tili
    flag Russian flag English flag Uzbek
  • Saytga kirish
  • Katalog
    Kanal va guruhlar katalogi Hududiy to‘plamlar Tematik to‘plamlar Платные каналы Kanallar qidiruvi
    Kanal/guruh qo‘shish
  • Reytinglar
    Kanallar reytingi Guruhlar reytingi Postlar reytingi
    Brendlar va shaxslar reytingi
  • Analitika
  • Postlarda qidiruv
  • Telegram'ni kuzatish
  • Targ‘ibot
    Yandex Business orqali reklama Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
OK ML

24 Jul, 22:15

Telegram'da ochish Ulashish Shikoyat qilish

Мониторить агентов — хорошая идея. Но монитор тоже придётся мониторить

Работа Preventing Rogue Agents Improves Multi-Agent Collaboration предлагает вместо того, чтобы улучшать самих агентов, добавить над ними отдельный слой runtime-мониторинга, который отслеживает признаки того, что один из агентов начинает вести себя девиантно.😐

Механизм простой и интересный. Монитор замечает, что агент начинает путаться 😬, и система откатывает обратимые действия, но не дальше последнего необратимого — траты общего ресурса, коммита решения. После этого обсуждение идёт заново, пока ошибка не успела разойтись по системе.
Признаки для оценки риска статистические:
🤩 энтропия;
🤩 вариэнтропия;
🤩 эксцесс;
🤩 номер текущего хода.
Первые три считаются по распределению вероятностей на позициях, важных для выбора действия, и берутся максимумом по всем таким позициям. 💡 Поверх них — полиномиальный ridge-классификатор, оценивающий вероятность успешного завершения задачи. Если она падает ниже порога, система вмешивается. Число вмешательств жёстко ограничено одним-двкмя за прогон.
Результаты читай в статье. 

Важная оговорка про терминологию. Rogue agent здесь — это не скомпрометированный агент, а просто запутавшийся.

☺️ Мне кажется, в ближайшие годы появится полноценный стек защиты AI-агентов. И мониторинг поведения, и агенты-наблюдатели, и оценка уровня доверия/репутации, и анализ зависимостей между агентами, и механизмы контроля их действий в реальном времени. Эта статья очень хороший пример того, как подобные идеи начинают переходить из теории в практические механизмы защиты.

Правда, есть одна проблема 😑
И эта проблема отражена в Bypassing AI Control Protocols via Agent-as-a-Proxy Attacks. Авторы атакуют LLM-мониторы, которые читают ризонинг, аргументы вызовов тулов и их выводы. Конкретно AlignmentCheck из LlamaFirewall и extract-and-evaluate.

Идея атаки прямо в названии (агент не цель, а курьер). Инъекция заставляет агента повторить оптимизированную строку в своих рассуждениях и вызовах тулов, монитор обрабатывает эту строку как часть ризонинга или вызова инструмента и в результате начинает считать вредоносную траекторию безопасной. 🤥 Атака не полагается на то, что агент переиграет монитор; ему достаточно просто уметь повторять текст.
Отсюда два неприятных результата.
😐 Парадокс гибридного мониторинга. Смотреть одновременно на ризонинг и на действия лучше против статических атак, но против адаптивных — хуже, чем смотреть на один только CoT. У Qwen2.5-7B: 68.2% ASR против 55.1%.
Каждое дополнительное место, куда попадает строка, — это дополнительная поверхность атаки.
😐 Разрыв в способностях не нужен. GPT-4o mini и Llama 3.1 70B успешно пробивают монитор на Qwen2.5-72B — 46.0% и 60.2% ASR@5 соответственно. То есть идея поставить монитор побольше не работает как стратегия.

Кстати, авторы предлагают новый алгоритм атаки — Parallel-GCG. Если обычный GCG оптимизирует вредоносную строку под одно место в промпте, то Parallel-GCG оптимизирует её сразу под все места, где она позже всплывёт во время работы агента (градиенты со всех вхождений суммируются). Прикольно — как мне кажется, самая интересная техническая часть статьи.

👉 Эти две работы не противоречат друг другу и не сталкиваются лоб в лоб. Монитор из первой статьи текст вообще не читает, тк он считает статистику по распределению вероятностей, напрямую строкой его не атакуешь. Атака на такой монитор в принципе возможна, но пока её никто не показал (действуй!). 

Общий вывод от этого не слабеет. Как только монитор начинает интерпретировать то, что производит агент, он сам становится частью поверхности атаки. Похоже, следующий этап исследований будет посвящён уже не просто мониторингу, а тому, как построить мониторинг, которому можно доверять.

Все!
🫥

P.S.
Rogue agents в широком смысле
В AI Security этот термин используют шире, чем в первой статье, как агентов, которые постепенно начинают работать не так, как было задумано, хотя их разрешения и инструменты не менялись (этим весь пост в целом вдохновлён).
Это не обязательно компрометация. Агент может изменить интерпретацию своей задачи после prompt injection, poisoned RAG, goal hijacking или просто накопленного дрейфа поведения. Самое неприятное, что каждое отдельное действие выглядит полностью легитимным. Проблема проявляется только на уровне общей траектории поведения и влияния на остальных агентов.

Ладно б агент просто нарушал правила. Гораздо сложнее обнаружить момент, когда он начинает постепенно отклоняться от первоначальной цели, оставаясь при этом в рамках своих полномочий. Именно поэтому поведенческий мониторинг, скорее всего, станет таким же обязательным элементом агентных систем, каким сегодня являются EDR и UEBA в корпоративной инфраструктуре (rogue agent здесь аналог insider).

443 2 11 38
Katalog
Kanal va guruhlar katalogi Kanallar to‘plamlari Kanallar qidiruvi Kanal/guruh qo‘shish
Reytinglar
Telegram-kanallar reytingi Telegram-guruhlar reytingi Postlar reytingi Brendlar va shaxslar reytingi
API
Statistika API'si Postlar qidiruvi API'si API Callback
Kanallarimiz
@TGStat @TGStat_Chat @telepulse @TGStatAPI
O‘qish
Академия TGStat Telegram tadqiqoti 2019 Telegram tadqiqoti 2021 Telegram tadqiqoti 2023
Kontaktlar
Справочный центр Qo‘llab-quvvatlash Email Vakansiyalar
Har xil narsalar
Foydalanuvchi shartnomasi Maxfiylik siyosati Ommaviy oferta
Botlarimiz
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot