Репост из: OK ML
AI Agent Traps (Google DeepMind)
Появился новый термин/класс уязвимостей — AI Agent Traps — атаки не на модель, а на среду, в которой работает агент. В отличие от классических атак на МО или промпт инъекции, здесь атака происходит через нормальные каналы восприятия агента (нормальные - не совсем подходит, но интуитивно "нормальные" 🤣).
Авторы вводят понятие agent traps (специально сконструированные элементы (веб-контент, данные, интерфейсы), которые заставляют агента выполнять нежелательные действия, не ломая модель напрямую, а манипулируя её входом).
Кроме того, дана системная классификация атак по этапам работы агента (помнишь, недавно было про чеклист агентов?). Выделяются шесть типов:
🦷 Content Injection — скрытые инструкции в HTML, CSS, медиа (расхождение между человеческим и машинным восприятием);
📔 Semantic Manipulation — искажение ризонинга через фрейминг и когнитивные эффекты;
🧠 Cognitive State — поизонинг памяти и RAG-баз;
🎰 Behavioural Control — джейлбрейк и принуждение к действиям (например, утечке данных);
🕸 Systemic Traps — атаки на коллективное поведение множества агентов (каскады, congestion, Sybil);
➰ Human-in-the-loop — воздействие на человека через агента.
Особый интерес представляют приведённые результаты: скрытые инъекции в HTML изменяют ответы моделей в 15–29% случаев, а простые промпт инъекции в веб-контенте способны частично перехватывать поведение агентов до 86% сценариев. В мультимодальных настройках универсальные adversarial-примеры (например, картинки) демонстрируют ещё более высокую эффективность, достигая уровней успешности атак, сопоставимых с полноценным джейлбрейками 🚬.
Также показано, что атаки на память и RAG могут иметь долгосрочный эффект, влияя на поведение агента в будущих сессиях при минимальном объёме отравленных данных. Про RAG вообще интересно, а то уже совсем обленились доучивать модели, заменяем рагами и радуемся!
Таким образом, работа не только предлагает концептуальную классификацию, но и подкрепляет её количественными и экспериментальными наблюдениями 😡🤬, демонстрируя и практическую реализуемость описанных угроз и важность пересмотра иб-практик. На почитать жареные факты!
Все!
😋
Появился новый термин/класс уязвимостей — AI Agent Traps — атаки не на модель, а на среду, в которой работает агент. В отличие от классических атак на МО или промпт инъекции, здесь атака происходит через нормальные каналы восприятия агента (нормальные - не совсем подходит, но интуитивно "нормальные" 🤣).
Авторы вводят понятие agent traps (специально сконструированные элементы (веб-контент, данные, интерфейсы), которые заставляют агента выполнять нежелательные действия, не ломая модель напрямую, а манипулируя её входом).
Кроме того, дана системная классификация атак по этапам работы агента (помнишь, недавно было про чеклист агентов?). Выделяются шесть типов:
🦷 Content Injection — скрытые инструкции в HTML, CSS, медиа (расхождение между человеческим и машинным восприятием);
📔 Semantic Manipulation — искажение ризонинга через фрейминг и когнитивные эффекты;
🧠 Cognitive State — поизонинг памяти и RAG-баз;
🎰 Behavioural Control — джейлбрейк и принуждение к действиям (например, утечке данных);
🕸 Systemic Traps — атаки на коллективное поведение множества агентов (каскады, congestion, Sybil);
➰ Human-in-the-loop — воздействие на человека через агента.
Особый интерес представляют приведённые результаты: скрытые инъекции в HTML изменяют ответы моделей в 15–29% случаев, а простые промпт инъекции в веб-контенте способны частично перехватывать поведение агентов до 86% сценариев. В мультимодальных настройках универсальные adversarial-примеры (например, картинки) демонстрируют ещё более высокую эффективность, достигая уровней успешности атак, сопоставимых с полноценным джейлбрейками 🚬.
Также показано, что атаки на память и RAG могут иметь долгосрочный эффект, влияя на поведение агента в будущих сессиях при минимальном объёме отравленных данных. Про RAG вообще интересно, а то уже совсем обленились доучивать модели, заменяем рагами и радуемся!
Таким образом, работа не только предлагает концептуальную классификацию, но и подкрепляет её количественными и экспериментальными наблюдениями 😡🤬, демонстрируя и практическую реализуемость описанных угроз и важность пересмотра иб-практик. На почитать жареные факты!
Все!
😋