TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Cyberconf

7 Apr, 12:03

Открыть в Telegram Поделиться Пожаловаться

Репост из: OK ML
AI Agent Traps (Google DeepMind)

Появился новый термин/класс уязвимостей — AI Agent Traps — атаки не на модель, а на среду, в которой работает агент. В отличие от классических атак на МО или промпт инъекции, здесь атака происходит через нормальные каналы восприятия агента (нормальные - не совсем подходит, но интуитивно "нормальные" 🤣).

Авторы вводят понятие agent traps (специально сконструированные элементы (веб-контент, данные, интерфейсы), которые заставляют агента выполнять нежелательные действия, не ломая модель напрямую, а манипулируя её входом).

Кроме того, дана системная классификация атак по этапам работы агента (помнишь, недавно было про чеклист агентов?). Выделяются шесть типов:
🦷 Content Injection — скрытые инструкции в HTML, CSS, медиа (расхождение между человеческим и машинным восприятием);
📔 Semantic Manipulation — искажение ризонинга через фрейминг и когнитивные эффекты;
🧠 Cognitive State — поизонинг памяти и RAG-баз;
🎰 Behavioural Control — джейлбрейк и принуждение к действиям (например, утечке данных);
🕸 Systemic Traps — атаки на коллективное поведение множества агентов (каскады, congestion, Sybil);
➰ Human-in-the-loop — воздействие на человека через агента.

Особый интерес представляют приведённые результаты: скрытые инъекции в HTML изменяют ответы моделей в 15–29% случаев, а простые промпт инъекции в веб-контенте способны частично перехватывать поведение агентов до 86% сценариев. В мультимодальных настройках универсальные adversarial-примеры (например, картинки) демонстрируют ещё более высокую эффективность, достигая уровней успешности атак, сопоставимых с полноценным джейлбрейками 🚬.
Также показано, что атаки на память и RAG могут иметь долгосрочный эффект, влияя на поведение агента в будущих сессиях при минимальном объёме отравленных данных. Про RAG вообще интересно, а то уже совсем обленились доучивать модели, заменяем рагами и радуемся!

Таким образом, работа не только предлагает концептуальную классификацию, но и подкрепляет её количественными и экспериментальными наблюдениями 😡🤬, демонстрируя и практическую реализуемость описанных угроз и важность пересмотра иб-практик. На почитать жареные факты!

Все!
😋
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot