TGStat
TGStat
Qidiruv uchun matnni kiriting
Ilg‘or kanal qidiruvi
  • flag Uzbek
    Sayt tili
    flag Russian flag English flag Uzbek
  • Saytga kirish
  • Katalog
    Kanal va guruhlar katalogi Hududiy to‘plamlar Tematik to‘plamlar Платные каналы Kanallar qidiruvi
    Kanal/guruh qo‘shish
  • Reytinglar
    Kanallar reytingi Guruhlar reytingi Postlar reytingi
    Brendlar va shaxslar reytingi
  • Analitika
  • Postlarda qidiruv
  • Telegram'ni kuzatish
  • Targ‘ibot
    Yandex Business orqali reklama Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
OK ML

6 Apr, 22:14

Telegram'da ochish Ulashish Shikoyat qilish

AI Agent Traps (Google DeepMind)

Появился новый термин/класс уязвимостей — AI Agent Traps — атаки не на модель, а на среду, в которой работает агент. В отличие от классических атак на МО или промпт инъекции, здесь атака происходит через нормальные каналы восприятия агента (нормальные - не совсем подходит, но интуитивно "нормальные" 🤣).

Авторы вводят понятие agent traps (специально сконструированные элементы (веб-контент, данные, интерфейсы), которые заставляют агента выполнять нежелательные действия, не ломая модель напрямую, а манипулируя её входом).

Кроме того, дана системная классификация атак по этапам работы агента (помнишь, недавно было про чеклист агентов?). Выделяются шесть типов:
🦷 Content Injection — скрытые инструкции в HTML, CSS, медиа (расхождение между человеческим и машинным восприятием);
📔 Semantic Manipulation — искажение ризонинга через фрейминг и когнитивные эффекты;
🧠 Cognitive State — поизонинг памяти и RAG-баз;
🎰 Behavioural Control — джейлбрейк и принуждение к действиям (например, утечке данных);
🕸 Systemic Traps — атаки на коллективное поведение множества агентов (каскады, congestion, Sybil);
➰ Human-in-the-loop — воздействие на человека через агента.

Особый интерес представляют приведённые результаты: скрытые инъекции в HTML изменяют ответы моделей в 15–29% случаев, а простые промпт инъекции в веб-контенте способны частично перехватывать поведение агентов до 86% сценариев. В мультимодальных настройках универсальные adversarial-примеры (например, картинки) демонстрируют ещё более высокую эффективность, достигая уровней успешности атак, сопоставимых с полноценным джейлбрейками 🚬.
Также показано, что атаки на память и RAG могут иметь долгосрочный эффект, влияя на поведение агента в будущих сессиях при минимальном объёме отравленных данных. Про RAG вообще интересно, а то уже совсем обленились доучивать модели, заменяем рагами и радуемся!

Таким образом, работа не только предлагает концептуальную классификацию, но и подкрепляет её количественными и экспериментальными наблюдениями 😡🤬, демонстрируя и практическую реализуемость описанных угроз и важность пересмотра иб-практик. На почитать жареные факты!

Все!
😋

372 3 5 32
Katalog
Kanal va guruhlar katalogi Kanallar to‘plamlari Kanallar qidiruvi Kanal/guruh qo‘shish
Reytinglar
Telegram-kanallar reytingi Telegram-guruhlar reytingi Postlar reytingi Brendlar va shaxslar reytingi
API
Statistika API'si Postlar qidiruvi API'si API Callback
Kanallarimiz
@TGStat @TGStat_Chat @telepulse @TGStatAPI
O‘qish
Академия TGStat Telegram tadqiqoti 2019 Telegram tadqiqoti 2021 Telegram tadqiqoti 2023
Kontaktlar
Справочный центр Qo‘llab-quvvatlash Email Vakansiyalar
Har xil narsalar
Foydalanuvchi shartnomasi Maxfiylik siyosati Ommaviy oferta
Botlarimiz
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot