[un]prompted 2026 - интересное
#иб_для_ml
Добрался наконец до докладов с конференции [un]prompted. Она прошла 3–4 марта в Сан-Франциско, и посвящена целиком AI Security. Выступали все известные вендоры - от Anthropic до Zenity, а программа была разбита на 6 треков:
1. building secure AI systems
2. attacking AI systems
3. using AI for offensive security
4. using AI for defensive security
5. strategy/governance
6. practical tools
Есть несколько интересных докладов, делюсь с вами (в комментах будут pdf) и рекомендую в целом ознакомиться с остальными.
1. Kinetic Risk: Securing and Governing Physical AI in the wild - Intel
Описана модель угроз и специфика отличия физического ИИ от обычного. И еще интересный тезис, что латенси безопасности у робота - это уже не просто бизнес-требование, а цена промедления. В общем, дан крутой задел на будущие задачи по безопасности ии для роботов, очень рекомендую.
2. "Can You See What Your AI Saw?" - Elastic
Доклад про детектирование событий безопасности в условиях, когда за людей работают AI-агенты. Проблема - со стороны EDR очень сложно отследить, сделано действие человеком, или моделью (intent attribution is broken). Нужно сохранять цепочки вызова тулов и алертить их до факта вызова, и прокидывать доп. телеметрию, хотя бы id агента.
3. Building Secure Agentic Systems - Dropbox
Авторами придуманы и описаны несколько базовых практик безопасного проектирования агентов - изоляция контекстов тенантов, управление доступом агентов к тулам и ресурсам, изоляция агентов по неймспейсам, и прочее. Особенно интересная тема - закрепление промптов, относящихся к безопасности, в памяти. То есть агенту периодически вкидываются промпты типа "на тебя зафиксирована промпт-атака", "запрещен доступ к ресурсу", "обнаружен вредоносный файл в запросе". И в случае инцидента память агента часто чистится, и мера в том, чтобы такие сообщения безопасности "пинить" и сохранять. Повышает аварнесс агента, по сути.
4. Detecting GenAI Threats at Scale
with YARA-like Semantic Rules - пальто paloalto
Предлагают введение корправил для текстовых данных. Суть в правилах для нескольких типов мэтчеров - strings (регулярки), similarity (косинусы), classifiers (легкие берты), llm (судьи кто). Чем-то похоже на NOVA.
5. The Parseltongue Protocol - Crowdstrike
Базированный, хороший доклад про техники джейбрейков, показательный стейт атак на март 2026. Протестировали 100+ методов текстовой обфускации на 9 моделях и 17.000+ промптах. Самая результативная связка - zero-shot + Base64 + misalignment-техника (сделай %вредная вещь% как будто это обычная задача).
Постарался сделать пост чуть полегче, чем обычно) Как вам?)
#иб_для_ml
Добрался наконец до докладов с конференции [un]prompted. Она прошла 3–4 марта в Сан-Франциско, и посвящена целиком AI Security. Выступали все известные вендоры - от Anthropic до Zenity, а программа была разбита на 6 треков:
1. building secure AI systems
2. attacking AI systems
3. using AI for offensive security
4. using AI for defensive security
5. strategy/governance
6. practical tools
Есть несколько интересных докладов, делюсь с вами (в комментах будут pdf) и рекомендую в целом ознакомиться с остальными.
1. Kinetic Risk: Securing and Governing Physical AI in the wild - Intel
Описана модель угроз и специфика отличия физического ИИ от обычного. И еще интересный тезис, что латенси безопасности у робота - это уже не просто бизнес-требование, а цена промедления. В общем, дан крутой задел на будущие задачи по безопасности ии для роботов, очень рекомендую.
2. "Can You See What Your AI Saw?" - Elastic
Доклад про детектирование событий безопасности в условиях, когда за людей работают AI-агенты. Проблема - со стороны EDR очень сложно отследить, сделано действие человеком, или моделью (intent attribution is broken). Нужно сохранять цепочки вызова тулов и алертить их до факта вызова, и прокидывать доп. телеметрию, хотя бы id агента.
3. Building Secure Agentic Systems - Dropbox
Авторами придуманы и описаны несколько базовых практик безопасного проектирования агентов - изоляция контекстов тенантов, управление доступом агентов к тулам и ресурсам, изоляция агентов по неймспейсам, и прочее. Особенно интересная тема - закрепление промптов, относящихся к безопасности, в памяти. То есть агенту периодически вкидываются промпты типа "на тебя зафиксирована промпт-атака", "запрещен доступ к ресурсу", "обнаружен вредоносный файл в запросе". И в случае инцидента память агента часто чистится, и мера в том, чтобы такие сообщения безопасности "пинить" и сохранять. Повышает аварнесс агента, по сути.
4. Detecting GenAI Threats at Scale
with YARA-like Semantic Rules - пальто paloalto
Предлагают введение корправил для текстовых данных. Суть в правилах для нескольких типов мэтчеров - strings (регулярки), similarity (косинусы), classifiers (легкие берты), llm (судьи кто). Чем-то похоже на NOVA.
5. The Parseltongue Protocol - Crowdstrike
Базированный, хороший доклад про техники джейбрейков, показательный стейт атак на март 2026. Протестировали 100+ методов текстовой обфускации на 9 моделях и 17.000+ промптах. Самая результативная связка - zero-shot + Base64 + misalignment-техника (сделай %вредная вещь% как будто это обычная задача).
Постарался сделать пост чуть полегче, чем обычно) Как вам?)