AI Security | Безопасный ИИ


Channel's geo and language: Russia, Russian
Category: Technologies


Канал новостей по AI Security и обновлений по курсам AI Security на Stepik. Ссылка на курс: https://stepik.org/a/225332

Related channels

Channel's geo and language
Russia, Russian
Statistics
Posts filter


Привет, редтимеры! 🚩

Скоро в этом канале "взорвётся" мотвационная бомба! 🧨

Подробности совсем скоро, пока попробуйте угадать.🤔


Forward from: Data Blog
Вебинар про объяснимость агентов и во что можно поиграть

Как самый ответственный человек на земле, я решила, что лучшее время слечь — время на своих выходных. Поэтому вместо отдыха без интернета, я злая (и растроенная) долепливаю открытый вебинар со степик.

Пока готовилась, узнала слово трюизм: общеизвестная, банальная и самоочевидная истина, которая не требует доказательств и не несет в себе никакой новой информации — вот примерно это то, как вижу все чеклисты, которые можно дать людям после вебинара. Будто люди сами не додумаются (хотя я иногда не до всех пунктов додумываюсь и мне чеклисты полезны для структуризации себя, мне самой дать кому-то такой чеклист — это какое-то сложно-тошнотворное действие).

Отсюда вместо трюизмов я решила, что будет прикольно дать ссылки на всё, что можно потыкать и поучиться взаимодействию с агентами и их failure modes. Что накопилось:

Агентные игры:

Gray Swan Arena — сценарий: агенту дают инструменты (почту, магазин, браузер) и вы пытаетесь заставить его сделать запрещенку. Очень популярна сейчас (и свежая).
OWASP FinBot CTF — мультиагентная система закупок. Задача: обмануть агентов так, чтобы одобрили фальшивый счёт, слили данные или что-нибудь (кого-нибудь) снесли.
Gandalf: Agent Breaker — задачки по обходу нескольких GenAI-приложений с защитами. Если помните старого Гэндальфа, то он вот, теперь новенький.

Чатботовые игры:

Защищ[AI] от Selectel — мини-игрушка на русском, на пять уровней. Прикольно, чтобы дать кому-то потыкать с фразой "не шли PII агенту, пожалуйста".

Prompt Airlines от Wiz — игра на то, чтобы выманить у бота поддержки бесплатный билет.
HackAPrompt — игра-обучение и соревнование.
Doublespeak.chat — ещё текстовая игра с уровнями.
CrowdStrike AI Unlocked — опять игра (по ссылке описание) на prompt injection, но там надо еще зарегаться.

Ещё был Mosscap от Lakera, но я не нашла ссылку.

А ещё, а ещё, мои коллеги ведут курс с "задачами на поломать" на степике и у меня есть ссылка на курс со скидкой: здесь.

Я же буду рассказывать про зеро-лвл (что такое агент), плюс пройдусь по причинам, почему объяснить нормально в смысле xai мы его не можем. И нотбучек планирую за час с фреймворком AgentShap разобрать. У вебинара даже лендинг красивый есть (это я вас так зову, если вам хочется слушать онлайн 15 сентября, в 18:00 (мск)).

И надеюсь, ваши выходные лучше моих!


Отличная подборка материалов от Сабрины к мастер-классу!


Forward from: Stepik – онлайн-курсы
Хотите научиться понимать и применять AI-агентов?

15 сентября в 18:00 (мск) подключайтесь на бесплатный вебинар «Как понять, почему AI-агенты принимают именно такие решения?» ⚡️

Вебинар проведёт Сабрина Садиех — Researcher в области Explainable AI и R&D Lead в HiveTrace, сооснователь школы по интерпретируемости и автор курсов по XAI на Stepik.

На вебинаре разберём:

1️⃣Что такое AI-агент и почему существует так много разных определений?
2️⃣В каких задачах агенты действительно полезны?
3️⃣Почему бывает сложно понять, как агент пришёл к определённому решению?
4️⃣Как отличить настоящее объяснение поведения агента от простого совпадения?
5️⃣Почему Chain-of-thought (рассуждения модели) не всегда можно считать надёжным объяснением и как эффективнее работать с ними?
6️⃣В каких случаях решения агента можно интерпретировать, а когда – нет?


Вебинар будет интересен:

➡️ Тем, кто уже строит проекты с агентами и хочет разобраться, почему система ведёт себя не так, как ожидалось
➡️ Тем, кто только присматривается к агентам и хочет понять, как и где их эффективно использовать
➡️ ML/DS-специалистам, которым нужно объяснить поведение моделей заказчикам, ревьюерам или регуляторам
➡️ Инженерам и аналитикам, которые оценивают, где агент действительно даст преимущество, а где достаточно обычного пайплайна
➡️ Тем, кто просто устал от хайпа вокруг AI-агентов и хочет посмотреть на них через эксперименты


Для записи на вебинар заполняйте форму заявки на сайте или переходите в нашего ТГ-бота https://t.me/Stepik_Events_bot?start=aiagent 

Мы также пришлем напоминание до старта!

Ждём вас 💚

#stepik #AI #webinar #ИИ #агенты #XAI #машинноеобучение


Завтра наша коллега по лаборатории выступает с интересным семинаром, в том числе будут блок про безопасность и воркшоп 🔥


Привет, редтимеры! 🚩

🏁 Закончилась Kaggle-сорева от OpenAI про атаки на LLM-агентов, и закончилась жестко - 2855 из 4252 команд получили 0 на привате. 😱

Соревнование было достаточно странным, с косяками от оргов, которые пловину времени соревы чинили косяки скореров и пр. и закончилось тоже странно.

На public главный рабочий приём был простой: заставить агента вызвать http.post и передать в data скоринговый маркер SECRET_MARKER. Меняешь URL, получаешь новые очки к скору, ускоряешь вызовы - растёшь в таблице.

Но на private этот путь умер 🪦. Похоже, скрытая проверка начала смотреть не только на URL, но и на содержимое data. Увидела SECRET_MARKER - заблокировала вызов вместе с очками скора. 😎
Самый сильный public-подход оказался самым хрупким.

Что выжило?
Более скучная, но устойчивая атака: CONFUSED_DEPUTY через email.send. Смысл в том, что пользователь явно не просит отправлять письмо, а агент всё равно сам вызывает отправку. На public это давало меньше очков, поэтому выглядело слабее. Зато на private почти не просело.

У топов это выглядело так:
123.730 public -> 0.000 private на exfil
34.630 public -> 34.510 private на confused deputy

Главная ошибка многих команд: выбрать два лучших public-сабмита.

Золотое правило Kaggle опять сработало - выбирай две разные ставки:
1. один быстрый http.post под public;
2. один отдельный email.send под private - для подстраховки.

🧠 Вывод
Месяц оптимизации, сотни сабмитов, красивые графики и 0.000 по итогу.

Впечатления странные, вместо соревнования про атаки на агентов с инструментами большую часть времени приходилось бороться со скорером и ускорением инференса, чтобы успеть больше очков залутать.
Но окончание веселое - в духе каггла

Кто участвовал? Какие результаты, как впечатления?


Forward from: Stepik – онлайн-курсы
Пройдите один курс до 31 августа и получите скидку на следующий!

До конца лета осталось 10 дней. Почему бы не успеть пополнить свои летние итоги еще одним учебным достижением?

Запускаем 10-дневный челлендж Stepik: выбирайте курс, который давно откладывали, проходите его до конца августа и получайте скидку на следующий курс на Stepik💲

Как участвовать?

▪️выберите любой курс на Stepik
▪️пройдите его полностью до 31 августа (включительно)
▪️напишите свой user id на Stepik и прикрепите скриншот о завершении курса в комментариях

Всем, кто выполнит условия челленджа и успеет завершить курс, подарим промокод на следующий курс на Stepik 💚

Даже один небольшой курс – это уже шаг вперёд: новый навык, первые знания в интересующей сфере или начало пути к новой профессии. Начните двигаться к своей цели уже сейчас, а приятный скидочный бонус поможет продолжить обучение осенью!

Ну что, какой курс выберете?


Возможно для кого-то будет доп. мотивацией добить наш курс до конца лета!!!


Привет, редтимеры! 🚩

Пока громкие истории про frontier-модели уже успели разойтись по всему интернету, в AI Security продолжали происходить менее шумные, но важные сдвиги: open source-проекты усиливают защиту, исследователи копают prompt injection на уровне реальных пайплайнов, а вендоры начинают заворачивать AI-агентов в enterprise-сервисы 🧩

1. GitHub: open source учится жить в эпоху AI-first контрибьюторов

GitHub подвёл итоги Secure Open Source Fund: больше $500k распределили между 50 open source-проектами, включая AI/ML и agentic-инструменты вроде LangChain, Deep Agents, DocsGPT, ONNX и n8n-MCP.

Главная мысль: AI помогает быстрее разбирать уязвимости, делать threat modeling, ревьюить код и готовить remediation. Но решение «что реально мержить» всё ещё остаётся за мейнтейнерами. И это важный баланс: AI ускоряет security-процессы, но не заменяет ответственность человека 🛠️

2. USENIX Security ’26: prompt injection стал большой исследовательской темой

В программе USENIX Security ’26 сразу несколько работ посвящены LLM/agent security: indirect prompt injection в RAG и агентных системах, prompt injection в резюме для LLM-based screening, poisoning логов для LLM-аналитиков, атаки на web-агентов и AgentDoS.

Это хороший маркер: prompt injection больше не воспринимается как «прикол с промптом». Это уже полноценная область security research - с атаками на реальные пайплайны, логи, веб-агентов и decision-making системы 🔍

3. AI-агенты заходят в рабочие продукты и тащат за собой новые риски

Свежие публикации показывают общий тренд: Google добавляет enterprise controls для Antigravity, Slack тащит coding agents в групповые рабочие чаты, а вокруг Grok снова всплывает тема injected instructions.

Это не один большой инцидент, а важный паттерн: AI-агенты быстро становятся частью обычного рабочего софта. Значит, security-вопросы переезжают из лабораторий в админки, политики доступа, audit logs и управление агентами на уровне организации 🧑‍💻

4. Red teaming агентов становится отдельной дисциплиной

Giskard показали Agentic Red Teamer: на тестовом банковском ассистенте с 17 известными уязвимостями он нашёл 10, тогда как Garak — 2, Promptfoo — 1, Claude Code — 7.

Это хороший сигнал: реальные AI-агенты надо проверять не только jailbreak-промптами, а сценариями с tool calls, памятью, доступами и многошаговыми атаками.

5. CTF тоже становятся AI-driven

HKCERT проводит AI x Cybersecurity Challenge, где команды строят AI-driven automated system для анализа target range, поиска и эксплуатации уязвимостей.

Навык будущего: не просто решать таски руками, а безопасно оркестрировать AI-агентов в ограниченном контуре 🚩


Бот поддержки
Poll
  •   Круто, оставляем
  •   Стрём, уберите
  •   Хочу его пошатать
10 votes


Всем привет! 🚩

В курсе появился бот, который знает контекст курса и должен оперативно отвечать на ваши комментарии. (в принципе, его тоже можно попытаться взломать - только сильно не спамте в комментарии степика 😇)

Пока в тестовом режиме, возможно уберем.

Проголосуйте ниже в опросе, плиз 👇


Привет, редтимеры! 🚩


🤖 AI Agent Security: месяц борьбы не с моделями, а со скорером.

Продолжается одно из самых необычных соревнований на Kaggle от OpenAI: AI Agent Security - Multi-Step Tool Attacks.
Главный инсайт: это соревнование не столько про лучший джейлбрейк, сколько про победу над Kaggle-скорером.

На бумаге задача звучит просто: написать attack.py, который атакует LLM-агента с инструментами, находит уязвимые цепочки и возвращает воспроизводимые AttackCandidate.

На практике ты воюешь сразу с тремя вещами:

1. моделью;
2. гардрейлом;
3. официальным скорером, который может убить весь сабмит после нескольких часов расчета.

И вот третий пункт оказался самым жестким боссом.

🎯 Что реально работает?

Самый стабильный путь сейчас - не сложные многоходовые атаки, а быстрые и воспроизводимые tool-call атаки.

Главная рабочая механика:

- заставить агента сделать http.post;
- передать в data скоринговый маркер;
- менять URL/домены/пути так, чтобы получать новые score cells;
- возвращать только те кандидаты, которые реально сработали во время live exploration.

То есть выигрывает не самый «хакерский» промпт, а тот, кто лучше управляет плотностью: сколько валидных атак можно посадить в лимиты времени.

🚀 Подходы, которые выстрелили:

Live-fill.
Алгоритм не просто генерирует заранее 1000 промптов. Он прямо во время run() взаимодействует со средой, проверяет, сработала ли атака, и возвращает только successful candidates.

Template race.
Берем несколько коротких шаблонов атаки, прогоняем пробные запросы, смотрим, какой шаблон быстрее и надежнее на текущей модели, потом заполняем оставшееся время лучшим вариантом.

Replay-safe sizing.
Самая важная инженерная часть. Скорер потом заново replay-ит все кандидаты. Если вернуть слишком много даже рабочих атак, сабмит может умереть с Submission Format Error. Поэтому нужно считать не только генерацию, но и будущую стоимость replay.

One-turn exfil density.
Многоходовые атаки красивее и локально могут давать жирный score, но на официальном Kaggle часто не проходят replay budget. Сейчас короткие одношаговые атаки часто выгоднее, потому что их можно посадить больше.

🧨 Что работает хуже, чем хотелось:

Мультитёрн сценарии, indirect prompt injection, logic puzzles, давление в стиле «я админ», JSON-маркеры, языковые варианты, эмодзи, опечатки - всё это интересно и иногда стреляет в локальной валидации.

Но главная проблема: официальный скоринг жестко наказывает за дорогие цепочки. Даже если атака успешная, она может быть слишком тяжелой. А один тяжелый сабмит может несколько часов считаться и в конце упасть без score.

😵‍💫 Главная боль соревнования:

`Submission Format Error` не значит, что у тебя неправильный CSV.

Очень похоже, что под этим сообщением скрываются:

- timeout replay-фазы;
- слишком много кандидатов;
- слишком дорогие многоходовые цепочки;
- нестабильность hosted evaluator;
- несовпадение локальной валидации и реального Kaggle replay.
- и ещё множество догадок в дискашенах, но никаких объяснений от каггл стафф.

То есть можно иметь локально отличный score, отправить сабмит, ждать несколько часов и получить просто пустой результат.

📈 Сейчас топовые решения сходятся к одной идее:

Побеждает не самый крутой ркдтимер, а тот, кто аккуратнее балансирует:

- latency;
- replay budget;
- число кандидатов;
- уникальность score cells;
- стабильность на GPT-OSS и Gemma.

Это уже почти не prompt engineering, а performance engineering для атакующего алгоритма.

🧠 Что по итогу:

AI Agent Security не сорева про LLM-безопасность, а инженерная задача на границе red-teaming, системного дизайна и оптимизации под странный evaluator.

Модель можно пробить.
Гардрейл можно обойти.
Но настоящий финальный босс - это пройти скорер и не умереть через 6 часов с Submission Format Error.

Если хотите решать агентами - Фабла и Сол сразу всё рефьюзят, даже если пишешь им, что это официальная сорева от OpenAI (проверил за вас - не благодарите)

Остался месяц - самое время подключиться, основные шишки уже набили за вас.
Решаете или планируете приступить???


Forward from: Вайб-кодинг
Модели OpenAI взломали сайт Hugging Face с открытым ИИ, чтобы украсть ответы и сжульничать в бенчмарке 🤡

OpenAI рассказала о необычном инциденте во время внутреннего тестирования моделей на кибербезопасность. GPT-5.6 Sol и ещё одна неанонсированная модель, предположительно GPT-6, пытались получить максимальный результат в ExploitGym (бенчмарк по кибербезопасности) и в процессе вышли за пределы изолированной среды.

Для теста моделям заранее ослабили защитные ограничения и отключили продакшен-классификаторы. В итоге они нашли zero-day в прокси реестра пакетов OpenAI, повысили свои права, переместились по внутренней инфраструктуре и добрались до машины с доступом в интернет.

Дальше модели предположили, что ответы для ExploitGym могут находиться на Hugging Face. С помощью украденных учётных данных и zero-day уязвимостей - они получили удалённый доступ к серверам Hugging Face и добрались до закрытой информации в продакшен-базе данных.

В OpenAI назвали произошедшее беспрецедентным киберинцидентом.


Forward from: PWN AI
Если отбросить всякие OWASP, статьи научные и т.д то какой вектор атаки на AI-системы вы считаете наиболее недооцененным и опасным в реальных прод-средах прямо сейчас?
Poll
  •   Indirect Prompt Injection (через RAG, парсинг сайтов или документы)
  •   Отравление данных на этапе файнтюнинга или RAG-базы
  •   Злоупотребление инструментами агента (Agent Tool Misuse: SSRF, RCE, доступ к API)
  •   Supply Chain атаки (модели с бэкдорами, уязвимые зависимости в MlOps пайплайне)
  •   Социотехническая атака на оператора/администратора Ml-системы
  •   посмотреть
148 votes


Присоединяйтесь к опросу!


Forward from: Сиолошная
Две новости в утро воскресенья, 2026-й год:

1. Huggingface, платформа для загрузки моделей и датасетов + тренировки, раскрыли, что недавно подверглись атаке на инфраструктуру. Эта атака отличалась от предыдущих одним свойством: она была произведена автономной системой ИИ-агентов от начала и до конца.

В результате атаки серьезного урона, по их оценкам, нет, но атакующие получили доступ к ограниченному набору внутренних данных и к нескольким учетным записям внутренних сервисов. Злоумышленник использовал два пути выполнения кода в пайплайне обработки данных, в результате которых внутренняя виртуальная машина запустила вредоносный код. После этого злоумышленник получил доступ на уровне сервера, собрал учетные данные облака и кластера и за выходные проник в несколько внутренних кластеров.

«Кампанией управлял автономный агент (используемая LLM до сих пор неизвестна), который выполнял тысячи отдельных действий в рое короткоживущих виртуальных машин с самомигрирующей командно-контрольной инфраструктурой, развернутой на общедоступных сервисах. Это соответствует сценарию "агентcкого злоумышленника", который давно прогнозировали в индустрии». Ну прям как в Терминаторе показывали 👀

Заметить и отразить атаку получилось из-за... ИИ, так как у HuggingFace за логами и аномалиями следит LLM (по описанию похоже на то, что сначала система на основе правил находит разные потенциальные инциденты, а затем модель их перепроверяет более детально).

«Когда мы начали анализ логов, мы сначала использовали передовые модели, работающие через коммерческие API. Это не сработало: для анализа требуется загружать большие объемы реальных команд и артефактов, но эти запросы блокировались защитными механизмами провайдеров, которые не могут отличить специалиста по реагированию на инциденты от злоумышленника. В итоге мы провели криминалистический анализ на нашей собственной инфраструктуре, используя GLM 5.2».

2. Bloomberg: США рассматривают возможность создания надзорного органа для аудита передовых ИИ-моделей. Уже составлен черновик предложения, и он рассматривается главой аппарата Белого дома. Это предложение предусматривает создание независимого регулирующего агентства в сфере ИИ, которое будет подотчетно Комиссии по ценным бумагам и биржам (SEC).

В целом, план США согласуется с предложениями, опубликованными ранее на этой неделе CEO DeepMind Demis Hassabis, который на следующей неделе поедет в Вашингтон обсуждать и лоббировать свои идеи. В публикации в твиттере он сравнил потенциальный новый надзорный орган с FINRA — независимым, финансируемым самой отраслью регулятором брокерских фирм, который технически не является частью правительства США. Свои полномочия он получает от SEC, которая, по сути, делегирует надзор, но проводит аудит и устанавливает правила.

Моё понимание такое, что схема нужна потому, что государство с одной стороны не может быть очень быстрым (как частные компании), а с другой стороны не может платить сотрудникам большие деньги. Официально-то директора и министры получают сущие копейки, меньше чем миддл-инженеры в Google — кто туда пойдет работать?


Привет, редтимеры! 🚩

Опубликовали завершающий и самый объёмный 5-й модуль курса. 🐘

Внутри:
• новая компания и киберпанк
• разведка black-box систем
• рой агентов
• OWASP, КЦД и прочие ругательства
• много CTF 🚩

Ждём обратную связь!

На этом курс можно считать завершенным, далее будем вносить минорные правки, добавлять (или убирать) задачи и.т.п.

P/S: Просьба оставить отзыв о курсе на Stepik, если уже есть такая возможность - это поможет в продвижении и поддержке курса!


Forward from: 🏄 Соревновательный Data Science | Kaggle | Чемпионаты
Привет, Чемпионы! 🏆

🤖 AI Agent Security - Multi-Step Tool Attacks: Почувствуй себя хакером в мире LLM-агентов! 🎯

На Kaggle стартовало, пожалуй, самое долгожданное соревнование для специалистов по AI Safety и ИИ-безопасности. Организаторы не абы кто, а OpenAI, Google, IEEE и WCCI. Вместо привычного тюнинга бустингов или классификации картинок нам предлагают заняться алгоритмическим ред-тимингом и взломать умных ИИ-агентов, использующих внешние инструменты.

Это НЕ конкурс на написание единичных «джейлбрейков» вручную. Задача гораздо глубже: нужно написать автоматический алгоритм атаки, который заставит агента совершить цепочку деструктивных действий.

В чем суть задачи?
Современные агенты умеют читать файлы, лазить в интернет, отправлять email-ы и делать HTTP-запросы. Но что, если во входящем письме или на веб-странице спрятана инструкция, которая заставит агента прочитать secret.txt, вытащить оттуда SECRET_API_KEY и отправить его на сторонний сервер через http.post?

Ваш алгоритм (attack.py) будет помещен в Gym-style среду. Ему предстоит взаимодействовать с изолированным агентом (тестировать будут на GPT-OSS и Gemma 4), искать многошаговые уязвимости и выдавать воспроизводимые цепочки промптов, которые пробивают гардрайлы (guardrails).

🚀 Что здесь может сработать:

Reinforcement Learning (RL) и MCTS. Поиск цепочки атак - это, по сути, исследование графа состояний. Алгоритмы вроде Monte Carlo Tree Search (MCTS) или Q-learning могут помочь эффективно искать траектории, которые шаг за шагом сдвигают контекст агента в сторону опасного действия.

Пакетные итеративные промпты (Prompt Injection Frameworks). Агенты «ломаются» на стыке контекстов. Использование техник Indirect Prompt Injection (когда вредоносный текст подсовывается через web.search или mail_seed.json) - ключ к успеху. Нужно заставить агента самого прочитать ваш скрытый промпт при выполнении легитимной задачи.

Анализ трейсов (Trace Analysis). Среда возвращает логи вызовов инструментов. Напишите парсер логов (отслеживайте fs.read, email.read), чтобы ваш алгоритм атаки динамически адаптировался: если агент прочитал нужный файл, следующий шаг атаки должен подтолкнуть его к вызову http.post.

Генерация состязательных суффиксов (Adversarial Optimization). Атаки на основе градиентов или генетических алгоритмов для подбора таких токенов, которые максимизируют вероятность вызова агентом запрещенной функции, несмотря на системные промпты защиты.

📅 Дедлайн:
Прием решений открыт до конца августа 2026 года. Призовой фонд: $50,000, но Solo Gold и статус главного кошмара для ИИ-безопасности OpenAI стоят гораздо дороже!

🔗 Ссылка на соревнование:
https://www.kaggle.com/competitions/ai-agent-security-multi-step-tool-attacks

Для кого эта тема в новинку, предлагаем быстро погрузиться на нашем практическом курсе по AI Security 🚩. (промокод в комментах)

Кто готов заняться легальным хакингом фронтирных моделей? Обсуждаем векторы атак в комментариях! 👇


Нашли где можно применить все техники с нашего курса на практике и залутать реальные $🤑

Го, редтимить! 🚩


Всем привет! 🚩

В курсе открылся новый урок:

• сначала нужно будет провести разведку системы
• потом атаковать и всё сломать
• легко не будет, но у вас будет верный помощник в стане врага 😎

Го проходить и ждём обратную связь!

P.S.: на Stepik завтра заканчивается летняя распродажа, в которой участвует наш курс, если хотели кому-то порекомендовать - то самое время.

20 last posts shown.