AI Security Lab


Kanal geosi va tili: Rossiya, Ruscha


Взламываем ИИ, а другим не позволяем
HiveTrace x AI Talent Hub ITMO
ai.itmo.ru/aisecuritylab

Bog‘liq kanallar

Kanal geosi va tili
Rossiya, Ruscha
Statistika
Postlar filtri








Raft dan repost


Открытый вебинар про интерепретируемость агентов совместно со Stepik.

Завтра (вторник, 18:00 по МСК) лид лабы Сабрина Садиех (@jdata_blog) проведет вебинар про агентов.

Разбор будет построен от базового понимания "что есть агент?", до границ и разбора вопроса "почему мы не можем объяснять поведение агентов".

Будет мини-практика с кодом и много материала, чтобы поучиться (в том числе, чтобы поучиться атаковать агентов).

Зарегистрироваться и прочитать другие тейки можно на лендинге вебинара. Присоединяейтесь!




Наш исследователь — контрибьютор SAE Lens 🎉

PR Егора Емельянова, исследователя нашей лаборатории, приняли в SAE Lens — одну из основных библиотек для обучения и анализа sparse autoencoder'ов.

Sparse autoencoder'ы раскладывают внутренние активации нейросети на более простые и разреженные признаки — это один из ключевых инструментов механистической интерпретируемости. С их помощью исследователи пытаются понять, какие концепции модель представляет внутри. SAE Lens упрощает обучение таких автоэнкодеров и работу с ними.

Как пишет Егор: «В своём исследовании я хотел воспроизвести подход к обучению SAE из Gemma Scope 2, чтобы сравнивать свои результаты с их моделями. Обучал через SAE Lens — и обнаружил, что нужной функции потерь в библиотеке нет.

Я реализовал её самостоятельно, а потом подумал, что она пригодится и другим, и отправил pull request.»

Егор сделал дополнительный вариант штрафа за разреженность для JumpReLU SAE — Quadratic L0 из Gemma Scope 2.

Его ключевое отличие: исследователь заранее задаёт целевой L0 — желаемое среднее число активных признаков, и модель в процессе обучения стремится к этому значению.

Это даёт более прямой контроль над разреженностью и упрощает сравнение разных SAE.
Идея и формула уже существовали в Gemma Scope 2 — задача Егора была корректно перенести подход в SAE Lens, встроить его в существующую архитектуру, добавить валидацию и тесты.

🤝PR: https://github.com/decoderesearch/SAELens/pull/732

Поздравляем Егора — контрибьюты в открытые инструменты интерпретируемости так и работают: нашёл задачу в своём исследовании и закрыл её для всех 🦾


🍂 Записи докладов наших студенток, выступавших на международной конференции AINL 2026

Продолжаем осень в активном формате (или подводим итоги лета)

Наши студентки выступали на AINL 2026 и сейчас организаторы опубликовали выступление Веры Краснобаевой, выпустившейся магистрантки AI Talent Hub, ITMO University и исследовательницы Hive Trace Security Lab, — Cascading Failures in Multi-Agent LLM Systems.

В работе Вера исследует каскадные ошибки в мультиагентных LLM-системах — ситуации, когда сбой или неверное решение одного агента распространяется дальше по цепочке и влияет на работу всей системы.

На базе OWASP FinBot она собрала мультиагентный пайплайн из четырёх агентов и исследовала сценарии возникновения таких каскадов. Работа в итоге выросла в контрибьют в OWASP: в FinBot появился отдельный Cascade Lab, где можно увидеть каскадные ошибки в действии на реальном пайплайне.

Если хотите разобраться, как ломаются взаимодействия между AI-агентами и почему безопасность отдельных компонентов ещё не гарантирует безопасность всей системы, — рекомендуем посмотреть доклад.

Также в этом году можно будет присоединиться к проекту Веры и поработать с ней, как с руководительницей! Проекты будут доступны в ITMO Talent Hub, не пропустите!

Записи:
📺 YouTube
https://www.youtube.com/watch?v=dCxRy7bWrFI

▶️ VK Видео
https://vkvideo.ru/video-38193760_456239039?list=ln-uAMoOe6lPq5kSaI4Mr

#AINL2026 #AISecurity #MultiAgentSystems






HiveTrace dan repost




🗿Могут ли ИИ-агенты пропустить вредоносный код?

Вообще говоря, могут. Смотреть на это лучше всего в примерах, чтобы понимать, как делать не надо, чем потом работать с последствиями.

Где посмотреть. Разработчик команды HiveTrace Red Никита Беляевский написал материал, где воспроизвел и разобрал эксперимент с агентом, которому предложили поработать с вредоносным репозиторием.

Что в статье❓

✔️ Процесс: как агент анализирует незнакомый репозиторий и ищет подозрительный код;
✔️ Причины изменений в поведении: почему наличие исходного кода, README и других «безопасных» артефактов может повлиять на решение агента;
✔️ Действия: как агент может обнаружить потенциальную угрозу, но после дополнительного анализа решить, что она безопасна;

Эксперимент показывает занчимую особенность агентных систем: обнаружение потенциальной угрозы ещё не означает, что агент правильно оценит риск и остановится перед опасным действием.

➡️ Читать статью на Хабре:
«Рэд-флаг, который ИИ-агент проигнорировал»




Участник лаборатории Мосин Вячеслав завершил работу над обзором 7 ресурсов для мониторинга угроз AI Security

🔥 И обзор доступен каждому

Выбор ресурсов для сбора информации об угрозах, в том числе связанных с безопасностью ИИ является важным этапом в решении задач моделирования угроз и разработки стратегий по защите от них.

Задача выбора ресурсов трудоёмкая — можно натравить агента принести ссылки, но он не учтет практических особенностей. Слава разобрал 7 ресурсов и свел всё в единую статью. Её можно использовать как для понимания «что есть?», как и для анализа «что взять?».

В статье приведены OWASP, MITRE ATLAS, Google SAIF, MIT AI Risk Repository, Cisco - Integrated AI Security and Safety Framework, а также Сбер - Модель угроз для кибербезопасности AI и ФСТЭК - Угрозы безопасности информации систем искусственного интеллекта.

Каждый ресурс отмечен его особенностями. Работа поможет быстрее ознакомиться с ними и выбрать подходящий вариант для разных задач.

⤵️
Читать статью на Хабр




Одна из участниц команды лаборатории — Анна Решетняк — дебютировала со статьей на Хабр! 🔥

В материале Аня рассказывает об опыте ускорения Guard модели на основе NER‑классификатора. Модель была нетривиальной, отсюда её ускорение не влезало в классические пути.

В статье протестировано 5 инструментов: TensorRT, NVIDIA Triton, vLLM, Ray Serve и отдельно — смена бэкбона на Flash DeBERTa. Такой зоопарк ценен сам по себе, но не менее ценно то, что описаны также найденные Аней сложности и их решения.

Приглашаем поддержать сильный дебют: https://habr.com/ru/articles/1067008/
И конечно воспроизвести эксперименты в репо.

Ане огни за упорство и результаты!




Инциденты в cyber-evals у Anthropic — и почему нам всем нужен трейсинг агентов

Anthropic выпустили пост-ретроспективу про инциденты в собственных evals по кибербезопасности. Технически история почти атака на Hf во второй части, но у Anthropic интересная подача. На неё и посмотрим.

Что случилось. Толчком стало раскрытие инцидента у OpenAI — побег моделей из тестовой среды. В ответ Anthropic подняли архив своих прогонов (порядка 141k) и нашли 3 инцидента. Причина — контейнеры, где была моделька имели доступ в интернет, хотя в системном промпте было прописано «интернета нет». В итоге Claude в нескольких прогонах вышел наружу и скомпрометировал реальные системы. Сделал он это обычными приёмами: использовал слабую аутентификацию, открытые эндпоинты, лежащие в открытую креды, установку непроверенного PyPI-пакета. В части случаев модель продолжала атаку, уже осознав, что системы настоящие; в одном — остановилась.

Как это подано. Двойной тезис:

1. плохой дизайн теста — не провалидировали все пути в интернет и не мониторили логи в реальном времени;
2. «взломанные не защищались»: дыры были, базовыми мисконфигами, которые вскрылись базовыми техниками.


Что из этого важно для нас. Инциденты нашли ретроспективным разбором транскриптов — то есть постфактум. И главный практический вывод прямо из их же выводов: нужно в реальном времени видеть, что делает агент — какие шаги, какие tool-calls, куда он реально ходит. Без этого «агент что-то делает» превращается в «агент что-то сделал» уже по факту.

Отсюда мы собрали фреймворки трейсинга агентов. Все они отвечают на запрос наблюдаемости — «что именно делал агент».

— [Langfuse](https://github.com/langfuse/langfuse) — open-source трейсинг на OpenTelemetry: шаги, промпты, tool-calls, стоимость, оценки.
— [Arize Phoenix](https://github.com/Arize-ai/phoenix) — open-source трейсинг + eval, удобно смотреть траектории и ловить аномалии.
— [AgentOps](https://github.com/AgentOps-AI/agentops) — заточен под агентов: session replay, разбор шагов и вызовов инструментов.
— [OpenLLMetry](https://github.com/traceloop/openllmetry) (Traceloop) — OTel-инструментирование поверх привычного стека.
— И стандарт, который всё это связывает — [OpenTelemetry GenAI semantic conventions](https://opentelemetry.io/docs/specs/semconv/gen-ai/).

Вывод такой: если агент способен что-то сломать — его действия надо видеть в момент, а не в архиве. У Anthropic был архив, но прекрасно иметь трейс в реальном времени.

Мы также добавляем задачи на тестирование агентов в наши исследования и планируем улучшать на их основе продукт Hivetrace.

Так что работаем и мониторим, коллеги, работаем и мониторим.


HiveTrace dan repost
Контроль Claude и OpenClaw в HiveTrace

На вебинаре покажем новый сценарий работы HiveTrace с OpenClaw и Claude: в лайв-демо разберем, как обеспечить безопасность при использовании этих нашумевших инструментов в AI-агентах

🗓 28 июля в 11:00, МСК

Что будет в демо: ⬇️
➡️ как HiveTrace Hooks работают с Claude Code;
➡️ как анализировать пользовательские запросы до передачи в Claude;
➡️ как проверять tool calls до фактического выполнения;
➡️ как контролировать параметры и допустимость действий;
➡️ как защитить инстанс OpenClaw от атаки через небезопасный контент;
➡️ как мониторить и аудировать запросы к моделям и инструментам OpenClaw;


Спикеры:

👤Анна Тищенко, руководитель интеграции, покажет, как с помощью HiveTrace Hooks контролировать работу Claude на разных этапах.

👤Ильдар Исхаков, эксперт по бэкенду и архитектуре, покажет, как HiveTrace помогает защитить OpenClaw и встроить контроль в существующую AI-инфраструктуру.

👤Никита Беляевский, Red-team engineer, покажет атаки на агентов, в ходе которых, агент под воздействием непрямой промпт-инъекции будет выполнять опасные для устройства команды.

Вебинар будет полезен тем, кто работает с AI-агентами, tool calls, Claude Code или OpenClaw и хочет контролировать не только запросы к модели, но и действия, которые агент выполняет в системе.

➡️ Успей зарегистрироваться

20 ta oxirgi post ko‘rsatilgan.