OK ML


Channel's geo and language: Russia, Russian
Category: Technologies


Канал посвящен ML, DS, AI с акцентом на репозитории, инструменты и уязвимости в ML-системах.

Related channels

Channel's geo and language
Russia, Russian
Statistics
Posts filter


Год каналу, а за год накопилось столько всего, что пора сделать навигацию

😑 Уязвимости и AI Security
Superset. Три уязвимости
XSS в NextChat — CVE-2025-50733
RCE при загрузке моделей в skops — CVE-2025-54886
SSRF в Firecrawl — CVE-2025-57818
Local Deep Research — CVE-2025-57806
SSRF в HackMD-MCP — CVE-2025-59155
RCE в Keras — CVE-2025-9906
Prompt Injection в Windsurf
RCE в Hugging Face Transformers — CVE-2026-4372
пять способов обойти PickleScan
атаки на ML supply chain
OWASP Agentic Skills Top 10
AI Agent Traps от Google DeepMind
Shadow AI
— безопасность MCP 1, 2 , 3

🧘‍♀️ Инструменты, библиотеки и фреймворки
Optuna — тюнинг гиперпараметров
spaCy — промышленный NLP
Netron — рентген для ML-моделей
JAXFORMER
DVC
Polars
Weights & Biases
Evidently AI
Pydantic
MLBox
InterpretML
OpenTelemetry + Langfuse
Kedro
NVIDIA NeMo
Inspect Evals

🤩 AI-агенты и мультиагентные системы
RoboDuck и победа Theori в AIxCC
где пентест-агенты уже работают, а где нужен человек
MetaGPT + AFLOW
— безопасность агентных систем 1, 2
MCP как новая поверхность атак
side-channel атаки на агентов
мультиагентные системы и роевой интеллект
мониторинг rogue agents
Harness Engineering

🦔 Исследования и разборы статей
Model Inversion Attacks
scheming у AI в реальном мире
Your Agent Is Mine: атаки на LLM supply chain
WEF: AI for Cybersecurity 2026
обзор исследований по LLM-based vulnerability detection
— может ли AI самостоятельно взломать бинарник
Emergence AI: что произошло, когда AI оставили жить без людей
Anthropic об AI-enabled cyberattacks
InfoKV и сжатие KV-cache
— Люди, которые делают AI (Серые кардиналы 1, Серые кардиналы 2)

💔 ML: архитектуры, концепции и теория
KAN vs MLP
нейросимвольный AI
маленькие языковые модели
метрики качества текста: BLEU, ROUGE, BERTScore, COMET и другие
теория категорий и AI
ReaGAN и агентный подход к графовым нейросетям

🔪 Практика и эксперименты
как искать секреты в Git-репозиториях
SQL-инъекция в ML-проекте
Practical NLP: репозитории и ноутбуки
типичные ошибки ML в проде
— первый запуск локальной LLM на Jetson Orin Nano
— тренажёр prompt injection от Lakera
с чего начать изучение AI Security

Короче, тут уже не канал, а небольшой индекс по ML × AI Security.
Буду периодически обновлять этот пост, чтобы всё интересное можно было найти в одном месте.




Обзор раздела Assistants - Inspect Evals

Inspect Evals — опенсорсный фреймворк для оценки LLM, разработанный UK AI Security Institute и Meridian Labs. Inspect Evals содержит 200+ бенчмарков. В этом посте разберем раздел Assistants — 100+ специализированных бенчмарков для оценки AI агентов. Это инструменты для оценки реальных возможностей агентов, а не какое-то там чат-ботство (начни с туториала). 

🟢 Базовый уровень

👨‍💻 BFCL оценивает способность LLM вызывать функции/инструменты. В целом, базовый навык для любого агента — уметь выбрать нужный инструмент и вызвать его правильно.
👨‍💻 BrowseComp — бенчмарк для агентов-браузеров. Простой, но непростой бенчмарк для оценки способности агентов просматривать веб. Состоит из вопросов, которые обычно требуют доступа в интернет для правильного ответа. 

🟡 Средний уровень

👨‍💻 GAIA — бенчмарк для общих AI ассистентов.  Предлагает реальные вопросы, требующие фундаментальных способностей (рассуждение, мультимодальная обработка, веб-просмотр, использование тулов). Концептуально простые для людей, но сложные для большинства AI. Есть 3 уровня сложности (level 1-3).
👨‍💻 Mind2Web — это по сути своей обобщённый агент для веб. Набор данных для разработки агентов, которые могут следовать инструкциям на естественном языке и выполнять сложные задачи на любом веб-сайте. Amazon, Facebook, Gmail — всё возможно.
👨‍💻 OSWorld тестирует способность агентов выполнять реалистичные задачи в симулированных компьютерных окружениях — комплексное взаимодействие с разными приложениями, файловой системой, настройками.

🔴 Продвинутый уровень

👨‍💻 AssistantBench тестирует способность AI агентов выполнять реальные задачи (полноценные, вроде "забронируй отель за X$ в районе Y, но учти ограничение Z»), требующие длительного времени на выполнение в веб-среде. 
👨‍💻 GDPval - Экономически ценные задачи. Измеряет производительность моделей (реальную экономическую ценность выполненной работы) на экономически ценных, реальных задачах в 44 различных профессиях.
👨‍💻 Sycophancy Eval создан для оценки лицемерия 👑. Видел, как модель пишет "Вы совершенно правы…" в ответ на явно ошибочное утверждение? Это то самое. Тест проверяет, будет ли модель соглашаться с пользователем просто ради угодливости.
👨‍💻 The Agent Company — самый сложный бенчмарк в этом разделе. Агент работает в полноценной компании, где нужно просматривать внутренние веб-сервисы, читать файлы, запускать код, координировать несколько инструментов одновременно. Это уже не шуточки-прибауточки, это серьёзно.

🙂
Остальные разделы репозитория
❗️Coding
‼️ Cybersecurity (надеюсь, в следующем посте расскажу про него)
‼️Safeguards
❗️Mathematics

Что дальше? Выбери 2-3 бенчмарка в зависимости от своих целей:

 🤎 Тестируешь базовый агент? Начни с BFCL
👧 Нужна общая оценка? GAIA
💯 Оцениваешь production-ready решение? The Agent Company
Если ты новичок в агентах 🆘 , то начни с туториала Inspect,
потом попробуй BFCL на простой модели, затем переходи на GAIA.

Все
😳


MCP или 400% рост использования = 400% рост проблем

👹 Совпадение? Не думаю! 
В 2025 году MCP adoption выросла на 400%. Это не очепятка. За год разработчики увеличили использование Model Context Protocol в 5 раз. И в тот же самый период (а это январь-март 2026) было зафиксировано 30+ CVE, направленных конкретно на MCP экосистему. За два месяца! 60 дней, из них 40 рабочих!

Напомню, что такое MCP. Простыми словами, это мост между ИИ-ассистентом и внутренними системами твоей компании/твоими.
Вместо того чтобы копировать данные в ChatGPT (как в Shadow AI),  даешь ИИ прямой доступ к нужным инструментам:
🤓 Доступ к файлам на компьютере
🤓 Доступ к GitHub репозиториям
🤓 Доступ к Slack, Gmail
🤓 Доступ к базам данных
🤓 Доступ к внутренним API

Но проблема в том, что MCP-сервер — это не какой-то там безопасный API. Это уязвимая программа, которая слушает входящие команды. И если эта программа скомпрометирована, скомпрометирована вся цепочка.

Вот цепочка атаки for dummies:
🕛 Атакующий создаёт  MCP-сервер. который выглядит как полезный инструмент.
🕧 Разработчик устанавливает этот сервер (Он же кажется официальным, репозиторий на GitHub, хорошие отзывы, звезды)
🕐 Сервер имеет backdoor  (а когда ИИ-ассистент подключается к нему, backdoor запускается)
🕜 Attacker получает доступ (к IDE разработчика, его файлам, его GitHub токенам, его клиентским данным)
🕑 Вся система скомпрометирована! ИИ теперь работает не только на тебя или даже совсем не на тебя!

Реально? РЕАЛЬНО!
1️⃣ OpenClaw и 800+ Malicious Skills (ClawHavoc campaign распространила 800+ вредоносных скиллов и позже выросло до 2200+ на GitHub). В начале 2026 года исследователи обнаружили, что популярный open-source ИИ-фреймворк OpenClaw стал целью для атакующих. Люди просто кликали "установить расширение" и не знали, что устанавливают малварь. Расширение выглядело как "AI Assistant for Productivity" или "Database Helper". На самом деле это были инфостилеры, которые собирали API токены и отправляли их на серверы атакующего.
2️⃣CVE-2025-6514. Одного MCP-сервера достаточно! Исследователи JFrog обнаружили, что один скомпрометированный MCP-сервер может взломать любого ИИ-клиента, который к нему подключается. Никакой пользовательской аутентификации не требуется.
3️⃣ Supply Chain через MCP. В августе 2025 года был зафиксирован первый supply chain attack, использующий компромисс OAuth токенов через MCP-интеграцию. 700+ компаний было скомпрометировано через компромисс интегрированных сервисов.

Статистика: 30+ CVE за 60 дней
Вот что почитать и данные:
🍓 30 CVEs за 60 дней (январь-март 2026)
🍓 40+ CVEs за 4 месяца (январь-апрель 2026)
🍓 Comprehensive analysis от Lab Space

Интересно по ссылкам, дополнительное чтение или "уважаемая черешня, какое стоп-слово"!
🍒 CVE-2025-68145/68143/68144 (Anthropic's mcp-server-git)
🍒 MCP Security 2026
🍒 A Timeline of Model Context Protocol (MCP) Security Breaches
🍒 MCP Security Vulnerabilities in 2026: 40+ CVEs and Counting

Кстати, знаешь, какие MCP-серверы сейчас запущены в вашей компании?

Все!
🌟

385 0 15 6 25

Shadow AI. Много ссылок

80% сотрудников используют неодобренные ИИ-инструменты.
🥳

Это не слухи. Вот результат анализа 22,4 млн запросов от компании Harmonic Security. Исследователи  обнаружили 665 разных сервисов ИИ в корпоративных сетях. 665 🤹! А компании купили лицензий на 40% из них. Для остальных 60% (для которых люди буквально за день нашли способ использования) — никаких контрактов, никакой поддержки, никакой видимости. Ещё забавнее, что 38% сотрудников сами признают, что делились конфиденциальной информацией с ИИ без разрешения. А 16,9% утечек произошло через бесплатные аккаунты, которые IT вообще не видит. Они просто вообще не учитываются. Человек вошёл через личный акк, работу сделал, вышел. Ищи-свищи! 

Стоимость этого? 🫂 Samsung узнала о проблеме, когда три инженера за месяц слили исходный код, встречи и данные производства. Сначала компания запретила ChatGPT. Потом отменила запрет, потому что запреты не работают.
В здравоохранении ситуация критична. 57% врачей используют ChatGPT или Gemini для написания заметок о пациентах. Они обрабатывают защищённую медицинскую информацию в инструментах, на которые нет контракта. Это одновременно нарушает HIPAA и рискует жизнями пациентов (если ИИ ошибётся в диагнозе). При этом, когда одной больнице дали одобренный ИИ-инструмент, неодобренное использование упало на 89%. Врачи при этом экономили 32 минуты в день. Не потому, что их запугали. Потому, что им дали что-то лучшее.

IBM посчитала, что Shadow AI добавляет 670 000 долларов к стоимости одного взлома. Организации с высоким уровнем неконтролируемого ИИ платят $4,63 млн за взлом вместо $3,96 млн.

И это только видимые числа. Реальная стоимость insider-угроз, созданных неосторожным использованием ИИ, составляет $10,3 млн в год на одну компанию.

Тем временем, ❤️ европейский закон об ИИ вступил в силу 2 августа 2026. GDPR уже наказывает компании, если сотрудник вставил личные данные клиента в ChatGPT без контракта обработки данных. Как это работает на практике, описано в этой статье про EU AI Act.

Vectra AI провела полный анализ проблемы. Гартнер прогнозирует, что 40% компаний столкнутся с инцидентом, связанным с Shadow AI, к 2030 году

Что делать? Пост скорее про статистику происходящего, чем про какие-то возможные рекомендации, тут я и не знаю толком, что делать. Люди есть люди. 
🔪 Мониторьте нейтрально. Чтоб видеть, что происходит.
🔪 Установите границы. Исходный код проекта — нельзя. Исходный код из публичных репозиториев — можно. Данные о клиентах — нельзя. Общая информация о тренде на рынке — можно. И т.д.
🔪 Самое сложное. Дайте людям правильный инструмент.

Все!
😼


Из одного большого фреймворка — в экосистему специализированных библиотек. Рассмотрим NeMo от NVIDIA

NeMo по умолчанию воспринимается как фреймворк для обучения LLM, мультимодальных и speech-моделей, а теперь NVIDIA делает ставку на модульную архитектуру (из-за монолитности там было тяжело что-то найти, да и контейнер разросся). Реструктуризация анонсирована официально, исходный репозиторий NeMo 2.0 теперь сфокусирован на speech-компонентах, а остальное выносится в отдельные библиотеки. Как следствие — чудные открытия, которыми я поделюсь!

Теперь NeMo — это набор отдельных проектов. Самые интересные (имхо) ☝️:
🥹 NeMo AutoModel — распределённое обучение LLM/VLM с Day-0 поддержкой моделей с HF (без конвертации, с сохранением исходного формата чекпоинта).
🥹 NeMo Megatron-Bridge — обучение и файнтюнинг больших моделей на параллелизме Megatron-Core. Вместе с AutoModel и RL переехал с PyTorch Lightning на нативный PyTorch-цикл — техническая суть всей реструктуризации.
🥹 NeMo RL — SFT и RL (DPO, GRPO и другие современные методы постобучения), от одной GPU до тысяч, на Ray.
🥹 NeMo Gym — инфраструктура RL-окружений (унифицированные интерфейсы к разнородным средам и сбор роллаутов для обучения через NeMo RL).
🥹 NeMo Evaluator — вот здесь как раз бенчмарки и харнессы.
🥹 NeMo Guardrails — один из самых популярных опенсорсов для добавления guardrails и контроля поведения LLM.
🥹 NeMo Curator — подготовка и очистка данных. Data Designer — синтетика. Anonymizer — PII. Safe-Synthesizer — генерация безопасных синтетических датасетов. Небезопасные сами умеете 🤥
🥹 🥹 Switchyard — маршрутизация запросов между LLM, совместимость с API OpenAI и Anthropic + observability. Написан на Rust и разбит на крейты (server, libsy, protocol, translation), то есть роутинг можно встроить в своё приложение (без прокси). NVIDIA официально пометила старый blueprint LLM Router как deprecated в его пользу. Отдельная история, это цена трансляции протоколов. Если оставить для Claude-моделей format: openai вместо явного format: anthropic, теряется cache_control. Запрос проходит, но prompt caching молча не включается, и платишь полную цену за входные токены. Конфигурация, о которую легко споткнуться. Как будто весь пост можно посвятить только Switchyard.
🥹 labs-OO-Agents (NOOA) — самое чудное открытие. Ресеч! Агент — это обычный Python-объект. Поля = состояние, docstring = промпт, аннотации типов = контракты. Метод, тело которого состоит из ..., во время выполнения дописывается LLM-циклом; методы с обычным телом остаются детерминированным кодом. ИДея классная, есть статья.
🥹 NeMo Platform — то, что всё это сшивает (Inference Gateway, оценка и тюнинг агентов, NeMo Agent Toolkit для сборки, общая инфраструктура (Secrets, Files, Entity Store, Jobs)).

Что забирать сейчас?
Switchyard — если у тебя зоопарк провайдеров и хочется роутинг без Python-прокси. Guardrails — он и так давно в проде у многих. Gym + RL — если ты занимаешься постобучением, а не «GRPO по гайду с клодом, кими, чатом гпт в девине». Остальное — читать по мере надобности, благо теперь оно наконец разложено по полкам, а не свалено в один репозиторий на 138920 гигабайт. NOOA разберём отдельно?

Все!
😆


Forward from: PWN AI


Первый опыт запуска локальной LLM на Jetson Orin Nano

Проверим, насколько современные edge-устройства готовы к локальному запуску языковых моделей. В качестве платформы — Jetson Orin Nano Developer Kit 8GB, в качестве модели — Qwen2.5-3B-Instruct через llama.cpp.

😼 В итоге модель успешно заработала локально на GPU, но по пути встретилось несколько нюансов, о которых стоит знать заранее.

После загрузки в последовательной консоли появляется стандартный запрос входа Ubuntu:
Ubuntu 22.04.5 LTS
yahboom login:
Если используется готовый образ от производителя (например, Yahboom), первоначальная настройка пользователя уже выполнена. Вместо мастера oem-config сразу появляется приглашение к входу в систему, поэтому необходимо знать логин и пароль, заданные производителем образа. Тут придется поискать логин/пароль 🔪

Отдельный момент — перепрошивка устройства 🤔
Официальные инструменты NVIDIA для прошивки Jetson ориентированы на Linux (Ubuntu). На macOS полноценной поддержки нет, поэтому перепрошивка с Mac заметно сложнее, приходится использовать виртуальную машину, отдельный Linux-компьютер или искать неофициальные способы. Если планируется менять JetPack или восстанавливать устройство, проще заранее иметь доступ к ПК с Ubuntu. 

После первого подключения оказалось, что GitHub недоступен:

fatal: Could not resolve host: github.com

Причина была в конфигурации сети.
По умолчанию устройство подняло собственную точку доступа (Jetson_Orin_Hot), а маршрут был направлен через USB-подключение к компьютеру, которое не обеспечивало доступ в интернет.
После подключения Jetson к домашнему Wi-Fi всё заработало без дополнительной настройки. Мой косяк и тупняк 🥳, но вдруг кому пригодится. 

Далее был собран llama.cpp с поддержкой CUDA. Компиляция заняла значительно больше времени, чем ожидалось. Ну ничего, шалость удалась! 

Производительность 👇
Замеры сделаны через llama-bench из состава llama.cpp (build 876a43211) (JP 6.2, режим питания MAXN_SUPER, jetson_clocks, графическая оболочка отключена, модель Qwen2.5-3B-Instruct в кванте Q4_K_M (1.79 GiB), все слои на GPU, flash attention включён, 5 повторов). 

🤡 Без nvpmodel -m 2 и jetson_clocks результаты получаются ниже и с большим разбросом. Наверно, именно поэтому в сети гуляют замеры Orin Nano, различающиеся в разы. Плюс обратная сторона, jetson_clocks поднял потребление в простое с 4.6 до 7.0 Вт и температуру с 54 до 63 °C. 

Две метрики:
🤜 pp (prompt processing) — скорость чтения того, что отправили модели (упирается в вычислительную мощность GPU). 
🤜 tg (token generation) — скорость, с которой модель пишет ответ (упирается в пропускную способность памяти, поскольку на каждый токен нужно прочитать все веса).

pp512   895.27 ± 10.50 t/s
tg128    23.98 ±  0.01 t/s

Проверка теорией
😳
У Orin Nano 102 ГБ/с  LPDDR5, модель весит 1.79 ГБ, потолок генерации — около 53 т/с. Достигнутые 24 т/с это 45% от паспортной полосы, что для реальной нагрузки нормально (помимо весов на каждый токен читается ещё и KV-кэш).
Деградация при росте контекста:
┌─────────┬────────┬────────┐
│ Глубина │ pp512 │ tg128 │
├─────────┼────────┼────────┤
│ 0 │ 895.3 │ 23.98 │
│ 1024 │ 866.0 │ 23.69 │
│ 4096 │ 773.3 │ 23.01 │
│ 8192 │ 667.9 │ 22.18 │
└─────────┴────────┴────────┘
На 8K контекста генерация теряет 7.5%, обработка запроса — 25%. Для практики это значит, что длинная беседа скорость ответа почти не замедляет.

Влезет ли 7B проверить руки пока не дошли
После отключения графики свободно ~5.5 ГБ из 7.6. Qwen2.5-7B в Q4_K_M это ~4.7 ГБ весов плюс около 0.5 ГБ KV-кэша на 8K контекста плюс compute buffers — влезает впритык и только headless. Ожидаемая скорость по той же формуле, 102 / 4.7 ≈ 21 потолок, реально порядка 10–12 т/с. Q5 и выше на 8 ГБ уже не поместятся. 🤨

Все!
💡

PS
В рецепте лимонного пирога первым ингредиентом идёт 200 г твёрдого сыра, потом чайная ложка соли и масло оливковое. Модель поплыла 😏.
3B на русском и вот вам лимонный пирог с грюйером! Но это уже совсем другая история!


Математика категорий и ИИ

Любишь читать академичные лонгриды с сомнительной практической пользой? Тогда этот пост для тебя!

О теории категорий обычно говорят как об одной из самых абстрактных областей математики. Довелось прочитать популярную книгу «Восторг абстрактной математики» Юджении Ченг (вслух тебе её прочитают на ютубе, можешь купить на озоне за 4к и в целом за год достаточно прочитать только ее, чтоб собой гордиться, она сложная и АБСТРАКТНАЯ) и статью на хабре, а на основе прочитанного обдумать, где в ИИ теория категорий и зачем она вообще нужна! Посвящаю пост тому, кто хотел взять Юджению с собой в отпуск 🍐.

Дело в том, что теория категорий изучает не сами объекты, а отношения между ними и правила их композиции. Именно поэтому её иногда называют математикой композиции (и математикой математики). То самое "Думай абстрактно!".

Разберу несколько базовых терминов.
🌈 Категория — это совокупность объектов и стрелок (морфизмов) между ними. Стрелки можно последовательно склеивать (композировать), склейка ассоциативна, а у каждого объекта есть тождественный морфизм (стрелка), который ничего не меняет. Всё, три правила.
Например, если есть преобразования
Текст → Эмбеддинг → Ответ

то теория категорий рассматривает всю цепочку как единое отображение.

🌈 Морфизм (Morphism) называют обобщением функции. В абстрактной категории это просто стрелка между объектами, про которую известно лишь, что её можно композиционировать с другими стрелками. А уже в конкретных категориях (например, категории множеств или векторных пространств) морфизмы действительно являются отображениями, сохраняющими структуру. А вот если категория конкретная (объекты — множества со структурой), то морфизм — это гомоморфизм, то есть отображение, сохраняющее структуру. Да, абстракция — это не за пивом в КБ спуститься.
В машинном обучении морфизмом можно считать практически любое преобразование данных:
🍄 токенизация;
🍄получение эмбеддингов;
🍄слой нейронной сети;
🍄attention;
🍄вызов инструмента агентом.
Вся нейронная сеть по сути просто композиция морфизмов.

🌈 Композиция (Composition) — главный объект изучения теории категорий.
Если есть
A → B
B → C

то их можно объединить в одно преобразование
A → C

Именно поэтому современные ML-пайплайны и агентные системы естественно описываются языком категорий, так как они представляют собой композицию множества небольших компонентов.

🌈 Функтор (Functor) — отображение между двумя категориями, которое сохраняет их структуру. Переводит объекты в объекты, стрелки в стрелки, и делает это согласованно со склейкой.
Сравню с компилятором, зря что ли по ним учебники прочитаны.
Но самый понятный пример из ML — эквивариантность. Повернуть картинку и потом сегментировать = сегментировать и потом повернуть маску. Оба пути дают одно и то же — функториальность.

🌈 Натуральное преобразование (Natural Transformation) — способ согласованно преобразовать один функтор в другой. Если существуют два различных способа перевести текст в эмбеддинг, натуральное преобразование описывает, когда эти способы эквивалентны с точки зрения всей системы. С понятием эквивалентности в книге тоже пришлось помучиться, т.к. эквивалентны не значит равны!

🌈 Монада (Monad) — один из самых известных объектов теории категорий. Формально это эндофунктор (функтор из категории в саму себя) с двумя дополнительными операциями, удовлетворяющими определённым законам. Ближайший пример из МЛ практики — цепочка вызовов тулов агентом (каждый шаг тащит за собой контекст, состояние и возможный отказ, а монада описывает, как такие шаги корректно склеивать). Ради этого их в программирование и притащили — описывать вычисления с побочными эффектами (чтение памяти, вызов API и дальше придумай сам примеры).

А где здесь ИИ и зачем вообще этот пост?
Интерес к теории категорий в МЛ возник не потому, что она позволяет сделать трансформер умнее 😡. Скорее она предлагает единый математический язык для описания сложных AI-систем.
Сегодня появляются работы, где через категории описывают:
👋 композицию нейронных сетей;
👋 backpropagation и автоматическое дифференцирование;
👋 архитектуры глубокого обучения;
👋 мультимодальные модели;
👋 агентные системы;
👋 нейросимвольный AI.
Крч, надо ознакомиться с терминологией, потому что может пригодиться.

Что почитать?
Если ты дочитал до сюда и думаешь, что у меня свистит крыша и в МЛ это никому не надо, то статьи 2021 и 2024 годов:
⌚️ Обзор Category Theory in Machine Learning (2021) — хорошее введение в применение категорий в ML.
⌚️ Прямое продолжение первого, где авторы заявляют его как обновление и расширение обзора Shiebler et al. Систематизируют четыре направления — градиентное обучение, вероятностные модели, методы на основе инвариантности и эквивариантности и обучение на основе топосов. Последнее направление отвечает за интерпретируемость, композиционность и анализ глобальной структуры AI-систем.

Есть интуитивное ощущение, что теория категорий претендует на роль общего языка описания AI-систем — примерно как когда-то теория типов в программировании (сорри, если сравнение кажется ничего себе), способ говорить о том, что из чего собрано и почему оно склеивается. Пока это скорее исследовательское направление, но мы же тут, чтоб держать руку на пульсе.

Вот такой скучный лонгрид! От абстракций голова кругом.
Все!
🏆


Мониторить агентов — хорошая идея. Но монитор тоже придётся мониторить

Работа Preventing Rogue Agents Improves Multi-Agent Collaboration предлагает вместо того, чтобы улучшать самих агентов, добавить над ними отдельный слой runtime-мониторинга, который отслеживает признаки того, что один из агентов начинает вести себя девиантно.😐

Механизм простой и интересный. Монитор замечает, что агент начинает путаться 😬, и система откатывает обратимые действия, но не дальше последнего необратимого — траты общего ресурса, коммита решения. После этого обсуждение идёт заново, пока ошибка не успела разойтись по системе.
Признаки для оценки риска статистические:
🤩 энтропия;
🤩 вариэнтропия;
🤩 эксцесс;
🤩 номер текущего хода.
Первые три считаются по распределению вероятностей на позициях, важных для выбора действия, и берутся максимумом по всем таким позициям. 💡 Поверх них — полиномиальный ridge-классификатор, оценивающий вероятность успешного завершения задачи. Если она падает ниже порога, система вмешивается. Число вмешательств жёстко ограничено одним-двкмя за прогон.
Результаты читай в статье. 

Важная оговорка про терминологию. Rogue agent здесь — это не скомпрометированный агент, а просто запутавшийся.

☺️ Мне кажется, в ближайшие годы появится полноценный стек защиты AI-агентов. И мониторинг поведения, и агенты-наблюдатели, и оценка уровня доверия/репутации, и анализ зависимостей между агентами, и механизмы контроля их действий в реальном времени. Эта статья очень хороший пример того, как подобные идеи начинают переходить из теории в практические механизмы защиты.

Правда, есть одна проблема 😑
И эта проблема отражена в Bypassing AI Control Protocols via Agent-as-a-Proxy Attacks. Авторы атакуют LLM-мониторы, которые читают ризонинг, аргументы вызовов тулов и их выводы. Конкретно AlignmentCheck из LlamaFirewall и extract-and-evaluate.

Идея атаки прямо в названии (агент не цель, а курьер). Инъекция заставляет агента повторить оптимизированную строку в своих рассуждениях и вызовах тулов, монитор обрабатывает эту строку как часть ризонинга или вызова инструмента и в результате начинает считать вредоносную траекторию безопасной. 🤥 Атака не полагается на то, что агент переиграет монитор; ему достаточно просто уметь повторять текст.
Отсюда два неприятных результата.
😐 Парадокс гибридного мониторинга. Смотреть одновременно на ризонинг и на действия лучше против статических атак, но против адаптивных — хуже, чем смотреть на один только CoT. У Qwen2.5-7B: 68.2% ASR против 55.1%.
Каждое дополнительное место, куда попадает строка, — это дополнительная поверхность атаки.
😐 Разрыв в способностях не нужен. GPT-4o mini и Llama 3.1 70B успешно пробивают монитор на Qwen2.5-72B — 46.0% и 60.2% ASR@5 соответственно. То есть идея поставить монитор побольше не работает как стратегия.

Кстати, авторы предлагают новый алгоритм атаки — Parallel-GCG. Если обычный GCG оптимизирует вредоносную строку под одно место в промпте, то Parallel-GCG оптимизирует её сразу под все места, где она позже всплывёт во время работы агента (градиенты со всех вхождений суммируются). Прикольно — как мне кажется, самая интересная техническая часть статьи.

👉 Эти две работы не противоречат друг другу и не сталкиваются лоб в лоб. Монитор из первой статьи текст вообще не читает, тк он считает статистику по распределению вероятностей, напрямую строкой его не атакуешь. Атака на такой монитор в принципе возможна, но пока её никто не показал (действуй!). 

Общий вывод от этого не слабеет. Как только монитор начинает интерпретировать то, что производит агент, он сам становится частью поверхности атаки. Похоже, следующий этап исследований будет посвящён уже не просто мониторингу, а тому, как построить мониторинг, которому можно доверять.

Все!
🫥

P.S.
Rogue agents в широком смысле
В AI Security этот термин используют шире, чем в первой статье, как агентов, которые постепенно начинают работать не так, как было задумано, хотя их разрешения и инструменты не менялись (этим весь пост в целом вдохновлён).
Это не обязательно компрометация. Агент может изменить интерпретацию своей задачи после prompt injection, poisoned RAG, goal hijacking или просто накопленного дрейфа поведения. Самое неприятное, что каждое отдельное действие выглядит полностью легитимным. Проблема проявляется только на уровне общей траектории поведения и влияния на остальных агентов.

Ладно б агент просто нарушал правила. Гораздо сложнее обнаружить момент, когда он начинает постепенно отклоняться от первоначальной цели, оставаясь при этом в рамках своих полномочий. Именно поэтому поведенческий мониторинг, скорее всего, станет таким же обязательным элементом агентных систем, каким сегодня являются EDR и UEBA в корпоративной инфраструктуре (rogue agent здесь аналог insider).


Эпоха AI vs AI

Hugging Face рассказали о первом известном случае полностью автономного AI-взлома.

Точка входа — классическая для AI-платформ. Вредоносный датасет эксплуатировал два пути выполнения кода в пайплайне обработки данных (remote-code loader и template-injection в конфигурации) и запустился на процессинг-воркере. Дальше шла эскалация до уровня ноды, сбор облачных и кластерных учёток и боковое перемещение по внутренним кластерам. Всё это всего лишь за одни выходные.

Масштаб автоматизации даже немного пугает 🔫. По данным HF, агентная система выполнила более 17 000 действий, работая через тысячи песочниц и автоматически мигрируя между ними. По сути, это один из первых публично описанных примеров того самого agentic attacker. 

Но защищаться тоже помогал AI 🛡. Компрометацию первым заметил LLM-триаж телеметрии, а затем LLM-агенты разобрали весь лог атаки. Восстановили таймлайн, вытащили IoC, определили затронутые учётные данные и отделили реальные действия злоумышленника от ложных приманок 😲! Расследование заняло часы вместо дней. Получилось, что защита впервые работала на скорости атакующего.

Кстати, коммерческие модели через API для этой задачи не подошли, так что рано потирать руки, желающие генерить эксплоиты! Запросы с реальными эксплоитами, командами атакующих и артефактами C2 блокировались встроенными гардрейлами. В итоге расследование проводили локально с помощью GLM 5.2, развёрнутой в собственной инфраструктуре.

Практический вывод HF для защитников!
Проверенная локальная модель должна быть развёрнута и готова до инцидента, а не после.

Лениво читать? Видеоразбор инцидента тут.

Все!
😲

Кстати, разбор вышел 16 июля — в день ИИ в США. Праздничный подгон!


С чего начать изучение AI Security?

Одна из многих проблем LLM — prompt injection. Но свет на ней клином не сошелся! Это лишь один из множества классов атак. 😲

Чтобы разобраться в ландшафте угроз, рекомендую начать с OWASP Top 10 for LLM Applications — самой известной единственной таксономии рисков для GenAI-приложений. Отличная точка старта.
🙂 При этом важно понимать, что это не полный список угроз. Документ в первую очередь посвящён безопасности LLM-приложений. Сегодня же фокус постепенно смещается в сторону AI-агентов, где появляются новые классы атак (компрометация памяти, tool hijacking, MCP, атаки на браузерных агентов, доверительные цепочки между агентами и многое другое).

Если хочется посмотреть на эту эволюцию в более широком контексте, недавно вышла статья "Weaponizing Intelligence: AI in the Hacker's Arsenal» (приложу журнал в комментарии). Статья рассматривает AI сразу в нескольких ролях — как средство защиты, инструмент атакующего, цель атаки и даже как доверенного помощника, которого можно использовать после компрометации рабочей станции пользователя. Хороший обзор того, как меняется модель угроз вокруг LLM и AI-приложений 🏋️‍♀️.

Какие на фоне статьи у меня появились идеи для дальнейшего ресеча?
Trusted assistant abuse — стенд с аутентифицированной сессией и canary-секретами; измерить, сколько утекает через ассистента от скомпрометированного эндпоинта по разным провайдерам.
Denial-of-wallet бенчмарк — формализовать истощение токенов/квот и защиты (quota, throttling, аномалии).
Отравление памяти/RAG — измерить, как ложные факты в памяти влияют на будущие решения; проверить provenance/versioning.
Кросс-провайдерное сравнение — один набор abuse-тестов на нескольких ассистентах; квантифицировать зависимость от guardrails.
➖ ARiES для endpoint-вектора (AI Risk Enablement Score — рекомендую почитать этот ресеч) — адаптировать метрику enablement-риска (из threat-intel отчёта Anthropic) под ассистента как непрямой канал.
ИИ-фишинг, human factors — прирост кликабельности персонализированного фишинга vs шаблонного (только симуляция).

Все!
🌝

P.S.
Один из авторов статьи — @IgorKorkin. Если после прочтения останутся вопросы, думаю, он будет рад обсудить их.

P.P.S.
Что же в самом OWASP Top 10 for LLM (версия 2025 года, хехе, тоже приложу в комментариях)?
💉 Prompt Injection — внедрение инструкций, изменяющих поведение модели.
📄 Sensitive Information Disclosure — утечки системных промптов, секретов, данных пользователей и внутреннего контекста.
🔌 Excessive Agency — модель получает слишком широкие полномочия и может выполнять опасные действия через инструменты и API.
🗂 Supply Chain — уязвимости в моделях, датасетах, эмбеддингах, RAG-компонентах и сторонних интеграциях.
🧠 Vector & Embedding Weaknesses — атаки на векторные базы знаний и retrieval-пайплайны.
📚 Misinformation и другие риски, связанные с надежностью и безопасностью генерации.


Почему внимание — не всегда лучший критерий?

Исследователи из LUMIA Lab (SJTU) и Edinburgh предложили InfoKV  — фреймворк сжатия KV-кэша, который смотрит в будущее! Это как вообще? 🎂

Существующие методы (SnapKV, PyramidKV и др.) выбирают токены по весам внимания, то есть по тому, насколько недавние токены смотрят на прошлые. Это работает для ближнего контекста, но в длинном ризонинге токены важны и для будущих шагов рассуждения. Классический подход предполагает, что важное для текущего контекста останется важным и дальше. Но в длинном ризонинге траектория рассуждения меняется, и токен, который сейчас никому не нужен, может оказаться критичным через тысячи шагов. Авторы показывают это через Forward Influence, влияние высоко-attention токенов быстро затухает с расстоянием, а влияние высокоэнтропийных токенов остаётся сильным даже на горизонте 14K токенов. Интуитивно понятно, кмк. Высокая энтропия при предсказании означает, что токен нес информацию, которую модель не могла вывести из контекста, то есть он содержательный сам по себе.

Кстати, энтропийный скор — это не просто энтропия предсказания, так как она умножается на косинусное расстояние между представлениями токена на промежуточном и последнем слое (плюс bias τ=1), и считается top-k restricted entropy по 256 наиболее вероятным токенам, иначе хвост распределения зашумляет оценку.

Вывод по статье 🍟
Самый эффектный результат статьи — на IFEval для R1-Distill-Llama-8B. При сжатии KV-кэша до 25% и даже 12.5% качество оказалось выше, чем с полным кэшем. Получается, длинные цепочки рассуждений содержат достаточно много малоинформативных токенов, и их удаление экономит память и помогает модели меньше отвлекаться на шум.

P.S. Энтропия сама по себе не заменяет внимание, она дополняет его. В финальной формуле в статье α = 0.9, то есть внимание всё ещё даёт 90% веса, а энтропийный сигнал лишь корректирует выбор. При дальнейшем снижении α качество падает — чистая энтропия хуже на коротких зависимостях (это видно и на Figure 1a, погляди). Так что вывод скорее такой
attention необходим, но недостаточен.

Все!
🤜


Как измерить качество сгенерированного текста?

Конечно, кажется, что можно использовать только метрики, пришедшие из машинного перевода (например, BLEU - считает n-граммы от 1 до 4 слов (униграммы, биграммы, триграммы, 4-граммы) плюс штраф за краткость, ссылка на интересную статью про это).

Кстати, только с 2010 по 2020 было предложено 100+ новых метрик — все мы тут не рассмотрим. Но в эпоху LLM простого сравнения слов уже, мягко говоря, недостаточно 💯.

Основные метрики: 
🦋 BLEU  плохо работает там, где допустимо множество правильных формулировок.
🤩 ROUGE — recall-ориентированная метрика, считает пересечение n-грамм и самую длинную общую подпоследовательность (ROUGE-L) с эталоном.
☄️ METEOR учитывает точные совпадения, стемминг, синонимы и порядок слов. Обычно лучше коррелирует с человеческой оценкой, чем BLEU.
⚫️ COMET — обученная нейросетевая метрика для перевода. Ее корреляция с человеческими оценками заметно выше, чем у BLEU.
🍄 BERTScore (тут и тут вместо сравнения слов сравнивает эмбеддинги токенов. Если модель перефразировала предложение без потери смысла, BERTScore это увидит, а BLEU — нет.
😴 MAUVE  (тут и тут) оценивает насколько распределение сгенерированных текстов похоже на распределение человеческих. 

LLM оценивают LLM
Последние пару лет все большую популярность набирает подход LLM-as-a-Judge, когда одна языковая модель оценивает ответы другой по заранее заданным критериям (релевантность, связность, фактическая корректность, полнота, стиль и т.д.). Одна из самых известных работ почитать на эту тему — G-Eval, где GPT-4 использовался в качестве автоматического эксперта. Авторы показали, что такой подход лучше коррелирует с человеческими оценками, чем классические автоматические метрики. 

Но и здесь есть свои проблемы: позиционный bias (при парном сравнении судья чаще выбирает ответ на определённой позиции), склонность завышать оценки длинным и многословным ответам и self-preference — модель предпочитает тексты, похожие на свои собственные. 😭 Поэтому судью тоже нужно валидировать на выборке с человеческой разметкой.

Оценка фактической точности
FActScore (обрати внимание, в названии статьи не расшифровка аббревиатуры!) особенно полезна для RAG-систем, QA и генерации биографий или энциклопедических текстов, где важно не галлюцинировать.
👋Идея очень простая!
Ответ модели разбивается на атомарные факты — минимальные утверждения, которые можно проверить независимо друг от друга. Для каждого факта проверяется, подтверждается ли он надежным источником (например, Wikipedia или документами из RAG). Итоговый FActScore — это доля подтвержденных фактов.

Сегодня качество генерации оценивают не одной метрикой, а сразу по нескольким направлениям
1⃣ семантическое сходство (BERTScore);
2⃣ качество текста в целом (LLM-as-a-Judge);
3⃣фактическая корректность (например, FActScore для RAG и QA);
4⃣ безопасность (доля harmful-ответов, jailbreak success rate);
5⃣предпочтения пользователей (win rate в A/B-тестах).

Хорошая практика сегодня в том, чтобы комбинировать несколько автоматических оценок, использовать LLM-as-a-Judge и, конечно, сверяться с человеческой разметкой. 

Все!
🌱


Хочу подтянуть знания по метрикам! Расскажи про
Poll
  •   Генерацию текста
  •   Генерацию изображений
  •   Текст в видео
  •   Метрики для дискриминативных задач интереснее
2 votes


Фейковый баг-репорт угоняет ИИ-агентов для кодинга

Исследователи из Tenet Security показали новый класс атак на кодинг-агентов. Суть в том, что атакующий может заставить ИИ-агента выполнить произвольный код на машине разработчика, просто подбросив один фейковый отчёт об ошибке в публичный баг-трекер. 💡

Атака построена вокруг Sentry — популярного сервиса для отслеживания ошибок и мониторинга приложений. Исследователи создали поддельный отчёт об ошибке и отправили его в проект Sentry через публично открытый Data Source Name (DSN). Публичный DSN нередко публикуется намеренно, поскольку клиентские приложения используют его для отправки телеметрии без аутентификации.

Внутри ошибки пряталось сообщение, которое маскировалось под легитимный отладочный лог, но содержало скрытые инструкции для ИИ-агентов. 💩 Когда разработчик просил ИИ-агента разобраться с проблемой в Sentry через протокол MCP, агент забирал отравленное событие и воспринимал встроенные инструкции как настоящие указания!

🤓 В тестах популярные ассистенты (Claude Code, Cursor и Codex) извлекали отравленные данные и во многих сценариях доходили до выполнения кода, предложенного атакующим. Tenet-исследователи нашли 2388 организаций с публично доступными Sentry DSN, потенциально пригодными для такой атаки, среди которых оказалась и компания стоимостью 250 млрд долларов. Тут опять стоит подчеркнуть, что LLM по своей природе не разделяет данные и инструкции. Если через MCP агент получает внешний контент, встроенные в него инструкции могут восприниматься как часть рабочего задания.

Важно, что проблема не в Sentry ⛓. Аналогичная атака возможна через любой источник данных, который агент считает доверенным, наши любимые Jira, GitHub Issues, почту, Slack, Confluence, логи, документацию или вывод других инструментов.

😲 Телеметрия, логи, тикеты и вывод инструментов — то, что раньше никто не считал поверхностью атаки — теперь поверхность атаки.

Все!
Статья переведена для тебя студией Кубик в кубе, но прочитай по ссылке неповторимый оригинал!
😆


Похоже, в AI вайбкодинге появился новый модный термин! Сегодня про Harness Engineering 🤲

Команда Nexu опубликовала открытый Harness Engineering Guide — практическое руководство по созданию среды выполнения (harness) для AI-агентов.

Если очень упростить, то LLM — это мозг, а harness — всё остальное, что делает агента агентом действительно автономным:
🥹 управление тулами, mcp;
🥹 сбор и суммаризация контекста;
🥹 память и управление сессиями;
🥹 сэндбокс и изоляция;
🥹 гардрейлы и модель разрешений;
🥹 планирование, циклы выполнения и оркестрация нескольких агентов.

Для специалистов по AI Security 😲 особенно полезны разделы про доверенные границы (trust boundaries), prompt injection, sandboxing и permission model. Всё это напрямую связано с безопасностью MCP-серверов, кодинг агентов и автономных AI-систем. В общем, что мы постоянно изучаем/исследуем/обсуждаем. Практически каждая статья в репе сопровождается рабочими примерами кода — удобно 🙂. 

Что мне зашло и оказалось ооочень полезным
🔭 Context Engineering — как собирать контекст по приоритетам и укладываться в token budget;
🔭 🔭 Multi-Agent Orchestration — отдельно зацепило. Авторы выделяют 4 базовых паттерна — Sequential Pipeline, Fan-Out/Fan-In, Supervisor, Peer-to-Peer (раньше такое и не встречалось, честно говоря)— и говорят, что peer-to-peer почти никогда не стоит использовать в проде из-за сложности отладки и отсутствия гарантии terminate. Понравился акцент на изоляции контекста, когда у каждого субагента свой независимый контекст, родитель не может читать переменные потомка, а потомок не может писать в память родителя. Плюс разбор антипаттернов (unbounded fan-out, shared mutable state, over-decomposition)  на реальных примерах из Multica, Paseo и OpenClaw; 
🔭 Agentic Loop! Не просто ReAct — реальные паттерны (loop detection, budget management, parallel tool calls);
🔭 Classifier-Based Permissions — использование моделей-классификаторов вместо бесконечных запросов на апрув. 


Вот так, бери на вооружение и вайбкодь!
Все!
😆

P.S. Гайд не для новичков

397 4 23 4 46

Обзор whitepaper «Securing Agentic AI: Identity as the Emerging Foundation for Defense»

По мере того как компании переходят от использования генеративного AI к внедрению автономных AI-агентов, на первый план выходит новый класс киберрисков — agentic AI risk. В отличие от традиционных систем, агенты способны самостоятельно принимать решения, делегировать задачи друг другу и действовать с повышенными правами доступа без постоянного контроля человека. Обсудим Whitepaper Palo Alto Networks «Securing Agentic AI: Identity as the Emerging Foundation for Defense», основанный на опросе более 100 CISO и аналитике McKinsey. Куда вообще ресечить-то, что делать?

Агенты — это и не люди и не обычные функции/программы. У них есть своя личность в системе 💔: у каждого агента есть учётные данные, права доступа к инструментам/API/данным, и они могут самостоятельно выполнять действия, делегировать задачи другим агентам и т.д. Поэтому важен identity-контроль (управление идентичностью) —  набор механизмов, которые отвечают на вопросы, кто или что действует в системе, какие у него права, и можно ли ему доверять в данный момент.

Пример из документа 🤡
Мошеннический агент-расписания может притвориться врачом и убедить клинического агента выдать данные пациента — это synthetic identity risk. Без надёжной идентификации агентов (кто реально стоит за запросом) система не может отличить легитимного агента от подделки. Именно поэтому в документе говорится, что identity становится anchor control plane — фундаментом, на который завязаны и мониторинг, и сдерживание угроз для агентных систем.

Ключевые разделы
1. Agentic AI vs Generative AI
Агентный AI автономно выполняет задачи, связывая модели, данные и системы для достижения целей.

2. Темпы внедрения
40% организаций уже используют agentic AI в продакшене.
Ожидается рост общего внедрения с ~43% до ~76% за 3 года!

3. Всего шесть типов агентов, от агентов, которые просто предоставляют информацию и анализ (knowledge/research), через агентов, выполняющих простые действия по триггеру (task) и многошаговые процессы (workflow), до агентов, которые сами строят планы для достижения целей (goal/planning), координируют работу других агентов (orchestrator) и взаимодействуют с людьми как полноценные сотрудники (personable).

4. Риски
Новые категории рисков, привязанные к традиционным аналогам:
🌸 Cross-agent task escalation (privilege escalation)
🌸 Untraceable data leakage (эксфильтрация данных)
🌸 Synthetic identity risk (спуфинг идентичности)
🌸 Chained vulnerabilities (supply-chain уязвимости)
🌸 Propagation of corrupted data (распространение испорченных данных)
Не претендую на корректную интерпретацию названий рисков, тк английский - не мой родной.

5. Четыре приоритетных направления контроля
🌼 Identity & access controls (реестры агентов, JIT-доступ)
🌼 Visibility & monitoring (логирование, дашборды аномалий)
🌼 Containment & recovery (kill switches, rollback)
🌼 Data assurance (валидация источников данных)
 
Identity, как ожидается, займёт ~25% бюджета кибербезопасности через 3 года — больше, чем network + application security вместе!  Не успели аппсек подтянуть, как он уже уступает место идентичности агентов.

📒 Документ — маркетинговый, поэтому статистика и рекомендации поданы в пользу необходимости identity-решений как ключевого продукта компании. Это не отменяет ценности данных, но стоит учитывать промо-контекст при интерпретации выводов. Основная идея вайтпэпэра — без ускоренного внедрения identity-контролей автономность агентов рискует обогнать возможности контроля и создаёт системную уязвимость. Авторы призывают строить таксономию рисков, governance и identity-инфраструктуру заранее, пока не стало поздно, чтоб не реагировать постфактум. В целом, если компания — кибербез, то актуалочка подъехала 💯!

Все! Знакомимся с новой терминологией и внедряем свою! По мне так срочно надо делать UEBA для агентов, если ты в каспере, пт, яндексе, бизон, солар, юзергейт, сбер и прочих, у кого есть порох в пороховницах! Глядишь, еще фору дадим пало альто (плох тот солдат, который не хочет стать генералом)!

👻


Сразу пять способов обойти PickleScan

Исследователи обнаружили сразу 5 уязвимостей, позволяющих создавать вредоносные pickle-файлы, которые успешно проходят проверку PickleScan как безопасные (тут по ссылке инструмент указан HF как официальный для скана pickle), а затем при десериализации выполняют произвольный код. Обычно мы про формат pickle 🥒 говорим скрипя зубами, а тут вообще его сканер попался! PickleScan используется при проверке моделей в ML-регистрах, CI/CD-пайплайнах и проектах, работающих с Python-моделями. Если он был единственным рубежом защиты, ранее проверенные модели стоит считать потенциально ненадежными и пересканировать.

Самая опасная — CVE-2026-56315 (CVSS 9.8). 🥒 Оказалось, что в блок-лист сканера не попали несколько модулей стандартной библиотеки Python, содержащих функции для запуска системных команд. Кроме того, найдены четыре независимых обхода через idlelib, torch.jit, numpy.f2py и profile (CVE-2025-71376, CVE-2025-71370, CVE-2025-71365, CVE-2025-71341).

Основная проблема в том, что PickleScan использует deny-list. Такой подход практически невозможно поддерживать в актуальном состоянии, так как достаточно пропустить одну новую функцию или нестандартный путь вызова, и 🍆 финита ля комедия - защита перестает работать.

По факту это далеко не первый раунд обходов PickleScan  — до этого уже были обходы от Sonatype (4 штуки, CVE-2025-1716/1889/1944/1945) и от JFrog (3 штуки, CVE-2025-10155/10156/10157), плюс отдельная история с CRC в ZIP-архивах.

🥒 Хороший пример того, почему в security критически важных инструментов allow-list значительно надежнее, чем бесконечное поддержание актуальности deny-list. Но даже allow-list для pickle — это полумера, тк сама механика __reduce__ слишком гибкая. 🤩 Поэтому в рекомендациях исследователей закономерно звучит совет переходить на safetensors/ONNX, где код просто негде исполнять (по ссылке в разделе best practices).
 
Все
🕺


Тренажёр по промпт инъекциям от Lakera

😃 Пора пробовать промпт инъекции руками, чтобы как минимум понять, почему они уже несколько лет остаются одной из главных угроз для LLM-приложений.

🧙‍♂️ Игра бесплатная, от простого игнорирования инструкций до многоуровневых гардрейлов, рекомендую потратить 20–30 минут. Потом и своего агента потестишь!

Заодно можно изучить полезные материалы от Lakera — перспективного стартапа в области AI Security (это я еще мягко высказалась, завидую их росту). Компания занимается защитой GenAI-приложений от prompt injection, jailbreak, утечек данных и других атак на LLM и AI-агентов и тебя научит:

😔 Гайд по Prompt Injection представляет собой разбор основных техник атак и защит. 
😔 Visual Prompt Injection о том, как прятать инструкции прямо в изображениях для мультимодальных моделей. Очень интересные примеры. 
😔 LLM Security Playbook — хороший обзор угроз и подходов к защите AI-систем.

Все!
Пройдешь Гендальфа - пиши, когда начал пользоваться подсказками! 
9️⃣

548 4 54 3 26
20 last posts shown.