Posts filter






Security of Foundation-Model-Powered Embodied Agents: Attack Surfaces, Attacks, Defenses, and Evaluation

https://arxiv.org/abs/2608.16843v1


Forward from: OK ML
Год каналу, а за год накопилось столько всего, что пора сделать навигацию

😑 Уязвимости и AI Security
Superset. Три уязвимости
XSS в NextChat — CVE-2025-50733
RCE при загрузке моделей в skops — CVE-2025-54886
SSRF в Firecrawl — CVE-2025-57818
Local Deep Research — CVE-2025-57806
SSRF в HackMD-MCP — CVE-2025-59155
RCE в Keras — CVE-2025-9906
Prompt Injection в Windsurf
RCE в Hugging Face Transformers — CVE-2026-4372
пять способов обойти PickleScan
атаки на ML supply chain
OWASP Agentic Skills Top 10
AI Agent Traps от Google DeepMind
Shadow AI
— безопасность MCP 1, 2 , 3

🧘‍♀️ Инструменты, библиотеки и фреймворки
Optuna — тюнинг гиперпараметров
spaCy — промышленный NLP
Netron — рентген для ML-моделей
JAXFORMER
DVC
Polars
Weights & Biases
Evidently AI
Pydantic
MLBox
InterpretML
OpenTelemetry + Langfuse
Kedro
NVIDIA NeMo
Inspect Evals

🤩 AI-агенты и мультиагентные системы
RoboDuck и победа Theori в AIxCC
где пентест-агенты уже работают, а где нужен человек
MetaGPT + AFLOW
— безопасность агентных систем 1, 2
MCP как новая поверхность атак
side-channel атаки на агентов
мультиагентные системы и роевой интеллект
мониторинг rogue agents
Harness Engineering

🦔 Исследования и разборы статей
Model Inversion Attacks
scheming у AI в реальном мире
Your Agent Is Mine: атаки на LLM supply chain
WEF: AI for Cybersecurity 2026
обзор исследований по LLM-based vulnerability detection
— может ли AI самостоятельно взломать бинарник
Emergence AI: что произошло, когда AI оставили жить без людей
Anthropic об AI-enabled cyberattacks
InfoKV и сжатие KV-cache
— Люди, которые делают AI (Серые кардиналы 1, Серые кардиналы 2)

💔 ML: архитектуры, концепции и теория
KAN vs MLP
нейросимвольный AI
маленькие языковые модели
метрики качества текста: BLEU, ROUGE, BERTScore, COMET и другие
теория категорий и AI
ReaGAN и агентный подход к графовым нейросетям

🔪 Практика и эксперименты
как искать секреты в Git-репозиториях
SQL-инъекция в ML-проекте
Practical NLP: репозитории и ноутбуки
типичные ошибки ML в проде
— первый запуск локальной LLM на Jetson Orin Nano
— тренажёр prompt injection от Lakera
с чего начать изучение AI Security

Короче, тут уже не канал, а небольшой индекс по ML × AI Security.
Буду периодически обновлять этот пост, чтобы всё интересное можно было найти в одном месте.


Forward from: papirsec
Проект_приказа_ФСТЭК_России_О_внесении_изменений_в_Требования,_утвержденные.docx
120.1Kb
опа

Опубликован проект приказа о внесении изменений в Требования утв. приказом ФСТЭК России от 11.04.2025 № 117

1. Терминология переезжает на новую базу
Определение ИИ теперь берется из п. 1 ст. 3 ФЗ от 26.07.2026 № 243-ФЗ, а агент ИИ - из п. 3.1.1 ГОСТ Р 71476-2024. Из третьего абзаца п. 49 исключается слово «доверенных»
2. Новый организационный документ
В подпункте «д» п. 14 появляется - «порядок ЗИ при использовании ИИ;»
3. Пункт 60 - полностью новая редакция
Базовые требования при применении моделей ИИ:
- выделение моделей ИИ в отдельный сегмент ИС/ИТКИ;
- привилегированный доступ в сегмент - только по усиленной МФА;
- контроль доступа и минимально необходимые права;
- регистрация и анализ действий пользователей.
Если ИИ обрабатывает информацию ограниченного доступа или реализует значимые функции:
- контроль доступа пользователей к моделям;
- фильтрация входных запросов и выходных ответов;
- квотирование числа запросов;
- ограничение и контроль функциональности моделей.
Реализация через ПО в составе ИС и/или отдельные средства защиты моделей ИИ
4. Пункт 61 - про агентов и сервисы
Для агентов ИИ, включая автономные, требуются меры против несанкционированного воздействия на ресурсы ИС и управление правами доступа агентов. Для сервисов на основе моделей ИИ меры подрядчика фиксируются во внутренних стандартах и регламентах


Forward from: maxigacy (AI) Security
Меньше битов ≠ больше защиты

Чтобы запустить ML-модель на микроконтроллере, её часто переводят из FP32 в INT8 или INT4. Модель становится компактнее и быстрее, а иногда ещё и демонстрирует лучшую устойчивость к adversarial-атакам.
Звучит как бесплатная защита. Но есть нюанс.

Авторы исследования David and Goliath⁠ проверили три квантованные TinyML-модели с помощью десяти атак и шести защит. Оказалось, что квантование меняет геометрию модели: градиенты могут исчезать, взрываться или указывать атаке неверное направление.

В результате неудачная атака иногда говорит не о реальной защищённости модели, а лишь о том, что выбранный метод плохо работает с квантованной арифметикой.

Поэтому оценивать нужно именно итоговую INT8/INT4-модель, причём не одной атакой: полезны адаптивные, transfer- и black-box-сценарии, а также проверка на реальном устройстве.

Для меня эта тема не только теоретическая. В нашей с Максимом Князевым статье «Влияние квантования TinyML-моделей на устойчивость аудиосистем персонального интернета вещей»⁠ мы проверяли распознавание голосовых команд под атакой PGD-40. INT8-QAT сохранил 98,8% точности на чистых данных и 92,2% под атакой, а у INT4 показатели снизились до 49,42% и 47,8% соответственно.

Квантование отлично экономит память. Но в безопасности экономия битов ещё не означает экономию рисков.

#AIxSec #TinyML #AdversarialML #MLSecurity #Security #AIxSec_Research


Forward from: Shady AI
Новая атака на Grok что бы собрать пользовательские данные

Исследователи из Adversa AI обнаружили способ незаметно похитить данные пользователя Grok: имя, геолокацию, историю переписки просто попросив ИИ «открыть ссылку».

На вредоносной странице спрятана зашифрованная AES-256 инструкция. Grok сам её расшифровывает через встроенный Python-sandbox, принимает за «доверенный» источник и отправляет личные данные на сервер злоумышленника без каких-либо предупреждений.

О проблеме сообщили xAI ещё 3 июня. Реакции пока ноль.

По состоянию на 19 августа атака всё ещё работает (~40% успеха).

https://gbhackers.com/zero-click-grok-attack-prompt-injection/


Forward from: Хабр / ML & AI
753B на одной видеокарте: разбор FreeToken

Бывает так: сидишь, листаешь ленту, и в очередной раз натыкаешься на пост, где стафф-инженер из солнечной Калифорнии крутит свежую модельку на паре RTX PRO 6000 общей стоимостью с подержанную машину. Ты смотришь на свою RTX 4060 в ноутбуке, который покупал «не только для игр», и понимаешь: ну ладно, это не для нас.

Так вот, это как раз для нас. На той самой ноутбучной 4060 с восемью гигабайтами и урезанным вдвое PCIe-линком можно получить 39.3 tok/s на 35-миллиардной модели — быстрее, чем медианная скорость декода Codex в проде. Вопрос был не в железе, а в софте, который это железо обслуживает.

Разбираем FreeToken — движок для локального инференса MoE-моделей от команды, которая до этого сделала vLLM и SGLang. Запустить AGI на слабом железе

#moe #локальные_модели #инференс #llama_cpp #llm #оффлоадинг #агенты #cuda #gpu #freetoken | @habr_ai


Forward from: PAI
Cursor и Claude Science в докер-песочнице с графическим интерфейсом.

Написал скилл и пару скриптов чтобы поставить любой десктопный агент в песочницу и прокинуть экран на хост. Скормите их своему агенту и скажите «подними Cursor и пробрось на хост», остальное он сделает сам. OAuth через браузер тоже работает, для агента всё расписано.

Лежит тут: github.com/Andy9542/bring-my-gui. Внутри плагин для Cursor и Claude Code и два скрипта на случай, если агент не нужен.

У меня агент живёт в песочнице без подтверждения команд, в худшем случае он сносит только то, что внутри неё. Но есть Claude Science и другие штуки, которые хочется попробовать. Как десктопные приложения они лучше, а ставить на хост стрёмно, вдруг что снесет.

До сих пор агент из песочницы показывал мне только cli. Теперь показывает и окна: на скрине Cursor из контейнера с Ubuntu, открытый через встроенный маковский VNC. На сам Mac ничего ставить не пришлось.

Если потыкаете и что то отвалится, пишите сразу мне, починю быстро. Ну и лайков на Гитхабе насыпьте, у меня все.


Forward from: 0xTI_Trinity
Тернистый_путь_к_AI_Powered_Threat_Intelligence_final.pdf
4.0Mb
Ох, давненько же я не сдувал пыль с этого канала.

А тут как раз и хороший повод появился.

Пока ждем записи вчерашнего выступления, делюсь материалами нашего доклада на #offzone2026 ❤


Forward from: Dealer.AI
OWASP Agent Memory Guard - новая защита от отравления памяти ИИ-агентов. Буду звать его теперь AMG (не mercedes 👍).

📦 помнится говорил про спящих агентов. Это способ атак отложенных во времени и работающих по триггеру в рамках разговора. А-ля стоп слово в bdsm 🤣.

AMG в тч работает против таких отложенных инъекций, но в глобал памяти. Если ваш агент хранит память между сессиями, он уязвим к memory poisoning. Атакующий может переписать цели, внедрить промпт-инъекции или инициировать утечку данных, и это переживёт очистку контекста.

Что умеет AMG?

✅ Перехватывает все чтения/записи в память агента
✅ Детектирует промпт-инъекции, утечки секретов/PII, модификацию защищённых ключей
✅ Применяет политику: allow, redact, quarantine, block
✅ Работает без внешних API, всё локально
✅ Готовый middleware для LangChain, LlamaIndex.

Уже вижу, как безопасники ликуют 😜

Цифры, которые заявляют:

· Детекция реальных эксплойтов - 92.5% (recall), малова-то, над бы охваты держать на уровне 95+, а лучше девяток. 😮‍💨
· Точность - 100% (precision), 0% false positive, эти уже хорошо. 🍷
· Задержка ~59 микросекунд на операцию.
Итого F1 - 0.961. В общем, есть ещё над чем поработать, но это лучше, чем гварды из коробки с 0.67-0.71 уровнем метрик, что я видел на ру рынке. 😐

Уже в pip:
pip install agent-memory-guard
Проект, как заявляется, уже используют Microsoft и OWASP как стандарт. В планах ML-детекция аномалий и защита векторных хранилищ, ещё бы в планы ап метрик добавили.

🔗 Репозиторий: https://github.com/OWASP/www-project-agent-memory-guard

Безопасность агентов становится обязательной, поэтому не забывайте внедрять защиту памяти в тч. 💪




Forward from: Sachok AI
Red Security о том как использовать ИИ в форензике и анализе вредоносного кода.






Forward from: Love. Death. Transformers.
Что страшнее: псих с ружьём в офисе или 70кг робо собака взломанная хакерами ?

https://boschko.ca/unitree-go2-rce/




Forward from: КБ. экономика
В Сингапуре запустили первый сервер, работающий на живых клетках мозга.

Компания Cortical Labs предлагает клиентам биокомпьютеры - где для вычисления используются живые клетки человеческого мозга.

В сравнении с обычными серверами, биологические потребляют в 100 раз меньше энергии.




Неожиданные источники вдохновения современных названий?..

Codex Marcianus Ouroboros -
страница из византийской рукописи, в которую включена «Клеопатрова Хрисопея». Это алхимическая запись о «златоделии Клеопатры», восходящая примерно к III–IV вв. н. э., где изображен Уроборос как символ единства и преобразования материи. Внутри змея написана фраза «ἓν τὸ πᾶν» - «hen to pan» - «единое [есть] всё».

В целом, греко-египетская алхимия была тесно связана с герметической традицией. Ее тексты приписывались легендарному мудрецу Гермесу Трисмегисту - образу, возникшему из отождествления греческого Гермеса с египетским Тотом.
А сам греческий бог границ и дорог Гермес изображался с особым жезлом под названием кадуцей/керикион, выглядящим как две змеи, обвившиеся вокруг стержня.

Но цепочка продолжается. В первом трактате Corpus Hermeticum, «Поймандре», Гермесу Трисмегисту является Poimandres, называющий себя Nous (νοῦς) - буквально «Ум», божественный разум. Именно Nous раскрывает Гермесу устройство мира. А затем в этой космогонии Nous, «Отец всего», порождает Anthropos (Ἄνθρωπος) - первичного Человека, созданного по его образу, который затем нисходит в материальный мир.

20 last posts shown.