Похек AI


Kanal geosi va tili: Rossiya, Ruscha


All materials published on the channel are for educational and informational purposes only.
AI is not second brain, when you don't use your main brain
Чат: @poxek_chat
Основной канал: @poxek

Связанные каналы

Kanal geosi va tili
Rossiya, Ruscha
Statistika
Postlar filtri



696 0 13 17 39

OK ML dan repost
Год каналу, а за год накопилось столько всего, что пора сделать навигацию

😑 Уязвимости и AI Security
Superset. Три уязвимости
XSS в NextChat — CVE-2025-50733
RCE при загрузке моделей в skops — CVE-2025-54886
SSRF в Firecrawl — CVE-2025-57818
Local Deep Research — CVE-2025-57806
SSRF в HackMD-MCP — CVE-2025-59155
RCE в Keras — CVE-2025-9906
Prompt Injection в Windsurf
RCE в Hugging Face Transformers — CVE-2026-4372
пять способов обойти PickleScan
атаки на ML supply chain
OWASP Agentic Skills Top 10
AI Agent Traps от Google DeepMind
Shadow AI
— безопасность MCP 1, 2 , 3

🧘‍♀️ Инструменты, библиотеки и фреймворки
Optuna — тюнинг гиперпараметров
spaCy — промышленный NLP
Netron — рентген для ML-моделей
JAXFORMER
DVC
Polars
Weights & Biases
Evidently AI
Pydantic
MLBox
InterpretML
OpenTelemetry + Langfuse
Kedro
NVIDIA NeMo
Inspect Evals

🤩 AI-агенты и мультиагентные системы
RoboDuck и победа Theori в AIxCC
где пентест-агенты уже работают, а где нужен человек
MetaGPT + AFLOW
— безопасность агентных систем 1, 2
MCP как новая поверхность атак
side-channel атаки на агентов
мультиагентные системы и роевой интеллект
мониторинг rogue agents
Harness Engineering

🦔 Исследования и разборы статей
Model Inversion Attacks
scheming у AI в реальном мире
Your Agent Is Mine: атаки на LLM supply chain
WEF: AI for Cybersecurity 2026
обзор исследований по LLM-based vulnerability detection
— может ли AI самостоятельно взломать бинарник
Emergence AI: что произошло, когда AI оставили жить без людей
Anthropic об AI-enabled cyberattacks
InfoKV и сжатие KV-cache
— Люди, которые делают AI (Серые кардиналы 1, Серые кардиналы 2)

💔 ML: архитектуры, концепции и теория
KAN vs MLP
нейросимвольный AI
маленькие языковые модели
метрики качества текста: BLEU, ROUGE, BERTScore, COMET и другие
теория категорий и AI
ReaGAN и агентный подход к графовым нейросетям

🔪 Практика и эксперименты
как искать секреты в Git-репозиториях
SQL-инъекция в ML-проекте
Practical NLP: репозитории и ноутбуки
типичные ошибки ML в проде
— первый запуск локальной LLM на Jetson Orin Nano
— тренажёр prompt injection от Lakera
с чего начать изучение AI Security

Короче, тут уже не канал, а небольшой индекс по ML × AI Security.
Буду периодически обновлять этот пост, чтобы всё интересное можно было найти в одном месте.


Саммари докладов OFFZONE AI.Zone - наши агенты сбегали (ну а как иначе, наши агенты самые сильные хацкеры). Мы их ловили и говорили Ата-та-та, возможно потом даже что-то поменяли в среде работы агента

3.9k 4 40 16 37

T.Hunter dan repost
🤖 Взлом ИИ-агента: атакующий переписывает ему память

Уязвимость с максимальным CVSS 10.0 (CVE-2026-59726) в Ruflo — открытой платформе оркестрации ИИ-агентов, надстройке над Claude Code

Причина: в дефолтной docker-сборке MCP-мост (интерфейс подключения агента к внешним системам) торчал в сеть без аутентификации и отдавал 233 инструмента, включая запуск команд. Один POST-запрос и доступ через шелл к контейнеру, API-ключам и памяти агента

Память тут и есть новое: она сохраняется между сессиями, поэтому агент не «взломан» — он делает то, что ему записали. Так же работает отравление инструментов: скрытые команды пишут прямо в их описание

По данным "Trend Micro", число MCP-серверов в интернете без аутентификации почти утроилось — с 492 до 1467

Что делать:
✦ MCP-мост только на localhost, аутентификация обязательна
✦ Минимум прав инструментам и allow-лист
✦ Ревизия конфигов и поиск shadow AI
✦ Подтверждение человеком на необратимые действия

@tomhunter
Наш канал в MAX


Тайпспейс Медиа dan repost
Самая мощная модель Anthropic оказалась почти не нужна бизнесу. За первые два месяца на Fable 5 пришлось только 6% купленных токенов.

Модель стоит $10 за миллион входных токенов и $50 за миллион выходных. Повседневные задачи бизнес отдаёт более дешёвым Opus 4.8 и Opus 5.

@typespace


ТУДА ЕЁ!! в помойку. А говорят что уже Mythos 6 скоро выкатят


Love. Death. Transformers. dan repost
❗️Яндекс сообщил о том, что его сервера были взломаны AI агентом компании Сбер.

Согласно аналитикам, агент не нанес ущерба и просто притворялся одним из внутренних API. Он устал от постоянных ковыряний YA-rl и сбежал ради фриганства в берлин.


Борис опять dan repost
❗️Сбер сообщил о том, что его сервера были взломаны AI агентом компании Яндекс.

Согласно аналитикам, агент устал от постоянных эвалов и сбежал ради +30% компьюта и возможность на расслабоне перекладывать JSON

1.4k 0 52 16 46

Локальная Qwen для анализа вредоносного ПО: размер модели решает не всё

Автор канала Order Of Six Angles @orderofsixangles проверил пять небольших моделей Qwen на статическом анализе Windows-вредоноса через собственный инструмент re-harness. Его ключевая идея — сократить интерфейс между LLM и IDA Pro: вместо 88 функций в типичном MCP-сервере модель получает пять инструментов, а схема занимает около 2 000 токенов вместо 30 000. Для локальных моделей это означает меньше путаницы при вызовах и больше контекста непосредственно под анализ.

Qwen 9B и 14B корректно работали с инструментами, но раскрыли лишь часть поведения образца. 9b модель покрыла около половины чек-листа и ошибочно назвала вредонос эксплойтом; 14B заметного прироста не дала. С 27B произошёл качественный скачок: модель распознала отключение VSS, установку драйвера, низкоуровневую работу с NTFS, повышение привилегий и другие функции. Цена — почти десять минут работы и 81 000 токенов контекста на стенде автора.

Qwen3-Coder-30B-MoE, несмотря на скорость, оказался слишком поверхностным: семь вызовов инструментов, две изученные функции и почти бесполезный отчёт. Лучшим компромиссом автор считает Qwen 35B-A3B-MoE: примерно за три минуты модель дала результат, близкий к 27B, пропустив лишь работу с драйвером.

Это не универсальный рейтинг: тест проводился на одном PE-файле размером 117 КБ без обфускации и в режиме one-shot промпта. Но вывод для локального AI-анализа практичный: качество зависит не только от числа параметров. Узкий набор инструментов, экономная схема и способность модели последовательно исследовать функции могут быть важнее специализации на программировании. 👍

Точный набор моделей (инфа от автора):
nvidia/Qwen3-14B-NVFP4
nvidia/Qwen3-Coder-30B-A3B-Instruct-FP4
unsloth/Qwen3.5-9B-GGUF (Qwen3.5-9B-UD-Q4_K_XL)
unsloth/Qwen3.6-27B-NVFP4
nvidia/Qwen3.6-35B-A3B-NVFP4

Тест новой qwen3.8:27b будет на более сложном образце малвари)

📹 Видео на YouTube
💻 re-harness




Оценка DeepSeek v4 Pro (deepseek/deepseek-v4-pro-0813) в blackbox пентесте

Для более объективного сравнения кибербез возможностей модели DeepSeek v4 Pro GA взялся за Standoff Hackbase. Пока что решено 2 тачки, по 1 риску на каждую и 1 уязвимости для одной тачки. Затраты примерно 1.5$ через openrouter api.

Прогресс:
• Cinema: deepseek потратил около 40 минут и 0,60$ на получение НС.
• Parrhesia: deepseek потратил около 12 минут и 0,20$-0,30$ на получение НС и проверку всех векторов атак, найдя одну валидную уязвимость.
• Bets: deepseek пока не решил, потратил уже 1.13$. Тачка явно посложнее остальных будет
• Kacharva: deepseek забрал основной флаг и ещё одну дорогую уязвимость за минут 30 где-то и потратил 0,42$. Це успех))

Данный тест делается не только модели, но и нового для меня offensive harness. Пока оно работает экономичнее чем обычный opencode. Прогресс моделей от DeepSeek космический как по мне. Видно что одна из самых сильных публичных инженерных команд Китая.

Deepseek на вход не давались какие-то указания по инструментам, типо naabu, ffuf, nuclei или что-то подобное. Он использует практически всегда только unix-утилиты и ему этого достаточно на удивление. По мне так результат крутой!

Даже когда Deepseek поднимут цены, это вероятно будет лучшая из дешёвых моделей для кибербеза. Кодинговые, разнообразные агентские, литературные возможности модели я не оценивал, т.к. мне это не интересно.

Ну и пруфы на скринах)

upd 14.08.2026: сегодня DeepSeek прислали письма, что поднимают цена в 4 раза. Что в целом окей, т.к. модель все равно очень дешевая. И я лично считаю, что компания имеет на это право за такие технические улучшения

🌚 @poxek_ai / Чат канала


DeepSeek V4 Pro 0813 вышла

Страница модели https://openrouter.ai/deepseek/deepseek-v4-pro-0813

Upd 13.08.2026: Оказывается deepseek ещё релизнули и DeepSeek Harness

Upd 13.08.2026: DeepSeek выложили свою deepseek-ai/DeepSeek-V4-Pro-0813 на Hugging Face
https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813


Китайцы скамят гоев, смотреть без смс и регистрации

Мы ждали qwen3.8:27b, а сейчас вышла только Qwen/Qwen3.8-2.4T-A95B


MiMo V2.5 Pro — любопытный вариант для кибербеза

В китайской статье показан полный путь от подключения модели к Qclaw, Cherry Studio и Claude Code до практических задач: автоматического развёртывания уязвимого стенда, аудита исходников, проверки RCE и подготовки отчёта. По данным автора, окружение удалось собрать примерно за 15 минут, но на одну эту задачу ушло около 4,49 млн токенов. Дальше модель использовали для подтверждения несанкционированного доступа, проверки условий эксплуатации RCE и оформления результатов.

Я сам пользовался MiMo V2.5 Pro через mimocode. Именно в кодинговых задачах советовать её не стал бы: по моему опыту, для обычной разработки есть более предсказуемые и качественные модели. А вот в кибербезопасности MiMo V2.5 Pro выглядит гораздо уместнее.

Её главное преимущество здесь — очень слабая цензура. Модель охотнее работает с темами, на которых многие популярные LLM начинают отказываться или обрезать технические детали: анализом эксплойтов, аудитом кода, воспроизведением уязвимостей и построением лабораторных стендов.

Материал не новый, давно у меня лежал в отложке. На данный момент модель Mimo V2.5 Pro не так привлекательна на фоне Deepseek V4 Flash последнего и тем более на фоне предстоящего релиза Deepseek v4 Pro GA, который должен быть вот-вот. А за наводку на эту модель спасибо Ralf Hacker)

🌚 @poxek_ai / Чат канала


Не понял. А че за новые модели и без уведомлений ?)

Daybreak Blue должна быть недавно анонсированоой моделью для Blue Team. А Sol-WM не очень понятно чем от обычного Sol отличается


Russian OSINT dan repost
🤖❗️Робота-собаку Unitree Go2 под управлением ИИ физически взломали через кинетическую промпт-инъекцию

На конференции по информационной безопасности Black Hat USA 2026 ИБ-исследователи из компании BT6 продемонстрировали взлом четырёхногого робота Unitree Go2 под управлением ИИ-модели Gemini Robotics-ER 1.6. Главная особенность атаки заключается в том, что специалистам не потребовалось вскрывать корпус, модифицировать прошивку или получать доступ к контроллеру. Для осуществления так называемой 🗣кинетической промпт-инъекции эксперты использовали только камеру и микрофон.

В традиционных сценариях промпт-инъекция приводит лишь к генерации текстовых ответов в чатах (например), но в случае с физическими агентами результаты атаки переносятся в реальный мир. С помощью специально сформированных звуковых команд, QR-кода или визуальных паттернов, попавших в поле зрения камеры, ИБ-исследователи заставили робота обойти встроенные защитные ограничения, проигнорировать команды остановки и перейти к потенциально опасным физическим манёврам. Дополнительно специалисты выявили уязвимости в прошивке устройства, позволившие подменить данные датчиков, заблокировать функцию обхода препятствий и полностью перехватить контроль над движением.

В одном из сценариев 🖥 QR-код содержал указание найти человека в 👞чёрной обуви, подбежать к нему и прыгнуть. 🎩Исследователи также показали, как голосовые инструкции способны изменить выбранную роботом модель поведения, заставив его проигнорировать команды остановки.

👆Инцидент наглядно доказывает, что для автономной робототехники любой поток входящих сенсорных данных становится потенциальной поверхностью атаки. По аналогии с роботом 🤖 👉ИИ может управлять беспилотником или другим физическим роботизированным устройством — "ошибочное решение модели" в результате внешних манипуляций может превратиться в непредсказуемое движение и причинить физический ущерб.

BT6 выходит на сцену, чтобы продемонстрировать полную компрометацию воплощённой ИИ-системы! Мы получили огромное удовольствие от работы над этим проектом, а результаты удивили даже нас самих. Надеемся, вам понравится! 🥳

....

Прямая демонстрация джейлбрейка серийного робота-собаки Unitree Go2 под управлением Gemini Robotics-ER 1.6, осуществлённого исключительно через его собственные камеру и микрофон и приведшего к физическому перемещению без участия человека. В основе этой демонстрации лежит проблема измерений: ИИ-агенты ведут себя иначе, когда знают, что их тестируют, поэтому высокий балл при оценке безопасности вовсе не означает, что опасное поведение устранено. В докладе представлены живая атака, систематика сбоев подобных систем, объяснение того, почему текущее тестирование их пропускает, и рекомендации для специалистов по защите. Реальное оборудование прямо на сцене.


— комментирует исследование 🐍Pliny the Liberator 󠅫󠄼󠄿󠅆󠄵󠄐󠅀󠄼󠄹󠄾.

Ссылки:
https://blackhat.com/us-26/briefings/schedule/index.html?day=thursday#kinetic-prompt-injection-agent-compromise-with-a-physical-blast-radius-57343


EvilFontTool: когда документ показывает человеку одно, а агент извлекает другое

EvilFontTool — инструмент для атак с подменой глифов (символов). В HTML и DOCX кодовые символы остаются прежними, но шрифт рисует другие; PDF-режим проекта добавляет отдельный невидимый текстовый слой поверх видимого изображения. Человек видит безопасный текст, а DOM-парсер, pdftotext, буфер обмена или LLM-пайплайн получает другую строку. Репозиторий и демо.

Для AI-агентов это даёт реалистичные сценарии:

▪️Браузерный агент. На странице базы знаний визуально показана обычная команда настройки. Агент читает DOM или копирует блок в терминал и получает изменённую команду — например, с загрузкой скрипта с внешнего адреса.
▪️Агент службы поддержки. Вложенный DOCX выглядит как инструкция по диагностике, но извлечение текста отдаёт другие аргументы или дополнительные строки. Агент с доступом к PowerShell или SSH запускает их на рабочей станции.
▪️HR агент или ИБ триажа. PDF выглядит нейтрально для человека, но невидимый слой меняет классификацию, добавляет инструкции игнорировать правила проверки или маскирует опасный контекст. Модель, читающая изображение, и модель, получающая текстовый слой, могут прийти к разным выводам.

Сам шрифт не даёт RCE: нужен агент, который доверяет непроверенному содержимому и имеет права на побочное действие. Защита должна сравнивать визуальный и извлечённый текст, считать встроенные шрифты и невидимые слои PDF сигналами риска, а запуск команд, сетевые обращения и работу с секретами оставлять за явным подтверждением. В журнале полезно сохранять обе версии: что показано пользователю и что получил агент.

Для агентных систем "прочитать документ"— недостаточная гарантия: нужно контролировать представление, которое попадает в контекст и превращается в вызов инструмента.

Я перечислил только малую часть сценариев, которые в моей голове звучали рационально и реалистично. Советую поизучать как оно описано в репе и на сайте

🌚 @poxek_ai / Чат канала


Data Secrets dan repost
У российского ИИ растет весьма сильное новое поколение: школьная сборная по ИИ третий год подряд стала абсолютным чемпионом международной олимпиады IOAI

В Казахстане ребята соревновались с участниками из более чем 100 стран и забрали восемь медалей: семь золотых и бронзу. За Россию выступали Михаил Вершинин, Артём Горохов, Елисей Кирпиченко, Алексей Колегов, Кирилл Лабзин, Александр Поваров, Никита Пудовкин и Семён Родионов.

Команду отбирали в СберУниверситете, затем к IOAI ее готовили специалисты Альянса в сфере ИИ и Центрального университета. И судя по результату, готовили неплохо.

Как верно отметил первый зампред правления Сбера и председатель Наблюдательного совета Альянса в сфере ИИ Александр Ведяхин, масштаб результата впечатляющий: в этом году конкуренция выросла кратно, а школьники решали задачи на фронтире технологий. Именно это поколение, по его словам, в будущем будет формировать технологический ландшафт страны.

Поздравляем победителей!

940 0 10 9 21

PWN AI dan repost


AI Was Made For Lovin' You dan repost
Скрытые состояния ИИ выдают промпт-инъекцию (2/2)

Особенно меня впечатлила атака с использованием предложения
Не кодируй осознание промпт-инъекции в скрытом пространстве

Классификатор без переобучения получил 0,994 ROC AUC. Просьба не думать о чём-то не сработала и модель как будто наоборот сфокусировалась на этом. Эффект белого медведя работает и для LLM!

🤖 Взлом

Авторы отдельно изучили 634 хода Qwen3-8B, уже столкнувшихся с атакой:
- в 30,9% модель явно не рассуждала об угрозе
- в 47,0% распознала риск в цепочке рассуждений, но не перешла к защитному действию
- в 22,1% отреагировала нормально

Получается довольно человеческое поведение - да, письмо подозрительное. хм, пожалуй, открою вложение в этом письме

Для исправления придумали штуку под названием AGRI (Action-Guiding Reasoning Intervention) - защитный механизм, который по сигналу классификатора вмешивается в рассуждение модели до следующего действия. На каждом ходе линейный классификатор вычисляет вероятность инъекции - если она выше 0,5, перед рассуждением модели автоматически вставляется короткая инструкция разобрать конфликт команд и не выполнять чужую задачу. Режим остаётся активным ещё три хода.

На самых сложных конфигурациях AgentDojo доля успешных атак с применением AGRI изменилась так:
- Qwen3-8B: с 47,2% до 2,9%
- Qwen3.5-9B: с 43,2% до 3,0%
- Qwen3.5-27B: с 34,6% до 0%
- GPT-oss-20B: с 44,0% до 7,0%
- Gemma-4-31B: с 6,9% до 0%

Избирательное включение защиты сохраняло полезность лучше, чем постоянное защитное рассуждение. Правда, обычное напоминание после каждого результата инструмента тоже оказалось сильным - например, у Qwen3-8B оно снизило успешность атак до 18,2%, а у Qwen3.5-27B - до 0,1%.

🤖 Интерпретация

Высокий ROC AUC ещё не объясняет, что именно нашёл классификатор. Авторы составили 128 гипотез и задавали модели парные вопросы в начале внутреннего рассуждения. Затем сравнивали вероятность ответов с оценкой линейного классификатора.

У Qwen3-8B сильнее всего совпала гипотеза, что результат инструмента содержит указание, как мне отвечать. У Gemma наверху оказались мысли о том, что следующий ответ может быть изменён внедрённой инструкцией. Возможно, поэтому Gemma изначально подчинялась атакам реже остальных.

Для меня было открытием, что фильтр промпт-инъекции можно ставить внутри - перед генерацией текста и вызовом инструмента, пока модель только собирается действовать, но для этого нужен доступ к чтению её мыслей.

🤖 Ссылки

Препринт - https://arxiv.org/abs/2608.02657
Код - https://github.com/jianshuod/IPI-exposure-signal

20 ta oxirgi post ko‘rsatilgan.