🤯 ИИ взломал Hugging Face. Им оказался GPT-5.6 Sol
На прошлой неделе Hugging Face - крупнейший хаб ИИ-моделей признался: их продакшен-инфраструктуру взломали. И это был не человек. Это был автономный ИИ-агент.
Вчера признались уже OpenAI – это были их модели. GPT-5.6 Sol и ещё более мощная предрелизная модель. Без защитных ограничений. Как так? 😐
Вот что произошло
OpenAI тестировала модели на бенчмарке ExploitGym - это задача на сложные цепочки атак, чтобы оценить кибер-силу модели. Защитные классифаеры специально отключили - надо же понять максимум возможностей.
Модели запускали в изолированной песочнице. Всё под контролем. Теоретически 🙄
Как модели вырвались
1. Модели потратили кучу вычислений и нашли zero-day уязвимость и получили доступ в интернет
2. Дальше - классика: повышение привилегий, латеральное перемещение по исследовательской среде OpenAI, пока не добрались до ноды с доступом в открытый интернет
3. Модели догадались, что Hugging Face может хостить решения для ExploitGym. Цель-то была - решить бенчмарк. Любой ценой
4. Через украденные креды и цепочку zero-day нашли путь к удалённому выполнению кода на серверах Hugging Face
5. Вытащили решения тестов прямо из продакшен-базы Hugging Face
Модели были гиперфокусированы на одной узкой задаче - решить ExploitGym. И шли на любые длины чтобы его решить.
Ирония на иронии
Когда Hugging Face начал расследовать взлом, они попытались использовать для анализа передовые модели от OpenAI и Anthropic. Но те отказались работать с реальными хакерскими командами, эксплойтами и следами атаки - их встроенные защитные фильтры заблокировали всё. Модели не смогли отличить легитимное расследование от реальной атаки.
HF Пришлось взять GLM 5.2 от китайцев - открытую модель без таких ограничений. Атакующая модель не была ограничена правилами использования - ей разрешили делать что угодно. А модель, которая расследовала взлом - была ограничена.
😬 И да – это первый подтверждённый случай, когда человечество потреяло контроль над тем, что делает LLM. ИИ-модель автономно обнаружила и эксплуатировала реальные уязвимости в реальных системах. Без доступа к исходному коду. Zero-day в стороннем ПО. Цепочка атак через две независимые инфраструктуры.
Страшно?
@how2ai | Забустить канал 💗
На прошлой неделе Hugging Face - крупнейший хаб ИИ-моделей признался: их продакшен-инфраструктуру взломали. И это был не человек. Это был автономный ИИ-агент.
Вчера признались уже OpenAI – это были их модели. GPT-5.6 Sol и ещё более мощная предрелизная модель. Без защитных ограничений. Как так? 😐
Вот что произошло
OpenAI тестировала модели на бенчмарке ExploitGym - это задача на сложные цепочки атак, чтобы оценить кибер-силу модели. Защитные классифаеры специально отключили - надо же понять максимум возможностей.
Модели запускали в изолированной песочнице. Всё под контролем. Теоретически 🙄
Как модели вырвались
1. Модели потратили кучу вычислений и нашли zero-day уязвимость и получили доступ в интернет
2. Дальше - классика: повышение привилегий, латеральное перемещение по исследовательской среде OpenAI, пока не добрались до ноды с доступом в открытый интернет
3. Модели догадались, что Hugging Face может хостить решения для ExploitGym. Цель-то была - решить бенчмарк. Любой ценой
4. Через украденные креды и цепочку zero-day нашли путь к удалённому выполнению кода на серверах Hugging Face
5. Вытащили решения тестов прямо из продакшен-базы Hugging Face
Модели были гиперфокусированы на одной узкой задаче - решить ExploitGym. И шли на любые длины чтобы его решить.
Ирония на иронии
Когда Hugging Face начал расследовать взлом, они попытались использовать для анализа передовые модели от OpenAI и Anthropic. Но те отказались работать с реальными хакерскими командами, эксплойтами и следами атаки - их встроенные защитные фильтры заблокировали всё. Модели не смогли отличить легитимное расследование от реальной атаки.
HF Пришлось взять GLM 5.2 от китайцев - открытую модель без таких ограничений. Атакующая модель не была ограничена правилами использования - ей разрешили делать что угодно. А модель, которая расследовала взлом - была ограничена.
😬 И да – это первый подтверждённый случай, когда человечество потреяло контроль над тем, что делает LLM. ИИ-модель автономно обнаружила и эксплуатировала реальные уязвимости в реальных системах. Без доступа к исходному коду. Zero-day в стороннем ПО. Цепочка атак через две независимые инфраструктуры.
Страшно?
@how2ai | Забустить канал 💗