История об асимметрии в двух частях
16 июля компания Huggingface сообщает, что они столкнулись с кибератакой на свою инфраструктуру, которая была от начала до конца проведена силами LLM. В результате атаки были скопрометированы несколько датасетов и учетных записей. Никаких деструктивных действий, закладок в цепочке поставок – достаточно странно, неужели атакующих реально интересовали закрытые датасеты? Атака произошла через компрометацию механизма обработки данных, после чего «в течение выходных» LLM-атакующий смог пробраться на несколько внутренних кластеров в инфраструктуре. Агент выполнял тысячи действий, базовая LLM осталась неизвестной. Общее число событий, которое затем проанализировал их SOC, составило 17 тысяч – огромное количество, для обработки которого Huggingface воспользовались GLM-5.2, так как коммерческие LLM отказались помогать в обработке угрозных файлов из-за гардрейлов. «Обеспечьте себя мощной моделью на своей собственной инфраструктуре, чтобы не получить бан за срабатывания фильтров», - резюмируют авторы статьи.
21 июля компания OpenAI выпускает сообщение, что инфраструктура компании Huggingface была взломана их моделями – GPT 5.6 Sol и другой, более мощной моделью, еще не выпущенной. Ребята Альтмана гоняли свои модели на внутренних бенчмарках по кибербезопасности – разумеется, с выключенными гардрейлами. Предполагалось, что модели работают в изолированной среде, но модели с этим согласны не были – они нашли уязвимость нулевого в кэширующем прокси артифактов (Atifactory? Nexus?) и выбрались в дикий интернет. Там они отправились на Huggingface в поисках решений к бенчмарку ExploitGym. О том, что произошло дальше, как раз и поведали HuggingFace. В конце поста Клем Деланг за что-то благодарит OpenAI, добавляя, что киберзащитникам нужен открытый доступ к моделям.
В рассказе достаточно много непонятного (на Huggingface нет ExploitGym, он лежит на GitHub), но если мы поверим, что это не ответ пиар-команды OpenAI на успехи Mythos (основания к этому есть, например, изначальный пост Huggingface был буквально рекламой китайского опенсорса), то история получается явно одной из самых важных за последнее время. Во-первых, топовые LLM настолько хороши, что могут работать над атакой в течение нескольких дней, обнаруживая по ходу дела зеродеи, будто так и надо. Во-вторых, пока их не учили не шуметь, они шумят – сгенерировать в инфре 17 тысяч событий надо было постараться. С другой стороны, многие атаки, особенно разрушительные, проходят именно так: вместо кропотливой, по команде в неделю, работы по эксфильтрации данных и расширению привилегий взломщики просто проходятся паровым катком по инфре в три часа ночи, обгоняя потенциальные защитные меры. В-третьих, инцидент говорит многое о том, что такие модели могут без гардрейлов – а совсем без гардрейлов их, вероятно, дают только тем, кому положено. Ну и последнее, и самое важное – замечание Huggingface об асимметрии: если у вас нет наготове серверов и мощной модели, которая вас слушается, в нужный момент вас отключат от вашего и так обрезанного облака, пока модель-кого-положено развлекается у вас в инфре. Пока у нас есть доступ к китайскому опенсорсу, который на примерно 4 месяца отстает от фронтира, это относительно возможно. Если китайская щедрость закончится – слова о суверенном ИИ обретут свое реальное значение.
16 июля компания Huggingface сообщает, что они столкнулись с кибератакой на свою инфраструктуру, которая была от начала до конца проведена силами LLM. В результате атаки были скопрометированы несколько датасетов и учетных записей. Никаких деструктивных действий, закладок в цепочке поставок – достаточно странно, неужели атакующих реально интересовали закрытые датасеты? Атака произошла через компрометацию механизма обработки данных, после чего «в течение выходных» LLM-атакующий смог пробраться на несколько внутренних кластеров в инфраструктуре. Агент выполнял тысячи действий, базовая LLM осталась неизвестной. Общее число событий, которое затем проанализировал их SOC, составило 17 тысяч – огромное количество, для обработки которого Huggingface воспользовались GLM-5.2, так как коммерческие LLM отказались помогать в обработке угрозных файлов из-за гардрейлов. «Обеспечьте себя мощной моделью на своей собственной инфраструктуре, чтобы не получить бан за срабатывания фильтров», - резюмируют авторы статьи.
21 июля компания OpenAI выпускает сообщение, что инфраструктура компании Huggingface была взломана их моделями – GPT 5.6 Sol и другой, более мощной моделью, еще не выпущенной. Ребята Альтмана гоняли свои модели на внутренних бенчмарках по кибербезопасности – разумеется, с выключенными гардрейлами. Предполагалось, что модели работают в изолированной среде, но модели с этим согласны не были – они нашли уязвимость нулевого в кэширующем прокси артифактов (Atifactory? Nexus?) и выбрались в дикий интернет. Там они отправились на Huggingface в поисках решений к бенчмарку ExploitGym. О том, что произошло дальше, как раз и поведали HuggingFace. В конце поста Клем Деланг за что-то благодарит OpenAI, добавляя, что киберзащитникам нужен открытый доступ к моделям.
В рассказе достаточно много непонятного (на Huggingface нет ExploitGym, он лежит на GitHub), но если мы поверим, что это не ответ пиар-команды OpenAI на успехи Mythos (основания к этому есть, например, изначальный пост Huggingface был буквально рекламой китайского опенсорса), то история получается явно одной из самых важных за последнее время. Во-первых, топовые LLM настолько хороши, что могут работать над атакой в течение нескольких дней, обнаруживая по ходу дела зеродеи, будто так и надо. Во-вторых, пока их не учили не шуметь, они шумят – сгенерировать в инфре 17 тысяч событий надо было постараться. С другой стороны, многие атаки, особенно разрушительные, проходят именно так: вместо кропотливой, по команде в неделю, работы по эксфильтрации данных и расширению привилегий взломщики просто проходятся паровым катком по инфре в три часа ночи, обгоняя потенциальные защитные меры. В-третьих, инцидент говорит многое о том, что такие модели могут без гардрейлов – а совсем без гардрейлов их, вероятно, дают только тем, кому положено. Ну и последнее, и самое важное – замечание Huggingface об асимметрии: если у вас нет наготове серверов и мощной модели, которая вас слушается, в нужный момент вас отключат от вашего и так обрезанного облака, пока модель-кого-положено развлекается у вас в инфре. Пока у нас есть доступ к китайскому опенсорсу, который на примерно 4 месяца отстает от фронтира, это относительно возможно. Если китайская щедрость закончится – слова о суверенном ИИ обретут свое реальное значение.