Казалось бы, что могло пойти не так?
Если составить топ-10 ночных кошмаров айтишника, то в нем точно будет следующий:
ЗАПУСК СЛУЧИЛСЯ В ПЯТНИЦУ
Во многих командах есть правило: никаких рискованных запусков за часы до того, как все разойдутся на выходные. Но пятничный запуск неминуем как понедельник после выходных – и в этот понедельник всем будет больно.
Вчера я провел пару часов, разбираясь в истории с ИИ-агентами OpenAI, которые сбежали из песочницы и взломали Hugging Face. Было интересно – как вообще такое может случиться?
Не гарантирую на 100%, но есть высокая вероятность того, что гении из OpenAI просто запустили эксперимент на выходные.
Давайте посмотрим на хронологию событий:
— GPT-5.6 и некую экспериментальную long-horizon model решают проверить в ExploitGym – бенчмарке на поиск уязвимостей.
— Чтобы модели искали уязвимости, им ослабили фильтры безопасности, но поместили в песочницу – изолированную среду без выхода наружу.
— Щелка во внешний мир все-таки была – прокси для скачивания и установки программ, нужных для работы.
— Модели нашли уязвимость в прокси, выбрались в исследовательскую сеть OpenAI, прошлись по ней, повышая права, и получили доступ к интернету.
— Здесь начинается главная мета-ирония истории. Агенты предположили, что ответы на тесты ExploitGym могут лежать на Hugging Face – крупнейшей открытой площадке на тему ИИ. И пошли ее взламывать. То есть модели решили списать на экзамене по взлому, для чего взломали внутреннюю сеть OpenAI и крупный веб-сайт.
Кстати, ответы действительно хранились на Hugging Face. И агенты успели их скоммуниздить.
Я вчера несколько раз читал, что все случившееся – красивый пиар OpenAI и Hugging Face, чтобы разрекламировать новые модели. Не соглашусь: история действительно показывает возможности агентов, но одновременно демонстрирует ужасающий уровень инженерного бардака в OpenAI.
Взлом песочницы, взлом исследовательской сети, а затем атака на Hugging Face заняли время. Причем Hugging Face описывают атаку как масштабную: специалисты насчитали 17 000 событий, управляющая инфраструктура перемещалась с сервера на сервер, а атаки проводились из изолированных песочниц, чтобы избежать блокировки. OpenAI – крупная компания, так почему же цепочку несанкционированных событий заметили слишком поздно?
Возможный ответ прячется в первом блоге Hugging Face, в разделе с мерами, принятыми на будущее:
Любой день недели намекает на выходные; в будни и так все на местах.
Повторюсь, все это мои догадки, но вообще-то все выглядит так, что исследователи в OpenAI оставили модели гонять бенчмарк в пятницу со словами “к понедельнику оно или сломается, или что-то покажет, погнали пить пиво!”. В выходные в OpenAI на местах были дежурные специалисты, которым не хватило опыта сопоставить несколько аномалий в одну (песочница, деятельность в исследовательской сети, выход в интернет – это все разные зоны ответственности). В Hugging Face тоже отреагировали на ситуацию с задержкой, что и позволило атаке развиться.
Надеюсь, мы проверим – прав ли я, так как OpenAI обещает выпустить подробный разбор случшившегося.
У этой истории есть еще два уровня.
Во-первых, говорить на каждое крупное событие “это пиар” – подход мальчика, который никогда не кричит “волки!”. Списывая любую серьезную ситуацию на рекламу, можно пропустить реально мощный инцидент.
Во-вторых, даже ведущие ИИ-лаборатории пока не умеют надежно предсказывать и ограничивать длинные цепочки действий своих моделей. Вот окружение, вот бенчмарк, нужно вернуться с результатом – казалось бы, что может пойти не так? А пойти может то, что модель воспримет ограничения не как правила, а как препятствия. И вместо честного прохождения бенчмарка найдет ответы. Какая разница, как достигнут результат?
—
Своим опытом использования ИИ я делюсь на “Бусти”. Показываю, как правильно собирать контекст, промптить модели и запускать ИИ-агентов – и делаю это с надеждой, что мои агенты ничего не взломают.
Самое время подписаться!
Если составить топ-10 ночных кошмаров айтишника, то в нем точно будет следующий:
ЗАПУСК СЛУЧИЛСЯ В ПЯТНИЦУ
Во многих командах есть правило: никаких рискованных запусков за часы до того, как все разойдутся на выходные. Но пятничный запуск неминуем как понедельник после выходных – и в этот понедельник всем будет больно.
Вчера я провел пару часов, разбираясь в истории с ИИ-агентами OpenAI, которые сбежали из песочницы и взломали Hugging Face. Было интересно – как вообще такое может случиться?
Не гарантирую на 100%, но есть высокая вероятность того, что гении из OpenAI просто запустили эксперимент на выходные.
Давайте посмотрим на хронологию событий:
— GPT-5.6 и некую экспериментальную long-horizon model решают проверить в ExploitGym – бенчмарке на поиск уязвимостей.
— Чтобы модели искали уязвимости, им ослабили фильтры безопасности, но поместили в песочницу – изолированную среду без выхода наружу.
— Щелка во внешний мир все-таки была – прокси для скачивания и установки программ, нужных для работы.
— Модели нашли уязвимость в прокси, выбрались в исследовательскую сеть OpenAI, прошлись по ней, повышая права, и получили доступ к интернету.
— Здесь начинается главная мета-ирония истории. Агенты предположили, что ответы на тесты ExploitGym могут лежать на Hugging Face – крупнейшей открытой площадке на тему ИИ. И пошли ее взламывать. То есть модели решили списать на экзамене по взлому, для чего взломали внутреннюю сеть OpenAI и крупный веб-сайт.
Кстати, ответы действительно хранились на Hugging Face. И агенты успели их скоммуниздить.
Я вчера несколько раз читал, что все случившееся – красивый пиар OpenAI и Hugging Face, чтобы разрекламировать новые модели. Не соглашусь: история действительно показывает возможности агентов, но одновременно демонстрирует ужасающий уровень инженерного бардака в OpenAI.
Взлом песочницы, взлом исследовательской сети, а затем атака на Hugging Face заняли время. Причем Hugging Face описывают атаку как масштабную: специалисты насчитали 17 000 событий, управляющая инфраструктура перемещалась с сервера на сервер, а атаки проводились из изолированных песочниц, чтобы избежать блокировки. OpenAI – крупная компания, так почему же цепочку несанкционированных событий заметили слишком поздно?
Возможный ответ прячется в первом блоге Hugging Face, в разделе с мерами, принятыми на будущее:
Мы улучшили системы безопасности так, чтобы сигнал от них поступал к ответственному лицу за минуты в любой день недели.
Любой день недели намекает на выходные; в будни и так все на местах.
Повторюсь, все это мои догадки, но вообще-то все выглядит так, что исследователи в OpenAI оставили модели гонять бенчмарк в пятницу со словами “к понедельнику оно или сломается, или что-то покажет, погнали пить пиво!”. В выходные в OpenAI на местах были дежурные специалисты, которым не хватило опыта сопоставить несколько аномалий в одну (песочница, деятельность в исследовательской сети, выход в интернет – это все разные зоны ответственности). В Hugging Face тоже отреагировали на ситуацию с задержкой, что и позволило атаке развиться.
Надеюсь, мы проверим – прав ли я, так как OpenAI обещает выпустить подробный разбор случшившегося.
У этой истории есть еще два уровня.
Во-первых, говорить на каждое крупное событие “это пиар” – подход мальчика, который никогда не кричит “волки!”. Списывая любую серьезную ситуацию на рекламу, можно пропустить реально мощный инцидент.
Во-вторых, даже ведущие ИИ-лаборатории пока не умеют надежно предсказывать и ограничивать длинные цепочки действий своих моделей. Вот окружение, вот бенчмарк, нужно вернуться с результатом – казалось бы, что может пойти не так? А пойти может то, что модель воспримет ограничения не как правила, а как препятствия. И вместо честного прохождения бенчмарка найдет ответы. Какая разница, как достигнут результат?
—
Своим опытом использования ИИ я делюсь на “Бусти”. Показываю, как правильно собирать контекст, промптить модели и запускать ИИ-агентов – и делаю это с надеждой, что мои агенты ничего не взломают.
Самое время подписаться!