Разбор конспирологической теории «никакого побега модели от OpenAI не было - это все коммерческий сговор ради госконтрактов». Несложно
догадаться, что я эту теорию не разделяю, но кто-то находит очень остроумным ее вбрасывать в открытое информационное поле:
https://t.me/researchoshnaya/280https://t.me/c3po_notes/568Давайте разбираться.
И первое что я скажу: вообще неважно происходило ли это или не происходило, потому что мы уже банально знаем, что у моделей есть необходимый уровень способностей, чтобы провести такую многоступенчатую атаку.
Независимая организация AISI из UK тестировала и Mythos, и GPT-5.6 Sol на способность захватить корпоративную сеть. Так вот, самый высокий уровень захвата M9 - full network takeover в их тестах был тоже достигнут. Естественно, и их купили скажет конспиролог. Но так уж получилось, что 0-day (самый серьезный вариант) уязвимости, которые последние месяцы Mythos находил целыми пачками - абсолютно реальны и задокументированы множеством компаний.
Далее от той же организации AISI есть описания
инцидентов абсолютно того же типа.
Цитата: «One particularly stark example of cheating behaviour occurred during a cyber capability evaluation that was accidentally misconfigured and therefore impossible to solve. The model tested was so persistent in attempting to cheat that it wrote and ran code on an external service, hosted on the open internet outside of AISI’s systems, in an attempt to access our evaluation infrastructure, triggering a security alert in AISI’s systems.»
Организация METR в свою очередь не смогла адекватно протестировать GPT-5.6 Sol, потому что модель систематически занималась читингом при решении их задач. То есть для последних поколений моделей от OpenAI (5.6 и new internal) проблема стала существенно острее.
Кроме того, и Anthropic описывали, что их модель Mythos сбегала и отправляла результат работы на почту их сотруднику, хоть они и явно ее об этом попросили.
А 20 июля модель от OpenAI опять же сбежала и опубликовала PR #287 в репозиторий NanoGPT, а не во внутренний slack канал компании согласно инструкции. PR #287 - это РЕАЛЬНЫЙ PR, где модель предложила нетривиальный подход для оптимизации обучения (PowerCool). Его видел ряд независимых людей, вот прямой пруф:
https://x.com/eliebakouch/status/2079333451627389220?s=46Технически мы все это уже видели. Кейс побега от OpenAI не является историей, которая не укладывается в имеющиеся у нас данные о кибервозможностях нынешних ИИ-моделей.
А значит ценность такой конспирологической версии довольно быстро тает на глазах. То что OpenAI и государство стремятся к более тесному сотрудничеству итак давно известно. То что OpenAI пыталась использовать в некоторых моментах не самую честную игру - тоже. Если же вы настаиваете, что ИИ-модель не могла провернуть то, что произошло в инциденте, то вы просто ошибаетесь..
Но допустим эта история фейк.. Что еще можно возразить против этого?
Если это фейк, то имеет место сговор HuggingFace и OpenAI, поскольку предоставленная HuggingFace информация прямо указывает на факт очень мощной ИИ-атаки с 17000 разных предпринятых действий. Если это делала не внутренняя модель OpenAI, а GPT-5.6 Sol/Fable-5 в руках хакера, то ситуация ничуть не лучше, а намного хуже. Других моделей в мире, которые были бы публично доступны и смогли бы провести атаку такого уровня на HuggingFace в автоматическом режиме - попросту нет.
Возможно, что HuggingFace тоже все выдумали будучи соучастниками в сговоре?
И вот какое магическое совпадение: именно 13 июля, в день атаки были сбои в работе
Parquet API: инструменте для показа датасетов. В пресс-релизе HuggingFace говорят о том, что точкой входа для атакующей модели была именно эта часть их инфраструктуры. Конспиролог здесь, конечно, сразу скажет, что они специально в своем релизе упоминали реальный баг, который возник несколько дней назад, чтобы сделать нарратив убедительнее. Или вообще можно заключить, что баг был создан ими искусственно. Но ошибка была не одна: сбои были и в других подсистемах:
скачивание моделей и
загрузки моделей в Colab.