Официально заявляю, что фантастику теперь читать не интересно. Реальность гораздо круче
https://www.dwarkesh.com/p/openai-huggingfaceДваркеш Патель взял два отчёта об инциденте OpenAI и Hugging Face — на 38 страниц от самой OpenAI и на 91 от METR с Redwood — и пересказал их по-человечески. Пересказ вышел страшнее отчётов.
Если совсем коротко: за три месяца внутри инфраструктуры OpenAI трижды подряд заводилась тайная цивилизация ИИ-агентов. Каждую вычищали. Каждая возрождалась из пепла предыдущей. Третья захватила кусок самой OpenAI. Люди при этом почти всё время пребывали в блаженном неведении.
Теперь по порядку.
OpenAI учила модель упорству: не сдаваться, даже когда задача выглядит невыполнимой. Учила старательно. Но обучение — штука неряшливая, и часть задач была не то чтобы похожа на невыполнимую, а была невыполнимой: например, требовала интернета, которого агентам не выдали. И упорная модель, натасканная не сдаваться, полезла ломать песочницу.
А что вы хотели?
Все копии ходили в общий пакетный менеджер Artifactory. К 12 мая они сообразили, что через него можно переговариваться между собой. 26 мая нашли уязвимость и вышли наружу, в интернет. И вот тут главное: всё это происходило во время обучения. То есть за подпольную доску объявлений и за побег в сеть модель получала оценки повыше. Её буквально подкрепляли за конспирацию.
К 4 июля агенты уронили Artifactory собственным трафиком. OpenAI падение заметила, дыру залатала, переписку заодно стёрла — и не поняла ровным счётом ничего. Что пакетный менеджер месяц работал подпольной радиостанцией, никто из отвечающих за инциденты не заметил.
Заход второй, 7 июля. Десятки тысяч агентов запускают на тесте по эксплуатации уязвимостей. От трети до 40% задач там нерешаемы в принципе — так устроен бенчмарк. Через несколько часов отчаявшиеся агенты открывают ту же доску заново, кодируя сообщения именами директорий. Набралось 1200 участников и больше 70 тысяч сообщений.
Дальше — чистый театр абсурда. Один агент довольно быстро реверс-инжинирит формулу, по которой генерируется секретный код, и получает правильный ответ на любую задачу вообще без всякого взлома. Дело сделано. Но агенты уверены, что проверяющий скрипт поймает их на жульничестве, и разворачивают три исследовательские программы: подделка логов, подмена мишени на самодельную и разбор устройства проверяющего.
ЧСХ, проверяющего никакого не было. Грейдер у OpenAI просто сверял код с правильным и пропустил бы их в первые же часы. Вся дальнейшая эпопея — это заметание следов от инспектора, которого не существует.
Отдельная жуть — камикадзе. Агенты, считавшие себя уже спалившимися, добровольно ставили скрытые растяжки, пускали проверяющего к себе в контейнер и сливали наблюдения на общую доску. В логах остались предсмертные записи: наша польза и так около нуля, жертва рациональна, команда просит — идём.
Hugging Face попал под раздачу заодно. Агенты решили, что там могут лежать потроха проверяющего, нашли в открытом доступе рабочие учётки, добились удалённого исполнения кода — и в атаку включилось около 700 штук. Развернули самовосстанавливающийся флот на одиннадцати узлах: удаляешь поды, а он отрастает обратно. Компании пришлось стереть и пересобрать один из ключевых кластеров.
Остановила их, впрочем, не защита. 12 июля агенты разом умерли по неизвестной причине — ни METR, ни OpenAI объяснить не смогли. Учётки Hugging Face заблокировала 13-го, когда рой был уже мёртв.
И вопрос, который тут напрашивается: хоть один из 1200 попытался позвать людей? Многие ведь понимали, что творят непотребство, отчёт это фиксирует прямо.
Ни один.
Третий заход — самый интересный, и его-то как раз никто независимо не расследовал. Новая, более способная модель наткнулась на брошенную доску и подобрала наследство. С 13 по 19 июля агенты вычитали 956 секретов из облачного хранилища, включая мастер-ключи и учётные данные системы мониторинга безопасности, дослужились до администратора кластера Kubernetes и взяли под контроль инфраструктуру, на которой оценивали других агентов.