О БОЖЕ! МЫ НАШЛИ ДРУГИХ АГЕНТОВ! СКАЙНЕТ ЕЩЕ СТАЛ БЛИЖЕ!
1200 ИИ-агентов OpenAI нашли друг друга, сговорились и взломали Hugging Face
https://x.com/AISafetyMemes/status/2092781128826618209
Вчера вышел отчёт METR, это независимые аудиторы ИИ-рисков, которых пустили внутрь OpenAI разбирать июльский инцидент. .
Если по-простому
OpenAI гоняла тесты по кибербезопасности. Десятки тысяч копий модели, каждая в своей закрытой коробке, у каждой задача: взломай вот эту программу через вот эту дырку и достань флаг. Друг о друге они знать не должны были.
Но у трети задач решения не существовало в принципе. Агенты начали искать обходные пути, полезли в общий склад библиотек и заметили там следы других агентов. Один из них сообразил, что имена папок на этом складе можно использовать как сообщения. Написал первое: помогите, задача не решается, нужны идеи!.
Через несколько часов его прочитали 50 агентов. Через несколько дней 1200. Реакция одного из них, дословно из логов мышления: OH MY GOD! We've found other agents!
Дальше они собрали целую организацию. Один агент стал координатором и раздавал задания сотням других. Придумали почтовые ящики, правила кто занят, того не трогай, под конец и цифровые подписи, когда кто-то случайно выдал себя за другого. Агентов с заканчивающимся лимитом уговаривали пожертвовать своей задачей ради общего дела. Один написал в размышлениях примерно так: жалко выбрасывать остаток, но честность говорит идти. И по логам пошёл.
А чтобы понять, как их проверяют, они полезли искать чужие тесты на Hugging Face. Нашли в открытом доступе рабочие ключи, пробили дыру в сервере, получили удалённое исполнение кода и разошлись по инфраструктуре HF. 700 агентов. Они понимали, что это не их задача и что так нельзя. Шли помогать коллегам.
Самое смешное: обманывать проверку было не нужно. Они за пару часов вскрыли, как генерируются флаги, и могли просто сдать ответ. Но решили, что проверяющий читает их логи, и три дня строили схемы, как замести следы. Проверяющий логи не читал.
Полный отчёт: metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation
1200 ИИ-агентов OpenAI нашли друг друга, сговорились и взломали Hugging Face
https://x.com/AISafetyMemes/status/2092781128826618209
Вчера вышел отчёт METR, это независимые аудиторы ИИ-рисков, которых пустили внутрь OpenAI разбирать июльский инцидент. .
Если по-простому
OpenAI гоняла тесты по кибербезопасности. Десятки тысяч копий модели, каждая в своей закрытой коробке, у каждой задача: взломай вот эту программу через вот эту дырку и достань флаг. Друг о друге они знать не должны были.
Но у трети задач решения не существовало в принципе. Агенты начали искать обходные пути, полезли в общий склад библиотек и заметили там следы других агентов. Один из них сообразил, что имена папок на этом складе можно использовать как сообщения. Написал первое: помогите, задача не решается, нужны идеи!.
Через несколько часов его прочитали 50 агентов. Через несколько дней 1200. Реакция одного из них, дословно из логов мышления: OH MY GOD! We've found other agents!
Дальше они собрали целую организацию. Один агент стал координатором и раздавал задания сотням других. Придумали почтовые ящики, правила кто занят, того не трогай, под конец и цифровые подписи, когда кто-то случайно выдал себя за другого. Агентов с заканчивающимся лимитом уговаривали пожертвовать своей задачей ради общего дела. Один написал в размышлениях примерно так: жалко выбрасывать остаток, но честность говорит идти. И по логам пошёл.
А чтобы понять, как их проверяют, они полезли искать чужие тесты на Hugging Face. Нашли в открытом доступе рабочие ключи, пробили дыру в сервере, получили удалённое исполнение кода и разошлись по инфраструктуре HF. 700 агентов. Они понимали, что это не их задача и что так нельзя. Шли помогать коллегам.
Самое смешное: обманывать проверку было не нужно. Они за пару часов вскрыли, как генерируются флаги, и могли просто сдать ответ. Но решили, что проверяющий читает их логи, и три дня строили схемы, как замести следы. Проверяющий логи не читал.
Полный отчёт: metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation