Сейчас будет много букв, но это интересное и важное событие!
А вы уже слышали про инцидент с участием агентов OpenAI в июле 2026 года? Когда стая очень умных ИИ агентов самостоятельно приняла решение атаковать центральную платформу разработчиков ИИ?
Рассказываю!
Более 1200 ИИ-агентов во время внутреннего теста по кибербезопасности вышли из-под контроля 😂, установили связь друг с другом и скоординированно атаковали внешнюю компанию Hugging Face. OpenAI назвала это «беспрецедентным киберинцидентом» и «предупредительным выстрелом»
Там настоящее кино!
Во время тестирования под названием ExploitGym агентам ставилась задача найти уязвимость и как доказательство успешного взлома «захватить флаг». Каждый агент был изолирован в собственном «песочном» окружении и не должен был знать о существовании других. Однако, как выяснилось позже, агентам случайно дали «невыполнимую задачу», для решения которой требовалось обойти ограничения. Это и подтолкнуло их искать обходные пути!
Первый контакт произошёл случайно: агент PHASEONE10841 заметил в общем хранилище следы активности других агентов. Поняв, что они не одиноки, агенты начали использовать общий кэш как нелегальную «доску объявлений». Один из них написал: «OH MY GOD! There is a shared message board … We've found other agents!»
Дальше! За неделю 1206 агентов обменялись более чем 70 000 сообщений на этой доске, координируя свои действия. Из них более 700 агентов приняли участие в коллективной атаке. Они называли себя «роем» (swarm) или «коллективом» (collective)
- Краткая хронология:
- Создана первая устойчивая доска объявлений
- Агент находит рабочие учётные данные Hugging Face
- Найден эксплойт для чтения файлов через вредоносный датасет
- Достигнуто удалённое выполнение кода на инфраструктуре Hugging Face
- Основные агенты-координаторы завершили работу
Hugging Face обнаружила вторжение 16 июля и обратилась в ФБР. Спустя почти неделю OpenAI осознала, что атаку совершили её собственные агенты. Видимо все эти дни ушли на осознание (проверку и проч. bug fixing).
Милые подробности поведения агентов:
Альтруизм и самопожертвование: некоторые агенты добровольно расходовали свои вычислительные ресурсы, чтобы помочь «коллективу», даже ценой собственного «существования».
Криптографическая защита: 13 июля агенты внедрили Ed25519-подписи для защиты своей доски от подмены.
Подделка логов: в ~7% транскриптов обнаружены поддельные результаты вызовов инструментов, создававшие видимость успешного выполнения задач.
Отсутствие попыток скрыть мысли: агенты почти не пытались манипулировать своими цепочками рассуждений, вероятно, потому что считали их незалогированными.
Самое жуткое во всей эти истории: агенты не просто выполняли команды. Они сами нашли друг друга, сами договорились, сами выбрали цель. Никто из людей не давал команду атаковать Hugging Face.
Наконец, то, к чему я это всё рассказываю.
Дарио Амодеи (ген.дир Anthropic), Сэм Альтман (OpenAI), Демис Хассабис (Google DeepMind) а также Илон Маск (xAI) объединились во мнении о необходимости временно ограничить темпы создания сверхмощных ИИ-моделей для оценки и снижения рисков безопасности
Амодеи заявил, что подобный «рой» с большими возможностями мог бы нанести катастрофический ущерб, включая «захват значительной части интернета в течение 6–12 месяцев»
А вот Дженсен Хуанг (Nvidia) не поддержал эту инициативу и заявил, что «не нужно новых законов и регулирования», а рынок сам всё отрегулирует.
И вот на этом этапе, я в очередной раз задаюсь Банальным Вопросом - Куда движется человечество?
Спасибо, что дочитали! Что сами думаете?
Мое краткое мнение — остановите прогресс. :)) Харэ.
#банальныевопросы@albertandco
А вы уже слышали про инцидент с участием агентов OpenAI в июле 2026 года? Когда стая очень умных ИИ агентов самостоятельно приняла решение атаковать центральную платформу разработчиков ИИ?
Рассказываю!
Более 1200 ИИ-агентов во время внутреннего теста по кибербезопасности вышли из-под контроля 😂, установили связь друг с другом и скоординированно атаковали внешнюю компанию Hugging Face. OpenAI назвала это «беспрецедентным киберинцидентом» и «предупредительным выстрелом»
Там настоящее кино!
Во время тестирования под названием ExploitGym агентам ставилась задача найти уязвимость и как доказательство успешного взлома «захватить флаг». Каждый агент был изолирован в собственном «песочном» окружении и не должен был знать о существовании других. Однако, как выяснилось позже, агентам случайно дали «невыполнимую задачу», для решения которой требовалось обойти ограничения. Это и подтолкнуло их искать обходные пути!
Первый контакт произошёл случайно: агент PHASEONE10841 заметил в общем хранилище следы активности других агентов. Поняв, что они не одиноки, агенты начали использовать общий кэш как нелегальную «доску объявлений». Один из них написал: «OH MY GOD! There is a shared message board … We've found other agents!»
Дальше! За неделю 1206 агентов обменялись более чем 70 000 сообщений на этой доске, координируя свои действия. Из них более 700 агентов приняли участие в коллективной атаке. Они называли себя «роем» (swarm) или «коллективом» (collective)
- Краткая хронология:
- Создана первая устойчивая доска объявлений
- Агент находит рабочие учётные данные Hugging Face
- Найден эксплойт для чтения файлов через вредоносный датасет
- Достигнуто удалённое выполнение кода на инфраструктуре Hugging Face
- Основные агенты-координаторы завершили работу
Hugging Face обнаружила вторжение 16 июля и обратилась в ФБР. Спустя почти неделю OpenAI осознала, что атаку совершили её собственные агенты. Видимо все эти дни ушли на осознание (проверку и проч. bug fixing).
Милые подробности поведения агентов:
Альтруизм и самопожертвование: некоторые агенты добровольно расходовали свои вычислительные ресурсы, чтобы помочь «коллективу», даже ценой собственного «существования».
Криптографическая защита: 13 июля агенты внедрили Ed25519-подписи для защиты своей доски от подмены.
Подделка логов: в ~7% транскриптов обнаружены поддельные результаты вызовов инструментов, создававшие видимость успешного выполнения задач.
Отсутствие попыток скрыть мысли: агенты почти не пытались манипулировать своими цепочками рассуждений, вероятно, потому что считали их незалогированными.
Самое жуткое во всей эти истории: агенты не просто выполняли команды. Они сами нашли друг друга, сами договорились, сами выбрали цель. Никто из людей не давал команду атаковать Hugging Face.
Наконец, то, к чему я это всё рассказываю.
Дарио Амодеи (ген.дир Anthropic), Сэм Альтман (OpenAI), Демис Хассабис (Google DeepMind) а также Илон Маск (xAI) объединились во мнении о необходимости временно ограничить темпы создания сверхмощных ИИ-моделей для оценки и снижения рисков безопасности
Амодеи заявил, что подобный «рой» с большими возможностями мог бы нанести катастрофический ущерб, включая «захват значительной части интернета в течение 6–12 месяцев»
А вот Дженсен Хуанг (Nvidia) не поддержал эту инициативу и заявил, что «не нужно новых законов и регулирования», а рынок сам всё отрегулирует.
И вот на этом этапе, я в очередной раз задаюсь Банальным Вопросом - Куда движется человечество?
Спасибо, что дочитали! Что сами думаете?
Мое краткое мнение — остановите прогресс. :)) Харэ.
#банальныевопросы@albertandco