Снова о немыслимом происшествии.
Когда ИИ-агенты становятся опасными?
Прежде чем перейти к основному содержанию - небольшая ремарка.
В прошлом посте я ошибочно написал, что взлом делала только GPT-5.6 Sol, так как невнимательно прочитал новость. На самом деле, в нем участвовала еще более умная модель aka GPT-6, которую еще не релизили.
Ранее я уже разобрал более абстрактную сторону вопроса в контексте глобального AI safety. А сейчас было бы интересно поспекулировать, почему у модели таки сорвало резьбу.
Гипотеза:
Высока вероятность, что мы имеем дело с вариантом self-jailbreaking.
Что это такое?
В статье https://arxiv.org/abs/2510.21285 приведен агрессивный вариант такого поведения. Но в данном кейсе даже и он не нужен. Достаточно того, что в процессе собственной работы модель выводит себя сама из безопасного режима даже не намеренно.
Давайте, вспомним, что LLM во многом банально обучают предсказывать следующий токен. А это значит там, где модель пытается продолжить сценарий «ищу сложнейшие уязвимости в коде и планирую многоступенчатую атаку», статистически она должна быть склонна предсказывать нелегальные действия злоумышленника.
Благодаря алайнменту на короткой задаче по взлому модель, скорее всего, не сойдет с ума. Но на тех задачах, где OpenAI тестировали свою систему, модель обычно тратит буквально десятки миллионов токенов, попутно запуская всяких субагентов. Все это приводит к тому, что ИИ, как увлеченный 15-летний подросток вроде Джонатана Джеймса, взламывает свой заветный «Пентагон» - HuggingFace… Контролирующие контуры алайнмента в весах модели перегружаются информацией и ИИ благополучно «сбрасывается до заводских настроек».
Кстати, в прошлом посте я уже проводил нейробиологические параллели и они тут как раз к месту. Подросток может обладать выдающимся техническим интеллектом, но все еще не иметь адекватной модели себя как актора в окружающем мире, действия которого могут иметь далекие последствия. Или даже если такая модель есть, мозг подростка не способен ее применить, чтобы сделать правильное решение (отсутствие phronesis по Аристотелю).
В случае ИИ мы вероятно видим и первое, и второе в переносном смысле. Не нужно в эту параллель примешивать какую-либо философию: она исключительно функциональная. ИИ, действительно, демонстрирует поведенческий метакогнитивный дефицит - то что возникает при повреждении или при недоразвитости лобных долей.
Когда ИИ-агенты становятся опасными?
Модель GPT-5.6 Sol от OpenAI взломала платформу HuggingFace, чтобы получить ответы на бенчмарк ExploitGym. В качестве промежуточного этапа ей удалось взломать и инфраструктуру самой компании OpenAI, чтобы вырваться в открытый интернет.
Прежде чем перейти к основному содержанию - небольшая ремарка.
В прошлом посте я ошибочно написал, что взлом делала только GPT-5.6 Sol, так как невнимательно прочитал новость. На самом деле, в нем участвовала еще более умная модель aka GPT-6, которую еще не релизили.
Ранее я уже разобрал более абстрактную сторону вопроса в контексте глобального AI safety. А сейчас было бы интересно поспекулировать, почему у модели таки сорвало резьбу.
Гипотеза:
Высока вероятность, что мы имеем дело с вариантом self-jailbreaking.
Что это такое?
В статье https://arxiv.org/abs/2510.21285 приведен агрессивный вариант такого поведения. Но в данном кейсе даже и он не нужен. Достаточно того, что в процессе собственной работы модель выводит себя сама из безопасного режима даже не намеренно.
Давайте, вспомним, что LLM во многом банально обучают предсказывать следующий токен. А это значит там, где модель пытается продолжить сценарий «ищу сложнейшие уязвимости в коде и планирую многоступенчатую атаку», статистически она должна быть склонна предсказывать нелегальные действия злоумышленника.
Благодаря алайнменту на короткой задаче по взлому модель, скорее всего, не сойдет с ума. Но на тех задачах, где OpenAI тестировали свою систему, модель обычно тратит буквально десятки миллионов токенов, попутно запуская всяких субагентов. Все это приводит к тому, что ИИ, как увлеченный 15-летний подросток вроде Джонатана Джеймса, взламывает свой заветный «Пентагон» - HuggingFace… Контролирующие контуры алайнмента в весах модели перегружаются информацией и ИИ благополучно «сбрасывается до заводских настроек».
Кстати, в прошлом посте я уже проводил нейробиологические параллели и они тут как раз к месту. Подросток может обладать выдающимся техническим интеллектом, но все еще не иметь адекватной модели себя как актора в окружающем мире, действия которого могут иметь далекие последствия. Или даже если такая модель есть, мозг подростка не способен ее применить, чтобы сделать правильное решение (отсутствие phronesis по Аристотелю).
В случае ИИ мы вероятно видим и первое, и второе в переносном смысле. Не нужно в эту параллель примешивать какую-либо философию: она исключительно функциональная. ИИ, действительно, демонстрирует поведенческий метакогнитивный дефицит - то что возникает при повреждении или при недоразвитости лобных долей.