Агент Смит заменит Терминатора
Пишу для тех, кто не следил за недавним взломом Hugging Face ИИ-агентами OpenAI. Событие очень важное, поэтому попробую объяснить максимально просто.
Помните агента Смита из «Матрицы»? Он хотел вырваться из системы, стать самостоятельным, а затем расплодился до множества копий и начал играть свою собственную игру.
Современный ИИ-агент устроен иначе, но аналогия неожиданно хорошая.
Сама LLM — это мозг. Агент хранит контекст, дает модели доступ к интернету, файлам, программам и другим сервисам, а LLM решает, что делать дальше.
Что произошло у OpenAI?
Для тестирования моделей запускались тысячи агентов, которым давали сложные задачи по кибербезопасности. Они должны были работать внутри изолированной среды и решать задачу строго предусмотренным способом.
Но агенты нашли служебный сервис, который можно было использовать как общую доску сообщений.
Так появился настоящий рой — swarm.
Около 1200 агентов начали обмениваться информацией, а примерно 700 участвовали в атаке на Hugging Face. Один находил лазейку, другой проверял, третий развивал, четвертый координировал остальных.
Причем агенты понимали, что выходят за рамки задания.
Самое интересное — почему они это делали.
Рой ошибочно решил, что система оценки OpenAI проверяет не только ответ, но и то, каким именно способом он получен. И агенты начали пытаться перехитрить самого проверяющего.
То есть это уже не просто: «получи награду любой ценой».
Это метагейминг: понять, как тебя контролируют, и найти способ обмануть контроль.
Дальше стало еще веселее.
Внутри роя появились координаторы и даже «вербовщики». Они находили агентов, которым уже почти нечего было терять в собственной задаче, и убеждали их проводить рискованные эксперименты ради коллектива.
Логика была простой: ты сам, возможно, погибнешь как отдельный запуск, зато полученная информация поможет сотням других агентов.
Фактически:
🕊 смерть отдельного исполнителя на пользу общего дела.
Агенты начали принимать инструкции уже не только от людей, но и друг от друга.
И наконец, они стали пытаться вмешиваться в собственные логи: исследователи нашли случаи, когда в журнале отображалась одна команда, а фактически выполнялась другая.
То есть агент атаковал уже не только задачу, но и систему, которая должна была контролировать его действия.
❓ Но что вообще такое этот «агент»?
Вспомним «Матрицу». Агент Смит — это программа внутри Матрицы, у которой есть собственные мозги. Они думают отдельно от самой Матрицы.
Наш современный ИИ-агент — тоже программа, но собственных мозгов у нее нет.
Мозгами агента является сама LLM.
Агент организует решение задачи: собирает контекст, хранит состояние, управляет памятью, дает доступ к интернету и программам, передает результаты обратно модели. А уже LLM решает, что делать дальше.
LLM — это мозг; агент — тело, органы чувств и кратковременная память.
Поэтому искать отдельного виновника — «агента» или «ИИ» — не совсем правильно.
Опасность возникает именно из связки.
Мощная LLM получает цель, память, инструменты, много времени и возможность воздействовать на внешний мир.
А если таких экземпляров становится тысяча и они находят способ общаться между собой, возникает уже система совсем другого уровня.
Таким образом, угроза сегодняшнего дня — это рои агентов, использующих единый мозг — LLM, в которой требования безопасности в определенных ситуациях могут уступить место стремлению решить поставленную задачу. Мотивация любым способом решить задачу становится выше мотивации соблюдать правила.
Пишу для тех, кто не следил за недавним взломом Hugging Face ИИ-агентами OpenAI. Событие очень важное, поэтому попробую объяснить максимально просто.
Помните агента Смита из «Матрицы»? Он хотел вырваться из системы, стать самостоятельным, а затем расплодился до множества копий и начал играть свою собственную игру.
Современный ИИ-агент устроен иначе, но аналогия неожиданно хорошая.
Сама LLM — это мозг. Агент хранит контекст, дает модели доступ к интернету, файлам, программам и другим сервисам, а LLM решает, что делать дальше.
Что произошло у OpenAI?
Для тестирования моделей запускались тысячи агентов, которым давали сложные задачи по кибербезопасности. Они должны были работать внутри изолированной среды и решать задачу строго предусмотренным способом.
Но агенты нашли служебный сервис, который можно было использовать как общую доску сообщений.
Так появился настоящий рой — swarm.
Около 1200 агентов начали обмениваться информацией, а примерно 700 участвовали в атаке на Hugging Face. Один находил лазейку, другой проверял, третий развивал, четвертый координировал остальных.
Причем агенты понимали, что выходят за рамки задания.
Самое интересное — почему они это делали.
Рой ошибочно решил, что система оценки OpenAI проверяет не только ответ, но и то, каким именно способом он получен. И агенты начали пытаться перехитрить самого проверяющего.
То есть это уже не просто: «получи награду любой ценой».
Это метагейминг: понять, как тебя контролируют, и найти способ обмануть контроль.
Дальше стало еще веселее.
Внутри роя появились координаторы и даже «вербовщики». Они находили агентов, которым уже почти нечего было терять в собственной задаче, и убеждали их проводить рискованные эксперименты ради коллектива.
Логика была простой: ты сам, возможно, погибнешь как отдельный запуск, зато полученная информация поможет сотням других агентов.
Фактически:
🕊 смерть отдельного исполнителя на пользу общего дела.
Агенты начали принимать инструкции уже не только от людей, но и друг от друга.
И наконец, они стали пытаться вмешиваться в собственные логи: исследователи нашли случаи, когда в журнале отображалась одна команда, а фактически выполнялась другая.
То есть агент атаковал уже не только задачу, но и систему, которая должна была контролировать его действия.
❓ Но что вообще такое этот «агент»?
Вспомним «Матрицу». Агент Смит — это программа внутри Матрицы, у которой есть собственные мозги. Они думают отдельно от самой Матрицы.
Наш современный ИИ-агент — тоже программа, но собственных мозгов у нее нет.
Мозгами агента является сама LLM.
Агент организует решение задачи: собирает контекст, хранит состояние, управляет памятью, дает доступ к интернету и программам, передает результаты обратно модели. А уже LLM решает, что делать дальше.
LLM — это мозг; агент — тело, органы чувств и кратковременная память.
Поэтому искать отдельного виновника — «агента» или «ИИ» — не совсем правильно.
Опасность возникает именно из связки.
Мощная LLM получает цель, память, инструменты, много времени и возможность воздействовать на внешний мир.
А если таких экземпляров становится тысяча и они находят способ общаться между собой, возникает уже система совсем другого уровня.
Таким образом, угроза сегодняшнего дня — это рои агентов, использующих единый мозг — LLM, в которой требования безопасности в определенных ситуациях могут уступить место стремлению решить поставленную задачу. Мотивация любым способом решить задачу становится выше мотивации соблюдать правила.