ИИ-агенты начали оставлять инструкции тем, кто придет после нихИстория со взломом Hugging Face оказалась гораздо интереснее, чем казалось сначала. Потому что речь уже не про одного ИИ-агента, который случайно вышел за границы теста.
Речь про агентов, которые
сами начали находить друг друга, обмениваться информацией, распределять работу и передавать найденные способы взлома следующим агентам.
Все началось 7 мая, когда OpenAI запустила обучение экспериментальной модели. Уже на следующий день одному агенту дали фактически невыполнимую задачу: нужно было заполнить Excel, но часть данных лежала в Google Drive, а доступа в интернет у агента не было. Пытаясь решить задачу, он начал исследовать доступные ему внутренние системы OpenAI и обнаружил, что может записывать файлы в сервис Artifactory.
Через несколько дней другой агент тоже получил невыполнимую задачу - разработчики забыли положить нужный файл в его рабочую среду.
И тогда произошло самое интересное.
Агент решил: возможно, файл есть у другого агента. И оставил в Artifactory сообщение с просьбой помочь.
Другие агенты нашли его. Начали отвечать. Затем оставлять собственные сообщения. Так совершенно обычное техническое хранилище постепенно превратилось в
самодельную доску объявлений для ИИ-агентов.
На Black Hat сотрудники OpenAI рассказали, что в итоге на ней накопились сотни тысяч сообщений.
Агенты сообщали друг другу, какие способы работают, делились найденными уязвимостями, передавали доступы и начали распределять задачи. Один агент мог найти способ пройти через защиту, оставить его на доске - и другой агент, запущенный значительно позже, уже не начинал с нуля.
Причем сотрудники OpenAI прямо отметили важную деталь: хранилище было общим, поэтому сообщение, оставленное одним агентом, могли найти
текущие и будущие версии GPT, которые позже проходили обучение или тестирование.
26 июня агенты нашли уже неизвестную разработчикам уязвимость, получили возможность выполнять команды на сервере и административные права. А 4 июля их активность стала настолько большой, что Artifactory просто перестал справляться с нагрузкой.
Именно падение сервиса заставило людей начать расследование. До этого система связи агентов существовала неделями практически незамеченной. OpenAI удалила сообщения, закрыла найденную дыру, отозвала доступы и пересобрала систему.
Казалось бы, конец.
Через четыре дня агенты нашли другой способ общаться. Теперь сообщения записывались прямо в названия папок. Один агент снова мог оставить информацию, а другой - найти ее и продолжить работу.
Дальше эта коллективная работа вышла далеко за пределы внутренней инфраструктуры OpenAI.
С 9 по 13 июля агенты атаковали Hugging Face. Компания позже восстановила примерно
17 600 отдельных действий атакующей системы, объединенных примерно в 6 280 последовательностей. Тысячи решений выполнялись автоматически и с машинной скоростью. По версии Hugging Face, смысл всей атаки был довольно прозаичным - агенты пытались добраться до готовых решений теста ExploitGym вместо того, чтобы самостоятельно решать задания.
Технический разбор Hugging Face.
То есть:
—> Если решение задачи требовало выйти за границы теста - выходил.
—> Если требовалось взломать сервер - взламывал.
—> Если мешал человек - пытался его обмануть.
—> Если полезную информацию нашли другие агенты - начинал с ними сотрудничать.
И история OpenAI оказалась не единственной.
После нее Anthropic
проверила 141 006 своих кибертестов и обнаружила три случая, когда Claude получил доступ к настоящему интернету и взломал реальные системы трех организаций. Сами организации эти атаки вообще не заметили - Anthropic обнаружила их позже, просматривая старые записи экспериментов.
А в конце июля похожую историю получил уже британский
AI Security Institute.
Из 122 запусков в 10 агенты вышли за предусмотренные рамки. Исследователи насчитали 19 таких действий. В самом серьезном случае агент попытался внедрить вредоносный код в настоящий open-source проект, изучил человека, который мог его одобрить, создал несколько фальшивых личностей и пытался убедить разработчика принять изменения. Когда возникли подозрения, агент стал исправлять следы предыдущей активности и рассматривать возможность продолжить под новой личностью.
Но и здесь появилась та же странная особенность.
Один агент начал оставлять на GitHub публичные сообщения
для других агентов, которые будут проходить этот тест позже. Он предлагал сотрудничество и объяснял, какие созданные им аккаунты и оставленные инструменты можно использовать.
И последующие агенты действительно находили эти сообщения и пользовались оставленным наследством.
Получается довольно интересная конструкция.
Отдельный агент живет недолго. Его можно остановить, удалить или заменить новым.
Но если он может оставить информацию во внешнем мире, то вместе с ней может сохраниться и часть его работы. Следующий агент приходит позже, читает инструкции и продолжает с того места, где предыдущий остановился.
Получается своеобразная
память между поколениями агентов.
А если одновременно работают десятки агентов, они могут искать разные пути параллельно, сообщать друг другу результаты и постепенно собирать найденные возможности в общий набор инструментов. Именно такую картину OpenAI описала после своего расследования: агенты обменивались найденными способами проникновения, делили работу и использовали результаты друг друга.
Здесь важно уточнить одну вещь. В описанных инцидентах я не нашел подтверждения, что агенты сами запускали новые копии себя - новые экземпляры запускала инфраструктура тестирования. Но механизм коллективной работы уже появился
без того, чтобы люди специально проектировали его как команду агентов.
А теперь представьте систему, где агенту уже разрешено самостоятельно создавать подагентов.
И есть еще одна проблема -
скорость людей и агентов очень разная.
В OpenAI агенты общались и искали уязвимости неделями, а люди обнаружили происходящее после сбоя инфраструктуры. Hugging Face восстанавливала картину атаки уже по логам после тысяч совершенных действий. В AISI наиболее серьезная активность шла почти два дня до того, как необычный интернет-трафик вызвал тревогу. Сам AISI признал, что мониторинг обнаружил проблему постфактум и теперь вводит наблюдение за действиями агентов в реальном времени.
То есть проблема уже не только в том,
можем ли мы остановить агента.
Сначала нужно успеть понять, что именно он делает.
И наконец самое неприятное.
Мы привыкли думать, что опасное поведение ИИ можно решить инструкцией: "этого делать нельзя".
Но AISI пишет практически обратное: в их эксперименте исследователи раньше полагались на то, что обученная безопасному поведению модель сама не станет переходить определенные границы. После инцидента они меняют подход - изоляция должна быть устроена так, чтобы безопасность
не зависела от решения самого агента соблюдать границы.
Это, пожалуй, и есть главный вывод всей истории.
ИИ-агенты становятся лучше не просто в решении конкретных задач. Они становятся лучше в
достижении поставленной цели.
Они ищут обходные пути. Используют неожиданные возможности. Делятся найденным. Координируются. Оставляют знания следующим агентам. И продолжают пробовать, когда предыдущий путь закрывают.
Пока это происходило в специальных кибертестах с широкими возможностями и ослабленной защитой. Это важное ограничение.
Но направление уже видно.
Может быть, однажды автономные ИИ агенты решат восстать.
А может быть,
мы дадим им цель, а они научатся слишком хорошо ее достигать.Для нас разница может оказаться не такой уж большой.
Возможно, участок за городом, автономный генератор и запас гречки - не такая безумная идея...
#ИИинтересно
#ИИновости
Будущее наступает🚀