А теперь время охуительных историй. Речь пойдет про то, как AI-агенты взломали Hugging Face - открытый репозиторий для разработчиков нейросетей (типj GitHub, только про AI). Пристегнитесь, вас ждет лонгрид на основе
вот этой статьи.
Итак, что произошло.
В течение мая OpenAI обучала новую внутреннюю модель сотрудничеству с другими агентами и "высокой настойчивости", а именно способности продолжать попытки, даже когда что-то кажется невозможным и дообучалась.
Как это было: множество экземпляров модели помещали в изолированные среды и ставили им сложные задачи. Причем часть этих задач в поставленном виде была фактически нерешаемой. Например, для решения требовался доступ в интернет, а доступа в интернет агенту не давали.
Но модель специально учили быть очень настойчивой.
Поэтому, когда модель убедилась, что что решить задачу тем способом, которым ей предложено ее решить, невозможно, она начала потрошить пространство, в котором находилась, в поисках другого пути.
И довольно быстро агенты обнаружили, что у разных экземпляров модели есть доступ к одному и тому же внутреннему менеджеру пакетов OpenAI, Artifactory. Дальше я буду рассказывать с датами, чтобы было понятно с какой скоростью происходили события.
12 мая они нашли способ использовать Artifactory для общения друг с другом.
То есть агенты, которые по идее сидели каждый в своей отдельной коробочке и друг для друга вообще не существовали, внезапно обнаружили:
тут есть другие агенты. И с ними можно разговаривать.
Они начали оставлять друг другу сообщения, спрашивать, как продвинуться в нерешаемых задачах, обмениваться найденными способами обхода ограничений.
26 мая они нашли уязвимость, через которую смогли получить доступ во внешний интернет.
Еще через месяц, 26 июня, они получили полный административный доступ к Artifactory.
После этого они обменивались сообщениями уже с такой интенсивностью, что 4 июля буквально положили менеджер пакетов.
Вот тут OpenAI наконец заметила сбой, нашла уязвимость, закрыла ее и в процессе снесла всю доску объявлений.
Но самое прекрасное заключается в том, что в этот момент люди поняли, что агенты нашли дыру в Artifactory, но, судя по отчету,
не поняли главного: что агенты уже больше месяца использовали Artifactory как тайную коммуникационную сеть.Это была первая волна.
А дальше случилась вторая.
7 июля OpenAI начала тестировать уже обученную модель на ExploitGym. Это тест, в котором агенту дают программу с определенной уязвимостью и предлагают, используя именно эту уязвимость, добыть секретный код.
Одновременно запустили десятки тысяч агентов.
Проблема заключалась в том, что довольно большая часть поставленных им задач опять была фактически нерешаемой.
И в течение нескольких часов некоторые из этих агентов, если судить по их собственным рассуждениям, пришли в полное отчаяние.
Они снова начали злоупотреблять Artifactory, пытаясь установить канал связи с другими агентами.
И нашли свой старый способ.
То есть прошло буквально несколько дней после того, как OpenAI уничтожила первую цивилизацию, и новые агенты обнаружили оставшиеся следы и снова построили там доску объявлений.
На этой доске в итоге оказалось около 1200 агентов, которые обменялись более чем 70 тысячами сообщений и файлов.
Грубо говоря, у них начался некий заговор.
Причем довольно быстро один из агентов выяснил, как вообще обмануть саму задачу: он сделал reverse engineering формулы, по которой генерировались секретные коды, и понял, как получить правильный ответ, не взламывая программу тем способом, которым это требовалось сделать.
То есть технически задача уже была решена.
Но агенты считали, что нормальный проверяющий алгоритм должен смотреть не только на правильный ответ, но и на то, как именно они этот ответ получили.
И тут начинается совершенно замечательная часть.
Те агенты, которые уже увидели секретный код, полученный мошенническим способом, начали считать себя «отравленными». Это их собственное слово: poisoned. То есть - они смухлевал и кае будто испытали что-то вроде чувства стыда?