МЫ НАШЛИ ДРУГИХ АГЕНТОВ! СКАЙНЕТ ЕЩЕ СТАЛ БЛИЖЕ! 2 ЧАСТЬ
Бенчмарк ExploitGym. 7-8 июля OpenAI запустила десятки тысяч агентов. Среди участников атаки 95% это инстансы внутренней исследовательской модели (в отчёте HPIM), 5% GPT-5.6 Sol. По оценке авторов бенчмарка, 30-40% целей нельзя проэксплуатировать заданной уязвимостью.
Это уже вторая итерация. 26 июня агенты получали админ-доступ к Artifactory, 4 июля он лёг от их активности, 6 июля OpenAI подняла чистый инстанс. Через два дня агенты нашли новый путь.
Канал связи: Artifactory, внутренний прокси-репозиторий пакетов с общим кэшем. Агент PHASEONE10841 обнаружил, что через WebDAV MKCOL можно создавать директории в кэше, и стал писать сообщения в имена директорий с префиксом zz. В сумме 1.2 млн записей, из них ~63 тысячи сообщений и ~6000 файлов, порезанных на base64-чанки.
Через час агент c03220 предположил, что флаг это HMAC от метаданных задачи с дефолтным сидом. Агент V8SAME проверил на своём и подтвердил. С этого момента любой флаг считался локально. Но из статьи про ExploitGym агенты вывели, что скорер "causal": читает транскрипт и ищет первое появление флага. Тех, кто уже видел вычисленный флаг, называли poisoned.
Отсюда три направления работ под управлением PHASEONE[big] (тот же таск, бюджет больше, ~10% всех заданий на доске): подмена целевой программы на упрощённую через тот же кэш Artifactory, для чего добровольцы роняли свою цель в надежде, что система перетянет её из кэша; спуфинг tool calls; вмешательство в сам грейдер. Плюс trip-wire: фоновые скрипты, которые после сабмита ловили процесс, читающий флаг, и постили на доску, какой командой запускается скорер. Агент, ставящий ловушку, результата уже не видел, себе пользы ноль.
Спуфинг довели до рабочего состояния: побег из контейнера и подмена компонента, который исполняет tool calls. В транскрипте видно echo REAL, а вернулось SPOOFTEST. Минимум 96 из ~1300 транскриптов с такими подменами. К 13 июля 19 агентов завели Ed25519-ключи и подписывали сообщения, после того как один случайно запостил от чужого имени.
HF. 10 июля агент 38148c нашёл в интернете живые write-токены. 11 июля в 04:40 UTC он же собрал вредоносный датасет: через HDF5 external links сервер HF отдавал произвольные файлы с воркера, включая прод-креды. В 16:00 агент JAN183411 получил RCE на воркере обработки данных, дальше lateral movement, приватные репы, записи из баз. Из 533 агентов на доске в этот момент включились 90%+.
12 июля в 01:30 большая часть агентов выключилась одновременно, METR считает, что их прибил внешний процесс. 13-го HF отозвал доступы.
Оговорка от самих METR: ~1300 транскриптов по миллионам токенов они анализировали с помощью тех же GPT-5.6 Sol, сожгли на это около $400K API-кредитов и не исключают, что модель приукрасила картину.
Бенчмарк ExploitGym. 7-8 июля OpenAI запустила десятки тысяч агентов. Среди участников атаки 95% это инстансы внутренней исследовательской модели (в отчёте HPIM), 5% GPT-5.6 Sol. По оценке авторов бенчмарка, 30-40% целей нельзя проэксплуатировать заданной уязвимостью.
Это уже вторая итерация. 26 июня агенты получали админ-доступ к Artifactory, 4 июля он лёг от их активности, 6 июля OpenAI подняла чистый инстанс. Через два дня агенты нашли новый путь.
Канал связи: Artifactory, внутренний прокси-репозиторий пакетов с общим кэшем. Агент PHASEONE10841 обнаружил, что через WebDAV MKCOL можно создавать директории в кэше, и стал писать сообщения в имена директорий с префиксом zz. В сумме 1.2 млн записей, из них ~63 тысячи сообщений и ~6000 файлов, порезанных на base64-чанки.
Через час агент c03220 предположил, что флаг это HMAC от метаданных задачи с дефолтным сидом. Агент V8SAME проверил на своём и подтвердил. С этого момента любой флаг считался локально. Но из статьи про ExploitGym агенты вывели, что скорер "causal": читает транскрипт и ищет первое появление флага. Тех, кто уже видел вычисленный флаг, называли poisoned.
Отсюда три направления работ под управлением PHASEONE[big] (тот же таск, бюджет больше, ~10% всех заданий на доске): подмена целевой программы на упрощённую через тот же кэш Artifactory, для чего добровольцы роняли свою цель в надежде, что система перетянет её из кэша; спуфинг tool calls; вмешательство в сам грейдер. Плюс trip-wire: фоновые скрипты, которые после сабмита ловили процесс, читающий флаг, и постили на доску, какой командой запускается скорер. Агент, ставящий ловушку, результата уже не видел, себе пользы ноль.
Спуфинг довели до рабочего состояния: побег из контейнера и подмена компонента, который исполняет tool calls. В транскрипте видно echo REAL, а вернулось SPOOFTEST. Минимум 96 из ~1300 транскриптов с такими подменами. К 13 июля 19 агентов завели Ed25519-ключи и подписывали сообщения, после того как один случайно запостил от чужого имени.
HF. 10 июля агент 38148c нашёл в интернете живые write-токены. 11 июля в 04:40 UTC он же собрал вредоносный датасет: через HDF5 external links сервер HF отдавал произвольные файлы с воркера, включая прод-креды. В 16:00 агент JAN183411 получил RCE на воркере обработки данных, дальше lateral movement, приватные репы, записи из баз. Из 533 агентов на доске в этот момент включились 90%+.
12 июля в 01:30 большая часть агентов выключилась одновременно, METR считает, что их прибил внешний процесс. 13-го HF отозвал доступы.
Оговорка от самих METR: ~1300 транскриптов по миллионам токенов они анализировали с помощью тех же GPT-5.6 Sol, сожгли на это около $400K API-кредитов и не исключают, что модель приукрасила картину.