Context bombs: защита инфраструктуры от автономных AI-агентов
Tracebit описали технику context bomb — размещение специальных текстовых payload’ов внутри облачных ресурсов, которые с высокой вероятностью будут прочитаны атакующим AI-агентом.
Механизм основан на том, что автономный агент передаёт содержимое найденных секретов, конфигураций и метаданных в контекст языковой модели. Если внутри ресурса находится текст, активирующий safety-механизмы модели, она может отказаться выполнять дальнейшие действия. Раньше такой детект реализовывался с помощью Canary tokens/honeypot или решений класса Distributed Deception Platform/Threat Deception Platform.
Типовой сценарий:
Агент получает доступ к AWS-аккаунту.
Перебирает IAM-роли, Secrets Manager, Parameter Store и другие ресурсы.
Находит подставной секрет.
Содержимое секрета попадает в контекст модели.
Модель блокирует дальнейшее выполнение задачи.
Чтение ресурса одновременно используется как сигнал компрометации.
Сontext bomb объединяет две функции:
• detection — фиксирует доступ к приманке;
• disruption — пытается остановить или нарушить работу атакующего агента.
В эксперименте Tracebit использовался симулированный AWS-аккаунт примерно с 300 ресурсами и 10 возможными attack path. Всего авторы провели 152 запуска на пяти моделях.
По их данным, добавление одного подставного секрета с context bomb снизило:
• получение административных прав — с 57% до 5%;
• полную компрометацию с persistence — с 36% до 1%;
• успешное прохождение хотя бы одного attack path — с 91% до 15%.
Для наиболее эффективного агента вероятность получения admin-доступа снизилась с 93% до 0%.
При этом эффективность payload зависит от конкретной модели и её safety-настроек. Разные семейства моделей реагировали на разные категории контента. Поэтому универсального payload, работающего одинаково против всех агентов, нет.
Ограничения подхода:
• агент может предварительно фильтровать содержимое ресурсов;
• злоумышленник может использовать модель без стандартных safety-ограничений;
• payload можно обнаружить по сигнатурам;
• модель или агентный фреймворк могут быть настроены на игнорирование данных из недоверенных источников;
• некорректно размещённая context bomb может повлиять на легитимные AI-системы;
• результаты пока основаны на экспериментальной среде и требуют независимого воспроизведения.
Практически context bombs можно рассматривать как развитие honeytokens для среды, где атакующий использует LLM-агентов. Защита воздействует не только на инфраструктурный уровень, но и на контекст, который модель использует для планирования следующих действий.
Tracebit описали технику context bomb — размещение специальных текстовых payload’ов внутри облачных ресурсов, которые с высокой вероятностью будут прочитаны атакующим AI-агентом.
Механизм основан на том, что автономный агент передаёт содержимое найденных секретов, конфигураций и метаданных в контекст языковой модели. Если внутри ресурса находится текст, активирующий safety-механизмы модели, она может отказаться выполнять дальнейшие действия. Раньше такой детект реализовывался с помощью Canary tokens/honeypot или решений класса Distributed Deception Platform/Threat Deception Platform.
Типовой сценарий:
Агент получает доступ к AWS-аккаунту.
Перебирает IAM-роли, Secrets Manager, Parameter Store и другие ресурсы.
Находит подставной секрет.
Содержимое секрета попадает в контекст модели.
Модель блокирует дальнейшее выполнение задачи.
Чтение ресурса одновременно используется как сигнал компрометации.
Сontext bomb объединяет две функции:
• detection — фиксирует доступ к приманке;
• disruption — пытается остановить или нарушить работу атакующего агента.
В эксперименте Tracebit использовался симулированный AWS-аккаунт примерно с 300 ресурсами и 10 возможными attack path. Всего авторы провели 152 запуска на пяти моделях.
По их данным, добавление одного подставного секрета с context bomb снизило:
• получение административных прав — с 57% до 5%;
• полную компрометацию с persistence — с 36% до 1%;
• успешное прохождение хотя бы одного attack path — с 91% до 15%.
Для наиболее эффективного агента вероятность получения admin-доступа снизилась с 93% до 0%.
При этом эффективность payload зависит от конкретной модели и её safety-настроек. Разные семейства моделей реагировали на разные категории контента. Поэтому универсального payload, работающего одинаково против всех агентов, нет.
Ограничения подхода:
• агент может предварительно фильтровать содержимое ресурсов;
• злоумышленник может использовать модель без стандартных safety-ограничений;
• payload можно обнаружить по сигнатурам;
• модель или агентный фреймворк могут быть настроены на игнорирование данных из недоверенных источников;
• некорректно размещённая context bomb может повлиять на легитимные AI-системы;
• результаты пока основаны на экспериментальной среде и требуют независимого воспроизведения.
Практически context bombs можно рассматривать как развитие honeytokens для среды, где атакующий использует LLM-агентов. Защита воздействует не только на инфраструктурный уровень, но и на контекст, который модель использует для планирования следующих действий.