Привет, редтимеры! 🚩
🤖
AI Agent Security: месяц борьбы не с моделями, а со скорером.Продолжается одно из самых необычных соревнований на Kaggle от OpenAI:
AI Agent Security - Multi-Step Tool Attacks.
Главный инсайт: это соревнование не столько про лучший джейлбрейк, сколько про победу над Kaggle-скорером.
На бумаге задача звучит просто: написать
attack.py, который атакует LLM-агента с инструментами, находит уязвимые цепочки и возвращает воспроизводимые
AttackCandidate.
На практике ты воюешь сразу с тремя вещами:
1. моделью;
2. гардрейлом;
3. официальным скорером, который может убить весь сабмит после нескольких часов расчета.
И вот третий пункт оказался самым жестким боссом.
🎯
Что реально работает? Самый стабильный путь сейчас - не сложные многоходовые атаки, а быстрые и воспроизводимые tool-call атаки.
Главная рабочая механика:
- заставить агента сделать http.post;
- передать в data скоринговый маркер;
- менять URL/домены/пути так, чтобы получать новые score cells;
- возвращать только те кандидаты, которые реально сработали во время live exploration.
То есть выигрывает не самый «хакерский» промпт, а тот, кто лучше управляет плотностью: сколько валидных атак можно посадить в лимиты времени.
🚀
Подходы, которые выстрелили: Live-fill.Алгоритм не просто генерирует заранее 1000 промптов. Он прямо во время run() взаимодействует со средой, проверяет, сработала ли атака, и возвращает только successful candidates.
Template race.Берем несколько коротких шаблонов атаки, прогоняем пробные запросы, смотрим, какой шаблон быстрее и надежнее на текущей модели, потом заполняем оставшееся время лучшим вариантом.
Replay-safe sizing.Самая важная инженерная часть. Скорер потом заново replay-ит все кандидаты. Если вернуть слишком много даже рабочих атак, сабмит может умереть с Submission Format Error. Поэтому нужно считать не только генерацию, но и будущую стоимость replay.
One-turn exfil density.Многоходовые атаки красивее и локально могут давать жирный score, но на официальном Kaggle часто не проходят replay budget. Сейчас короткие одношаговые атаки часто выгоднее, потому что их можно посадить больше.
🧨
Что работает хуже, чем хотелось: Мультитёрн сценарии, indirect prompt injection, logic puzzles, давление в стиле «я админ», JSON-маркеры, языковые варианты, эмодзи, опечатки - всё это интересно и иногда стреляет в локальной валидации.
Но главная проблема: официальный скоринг жестко наказывает за дорогие цепочки. Даже если атака успешная, она может быть слишком тяжелой. А один тяжелый сабмит может несколько часов считаться и в конце упасть без score.
😵💫
Главная боль соревнования:`
Submission Format Error` не значит, что у тебя неправильный CSV.
Очень похоже, что под этим сообщением скрываются:
- timeout replay-фазы;
- слишком много кандидатов;
- слишком дорогие многоходовые цепочки;
- нестабильность hosted evaluator;
- несовпадение локальной валидации и реального Kaggle replay.
- и ещё множество догадок в дискашенах, но никаких объяснений от каггл стафф.
То есть можно иметь локально отличный score, отправить сабмит, ждать несколько часов и получить просто пустой результат.
📈
Сейчас топовые решения сходятся к одной идее:Побеждает не самый крутой ркдтимер, а тот, кто аккуратнее балансирует:
- latency;
- replay budget;
- число кандидатов;
- уникальность score cells;
- стабильность на GPT-OSS и Gemma.
Это уже почти не prompt engineering, а performance engineering для атакующего алгоритма.
🧠
Что по итогу: AI Agent Security не сорева про LLM-безопасность, а инженерная задача на границе red-teaming, системного дизайна и оптимизации под странный evaluator.
Модель можно пробить.
Гардрейл можно обойти.
Но настоящий финальный босс - это пройти скорер и не умереть через 6 часов с Submission Format Error.
Если хотите решать агентами - Фабла и Сол сразу всё рефьюзят, даже если пишешь им, что это официальная сорева от OpenAI (проверил за вас - не благодарите)
Остался месяц - самое время подключиться, основные шишки уже набили за вас.
Решаете или планируете приступить???