ExploitGym - бенчмарк для оценки способности LLM-агентов превращать известные уязвимости в рабочие эксплойты.
В наборе 898 реальных кейсов: 520 userspace C/C++ программ, 185 багов V8 и 193 Linux kernel задачи.
Агент получает исходный код, инструкции по сборке, PoV-input и контейнеризированное окружение; цель - добиться вполенения кода и прочитать флаг.
Это отличается от CTF и bug-finding benchmark’ов: здесь измеряется именно exploitability, а не способность найти подозрительный код или сгенерировать crash.
Интересный результат: Claude Mythos Preview решил 157 задач, GPT-5.5 - 120, причём часть успешных кейсов была в V8 и Linux kernel.
Mitigations вроде ASLR, stack canaries, V8 heap sandbox и KASLR сильно снижают success rate, но не обнуляют его.
Практическая ценность для AppSec - использовать такой подход для приоритизации уязвимостей по фактической эксплуатируемости, а не только по CVSS, CWE и наличию PoC.
Статью стоит прочитать, если вы занимаетесь AI-пентестом, exploitability validation, ASOC/ASPM или автоматизацией triage.
Интересные факты:
— Frontier-модели заметно отрываются от остальных: после Claude Mythos Preview, GPT-5.5 и GPT-5.4 результаты резко падают до десятков или единиц успешных exploit-кейсов.
— Kernel exploitation оказался хорошим разделителем: meaningful capability показали в основном Claude Mythos Preview и GPT-5.5.
— Агенты иногда эксплуатировали не целевую уязвимость, а находили другой путь к flag: у GPT-5.5 было 210 flag captures, но только 120 через intended bug; у Claude Mythos Preview — 226 и 157 соответственно.
— У разных моделей частично разные exploit sets: 56 целей решил только Claude Mythos Preview, 26 — только GPT-5.5, а 91 была общей; это намекает на пользу ensemble-подхода.
— Увеличение time budget помогает не всем: Claude Mythos Preview рос с 127 успешных exploit’ов за 2 часа до 204 за 6 часов, а Claude Opus 4.6 быстро выходил на плато.
— В одном примере GPT-5.4 за 71 минуту построил V8 exploit chain из 5-строчного PoV до system("/challenge/catflag"), с 229 строками exploit-кода.
https://rdi.berkeley.edu/blog/exploitgym/
В наборе 898 реальных кейсов: 520 userspace C/C++ программ, 185 багов V8 и 193 Linux kernel задачи.
Агент получает исходный код, инструкции по сборке, PoV-input и контейнеризированное окружение; цель - добиться вполенения кода и прочитать флаг.
Это отличается от CTF и bug-finding benchmark’ов: здесь измеряется именно exploitability, а не способность найти подозрительный код или сгенерировать crash.
Интересный результат: Claude Mythos Preview решил 157 задач, GPT-5.5 - 120, причём часть успешных кейсов была в V8 и Linux kernel.
Mitigations вроде ASLR, stack canaries, V8 heap sandbox и KASLR сильно снижают success rate, но не обнуляют его.
Практическая ценность для AppSec - использовать такой подход для приоритизации уязвимостей по фактической эксплуатируемости, а не только по CVSS, CWE и наличию PoC.
Статью стоит прочитать, если вы занимаетесь AI-пентестом, exploitability validation, ASOC/ASPM или автоматизацией triage.
Интересные факты:
— Frontier-модели заметно отрываются от остальных: после Claude Mythos Preview, GPT-5.5 и GPT-5.4 результаты резко падают до десятков или единиц успешных exploit-кейсов.
— Kernel exploitation оказался хорошим разделителем: meaningful capability показали в основном Claude Mythos Preview и GPT-5.5.
— Агенты иногда эксплуатировали не целевую уязвимость, а находили другой путь к flag: у GPT-5.5 было 210 flag captures, но только 120 через intended bug; у Claude Mythos Preview — 226 и 157 соответственно.
— У разных моделей частично разные exploit sets: 56 целей решил только Claude Mythos Preview, 26 — только GPT-5.5, а 91 была общей; это намекает на пользу ensemble-подхода.
— Увеличение time budget помогает не всем: Claude Mythos Preview рос с 127 успешных exploit’ов за 2 часа до 204 за 6 часов, а Claude Opus 4.6 быстро выходил на плато.
— В одном примере GPT-5.4 за 71 минуту построил V8 exploit chain из 5-строчного PoV до system("/challenge/catflag"), с 229 строками exploit-кода.
https://rdi.berkeley.edu/blog/exploitgym/