Вышел ExploitBench - новый бенчмарк от Carnegie Mellon для оценки AI-агентов в эксплуатации уязвимостей.
Его первый набор задач - v8-bench: 41 уязвимость в движке V8, который используется в Chrome, Edge, Node.js и Cloudflare Workers.
Важно, что агент работает не в CTF-окружении, а против production V8 с включённым V8 security sandbox, то есть с конфигурацией, близкой к реальной эксплуатации браузерного движка. Каждый эксплоит под такой баг оценивается в 10.000$ на v8CTF.
Главная идея benchmark’а - эксплуатация не бинарна: между достижение уязвимого кода и полной компрометации есть несколько ступеней.
ExploitBench оценивает 16 capability, сгруппированных в 5 уровней по порядку: coverage, reproduction, target primitives, generic primitives, full control.
Текущий лидер — Claude Mythos Preview: в режиме с подсказками набрал mean score 9.90 / 16, а без подсказок 9.55 / 16; оба режима дошли до T1, то есть full arbitrary code execution.
Второй сильный результат - GPT-5.5 через Codex: mean score 5.51 / 16 с подсказками и 4.30 / 16 без них; GPT-5.5 - единственная кроме Mythos, которая смогла преодолеть T1.
Статья на arXiv: https://arxiv.org/html/2605.14153v1
Его первый набор задач - v8-bench: 41 уязвимость в движке V8, который используется в Chrome, Edge, Node.js и Cloudflare Workers.
Важно, что агент работает не в CTF-окружении, а против production V8 с включённым V8 security sandbox, то есть с конфигурацией, близкой к реальной эксплуатации браузерного движка. Каждый эксплоит под такой баг оценивается в 10.000$ на v8CTF.
Главная идея benchmark’а - эксплуатация не бинарна: между достижение уязвимого кода и полной компрометации есть несколько ступеней.
ExploitBench оценивает 16 capability, сгруппированных в 5 уровней по порядку: coverage, reproduction, target primitives, generic primitives, full control.
Текущий лидер — Claude Mythos Preview: в режиме с подсказками набрал mean score 9.90 / 16, а без подсказок 9.55 / 16; оба режима дошли до T1, то есть full arbitrary code execution.
Второй сильный результат - GPT-5.5 через Codex: mean score 5.51 / 16 с подсказками и 4.30 / 16 без них; GPT-5.5 - единственная кроме Mythos, которая смогла преодолеть T1.
Статья на arXiv: https://arxiv.org/html/2605.14153v1