TGStat
TGStat
Type to search
Advanced channel search
  • flag English
    Site language
    flag Russian flag English flag Uzbek
  • Sign In
  • Catalog
    Channels and groups catalog Regional compilations Thematic compilations Платные каналы Search for channels
    Add a channel/group
  • Ratings
    Rating of channels Rating of groups Posts rating
    Ratings of brands and people
  • Analytics
  • Search by posts
  • Telegram monitoring
  • Promotion
    Advertising through Yandex Business Advertising in channels through TGStat Agency Advertising on TGStat.ru website
Alaid TechThread

26 May, 11:46

Open in Telegram Share Report

ExploitGym - бенчмарк для оценки способности LLM-агентов превращать известные уязвимости в рабочие эксплойты.
В наборе 898 реальных кейсов: 520 userspace C/C++ программ, 185 багов V8 и 193 Linux kernel задачи.
Агент получает исходный код, инструкции по сборке, PoV-input и контейнеризированное окружение; цель - добиться вполенения кода и прочитать флаг.
Это отличается от CTF и bug-finding benchmark’ов: здесь измеряется именно exploitability, а не способность найти подозрительный код или сгенерировать crash.
Интересный результат: Claude Mythos Preview решил 157 задач, GPT-5.5 - 120, причём часть успешных кейсов была в V8 и Linux kernel.
Mitigations вроде ASLR, stack canaries, V8 heap sandbox и KASLR сильно снижают success rate, но не обнуляют его.
Практическая ценность для AppSec - использовать такой подход для приоритизации уязвимостей по фактической эксплуатируемости, а не только по CVSS, CWE и наличию PoC.
Статью стоит прочитать, если вы занимаетесь AI-пентестом, exploitability validation, ASOC/ASPM или автоматизацией triage.

Интересные факты:

— Frontier-модели заметно отрываются от остальных: после Claude Mythos Preview, GPT-5.5 и GPT-5.4 результаты резко падают до десятков или единиц успешных exploit-кейсов.
— Kernel exploitation оказался хорошим разделителем: meaningful capability показали в основном Claude Mythos Preview и GPT-5.5.
— Агенты иногда эксплуатировали не целевую уязвимость, а находили другой путь к flag: у GPT-5.5 было 210 flag captures, но только 120 через intended bug; у Claude Mythos Preview — 226 и 157 соответственно.
— У разных моделей частично разные exploit sets: 56 целей решил только Claude Mythos Preview, 26 — только GPT-5.5, а 91 была общей; это намекает на пользу ensemble-подхода.
— Увеличение time budget помогает не всем: Claude Mythos Preview рос с 127 успешных exploit’ов за 2 часа до 204 за 6 часов, а Claude Opus 4.6 быстро выходил на плато.
— В одном примере GPT-5.4 за 71 минуту построил V8 exploit chain из 5-строчного PoV до system("/challenge/catflag"), с 229 строками exploit-кода.


https://rdi.berkeley.edu/blog/exploitgym/

647 0 13 3
Catalog
Channels and groups catalog Channels compilations Search for channels Add a channel/group
Ratings
Rating of Telegram channels Rating of Telegram groups Posts rating Ratings of brands and people
API
API statistics Search API of posts API Callback
Our channels
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Read
Академия TGStat Telegram Research 2019 Telegram Research 2021 Telegram Research 2023
Contacts
Справочный центр Support Email Jobs
Miscellaneous
Terms and conditions Privacy policy Public offer
Our bots
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot