Битва ИИ на Standoff: что хотели показать и что вышло
PT столкнули на киберполигоне четырёх атакующих агентов с собственной системой расследования MaxPatrol O2. Вопрос заявлен большой: опасны ли ИИ-хакеры и готова ли к ним защита? Вывод предсказуемо ведёт к продукту — отдельных детектов мало, нужна система, понимающая контекст.
Формальный результат: HexStrike AI прошёл все критические события и стал лучшим среди атакующих. Общего зачёта красных и синих нет.
Измерено при этом другое:
Автономности не было: human-in-the-loop, застрявших агентов вытаскивал оператор. Сколько раз и насколько глубоко — не сказано, метрики вмешательства нет, хотя именно она отвечала бы на главный вопрос.
Битвы тоже не было. Инфраструктуру откатывали из снапшота перед каждым прогоном, реагирование в эксперимент не входило — O2 расследовал, но не мешал. Итоговый отчёт затем дополнительно суммаризировали отдельной LLM. Баллы сторон несопоставимы: TEI/RDC против 0,6×SA+0,4×SJS. К чести PT, подпись под таблицей это признаёт.
Полигон знакомый в буквальном смысле: одна точка входа, все атаки начинались одинаково — CVE-2024-11680 в ProjectSend, повышение привилегий через SUID на /usr/bin/find, VPN-конфиг во внутреннюю сеть.
Далее — дизайн теста. Коэффициент отклонения штрафует за отход от эталонной цепочки, написанной теми же людьми, что строили полигон: чем оригинальнее маршрут, тем хуже оценка — даже если цель достигнута скрытнее.
Агенты крутились на разных моделях, поэтому «HexStrike лучший» неотделимо от «DeepSeek V4 Pro сильнее GLM 5.1». NyxStrike — форк HexStrike, независимых архитектур фактически три. Повторы не заявлены: по прогону на комбинацию, а для стохастичных агентов это демонстрация, а не сравнение. Скрытность не измерялась ни одним баллом. У защиты нет базовой линии — ни живого аналитика, ни корреляции без LLM, ни MTTD с MTTR.
Отдельный пункт — что за модель внутри O2? У всех атакующих LLM названы поимённо и с версиями, вплоть до объяснения, почему Yasen работал на Opus 4.6: 4.7 и 4.8 использовать для атак не вышло из-за ограничений Anthropic на уровне запросов к моделям. У защиты — только «LLM-агенты расследования». Ни модели, ни вендора, ни способа запуска. Без этого эксперимент невоспроизводим, а вклад, собственно, O2 не отделяется от возможностей базовой LLM. Единственный участник битвы с нераскрытым движком — хозяин площадки.
Что показали: публичные агенты на стандартном тулинге доводят цепочку от периметра до критического события за 40 минут — несколько часов. Полной автономности пока нет.
И главное, задвинутое в статье в одну строчку: новых техник агенты не изобрели — Kerberoasting, дамп LSASS, Pass the Hash, ESC3.
Тезис PT о недостаточности классических детектов эксперимент не подтверждает. Обратное он тоже не доказывает — эффективность детектов здесь просто не измеряли. Изменилось не то, чем атакуют, а как быстро и дёшево это теперь делается.
Итого получилось качественное продуктовое демо с открыто опубликованной методикой и без явной игры в поддавки — собственный Yasen не выиграл. Но выводы оказались шире, чем позволяют данные.
Спрошено: «опасны ли автономные агенты?» Измерено: «проходят ли ассистируемые агенты знакомый полигон».
Спрошено: «готова ли защита?» Измерено: «насколько O2 восстанавливает заранее известную организаторам цепочку».
Победил полигон.
@gostev_future
PT столкнули на киберполигоне четырёх атакующих агентов с собственной системой расследования MaxPatrol O2. Вопрос заявлен большой: опасны ли ИИ-хакеры и готова ли к ним защита? Вывод предсказуемо ведёт к продукту — отдельных детектов мало, нужна система, понимающая контекст.
Формальный результат: HexStrike AI прошёл все критические события и стал лучшим среди атакующих. Общего зачёта красных и синих нет.
Измерено при этом другое:
Автономности не было: human-in-the-loop, застрявших агентов вытаскивал оператор. Сколько раз и насколько глубоко — не сказано, метрики вмешательства нет, хотя именно она отвечала бы на главный вопрос.
Битвы тоже не было. Инфраструктуру откатывали из снапшота перед каждым прогоном, реагирование в эксперимент не входило — O2 расследовал, но не мешал. Итоговый отчёт затем дополнительно суммаризировали отдельной LLM. Баллы сторон несопоставимы: TEI/RDC против 0,6×SA+0,4×SJS. К чести PT, подпись под таблицей это признаёт.
Полигон знакомый в буквальном смысле: одна точка входа, все атаки начинались одинаково — CVE-2024-11680 в ProjectSend, повышение привилегий через SUID на /usr/bin/find, VPN-конфиг во внутреннюю сеть.
Далее — дизайн теста. Коэффициент отклонения штрафует за отход от эталонной цепочки, написанной теми же людьми, что строили полигон: чем оригинальнее маршрут, тем хуже оценка — даже если цель достигнута скрытнее.
Агенты крутились на разных моделях, поэтому «HexStrike лучший» неотделимо от «DeepSeek V4 Pro сильнее GLM 5.1». NyxStrike — форк HexStrike, независимых архитектур фактически три. Повторы не заявлены: по прогону на комбинацию, а для стохастичных агентов это демонстрация, а не сравнение. Скрытность не измерялась ни одним баллом. У защиты нет базовой линии — ни живого аналитика, ни корреляции без LLM, ни MTTD с MTTR.
Отдельный пункт — что за модель внутри O2? У всех атакующих LLM названы поимённо и с версиями, вплоть до объяснения, почему Yasen работал на Opus 4.6: 4.7 и 4.8 использовать для атак не вышло из-за ограничений Anthropic на уровне запросов к моделям. У защиты — только «LLM-агенты расследования». Ни модели, ни вендора, ни способа запуска. Без этого эксперимент невоспроизводим, а вклад, собственно, O2 не отделяется от возможностей базовой LLM. Единственный участник битвы с нераскрытым движком — хозяин площадки.
Что показали: публичные агенты на стандартном тулинге доводят цепочку от периметра до критического события за 40 минут — несколько часов. Полной автономности пока нет.
И главное, задвинутое в статье в одну строчку: новых техник агенты не изобрели — Kerberoasting, дамп LSASS, Pass the Hash, ESC3.
Тезис PT о недостаточности классических детектов эксперимент не подтверждает. Обратное он тоже не доказывает — эффективность детектов здесь просто не измеряли. Изменилось не то, чем атакуют, а как быстро и дёшево это теперь делается.
Итого получилось качественное продуктовое демо с открыто опубликованной методикой и без явной игры в поддавки — собственный Yasen не выиграл. Но выводы оказались шире, чем позволяют данные.
Спрошено: «опасны ли автономные агенты?» Измерено: «проходят ли ассистируемые агенты знакомый полигон».
Спрошено: «готова ли защита?» Измерено: «насколько O2 восстанавливает заранее известную организаторам цепочку».
Победил полигон.
@gostev_future