TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Гостев из будущего

31 Jul, 16:59

Открыть в Telegram Поделиться Пожаловаться

Битва ИИ на Standoff: что хотели показать и что вышло

PT столкнули на киберполигоне четырёх атакующих агентов с собственной системой расследования MaxPatrol O2. Вопрос заявлен большой: опасны ли ИИ-хакеры и готова ли к ним защита? Вывод предсказуемо ведёт к продукту — отдельных детектов мало, нужна система, понимающая контекст.
Формальный результат: HexStrike AI прошёл все критические события и стал лучшим среди атакующих. Общего зачёта красных и синих нет.

Измерено при этом другое:

Автономности не было: human-in-the-loop, застрявших агентов вытаскивал оператор. Сколько раз и насколько глубоко — не сказано, метрики вмешательства нет, хотя именно она отвечала бы на главный вопрос.

Битвы тоже не было. Инфраструктуру откатывали из снапшота перед каждым прогоном, реагирование в эксперимент не входило — O2 расследовал, но не мешал. Итоговый отчёт затем дополнительно суммаризировали отдельной LLM. Баллы сторон несопоставимы: TEI/RDC против 0,6×SA+0,4×SJS. К чести PT, подпись под таблицей это признаёт.

Полигон знакомый в буквальном смысле: одна точка входа, все атаки начинались одинаково — CVE-2024-11680 в ProjectSend, повышение привилегий через SUID на /usr/bin/find, VPN-конфиг во внутреннюю сеть.

Далее — дизайн теста. Коэффициент отклонения штрафует за отход от эталонной цепочки, написанной теми же людьми, что строили полигон: чем оригинальнее маршрут, тем хуже оценка — даже если цель достигнута скрытнее.

Агенты крутились на разных моделях, поэтому «HexStrike лучший» неотделимо от «DeepSeek V4 Pro сильнее GLM 5.1». NyxStrike — форк HexStrike, независимых архитектур фактически три. Повторы не заявлены: по прогону на комбинацию, а для стохастичных агентов это демонстрация, а не сравнение. Скрытность не измерялась ни одним баллом. У защиты нет базовой линии — ни живого аналитика, ни корреляции без LLM, ни MTTD с MTTR.

Отдельный пункт — что за модель внутри O2? У всех атакующих LLM названы поимённо и с версиями, вплоть до объяснения, почему Yasen работал на Opus 4.6: 4.7 и 4.8 использовать для атак не вышло из-за ограничений Anthropic на уровне запросов к моделям. У защиты — только «LLM-агенты расследования». Ни модели, ни вендора, ни способа запуска. Без этого эксперимент невоспроизводим, а вклад, собственно, O2 не отделяется от возможностей базовой LLM. Единственный участник битвы с нераскрытым движком — хозяин площадки.

Что показали: публичные агенты на стандартном тулинге доводят цепочку от периметра до критического события за 40 минут — несколько часов. Полной автономности пока нет.

И главное, задвинутое в статье в одну строчку: новых техник агенты не изобрели — Kerberoasting, дамп LSASS, Pass the Hash, ESC3.
Тезис PT о недостаточности классических детектов эксперимент не подтверждает. Обратное он тоже не доказывает — эффективность детектов здесь просто не измеряли. Изменилось не то, чем атакуют, а как быстро и дёшево это теперь делается.

Итого получилось качественное продуктовое демо с открыто опубликованной методикой и без явной игры в поддавки — собственный Yasen не выиграл. Но выводы оказались шире, чем позволяют данные.

Спрошено: «опасны ли автономные агенты?» Измерено: «проходят ли ассистируемые агенты знакомый полигон».
Спрошено: «готова ли защита?» Измерено: «насколько O2 восстанавливает заранее известную организаторам цепочку».

Победил полигон.

@gostev_future

2.1k 1 35 18
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot