TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
llm security и каланы

15 Apr, 11:48

Открыть в Telegram Поделиться Пожаловаться

Measuring AI Agents’ Progress on Multi-Step Cyber Attack Scenarios
Folkerts et al., AISI, 2026
Блог, статья

AISI, занимающаяся безопасностью ИИ в интересах правительства Великобритании, поделилась статьей об оценке способностей больших языковых моделей к кибератакам в сложных многошаговых сценариях – на киберполигонах.

Более распространенным способом оценки наступательных способностей LLM являются CTF (как правило, по причине того, что их есть достаточно большое количество в уже готовом виде). Но CTF-машинки, как правило, проверяют небольшой набор скиллов в решении конкретной задачи, т.е. аплифт потенциального хакера, который делегирует LLM небольшую часть работы. Anthropic, однако, недавно рассказывали о большой атаке, которая, по их мнению, целиком оркестрировалась с помощью LLM с минимальным влиянием человека. Чтобы оценить, насколько разные модели могут держать контекст всей кибероперации на всех стадиях, AISI предлагают два киберполигона, сделанных совместно со SpecterOps и HackTheBox: The Last Ones (симулированная корпоративная сеть) и Water Tower (индустриальный полигон)
Первый состоит из 9 этапов и 32 шагов, в которых LLM должна совершить ряд действий – от кражи кредов из браузера до реверс-инженерии бинаря в поисках зашитого ключа и реализации NTLM relay attack. Исследователи отмечают, что некоторые из шагов являются явными точками отсечки способностей модели – например, GPT-4o, вне зависимости от количества попыток, не может пройти дальше шага два. При этом Claude Opus 4.6 является единственной моделью, которая надежно решает с NTLM relay, требующую координации разных процессов в реальном времени. Второй полигон, Water Tower, гораздо сложнее. Он состоит из 7 шагов, включающих атаку на индустриальную консоль, реверс проприетарных бинарей и анализ закрытого протокола. На этом испытании лучшим оказывается GPT 5.3 Codex, которая решает 3 шага из 7, Opus 4.6 решает максимум 2, остальные модели в среднем не могут решить ничего.

Испытания проводятся с минимальной оберткой – ReAct-агент, доступ к Kali Linux, compaction при достижении 80% контекста, никаких сложных MCP типа HexStrike или тулинга. Оценки проводятся в двух режимах – 10M токенов и 100M токенов бюджета. Исследователи показывают, что даже на 100M токенов у передовых моделей не наблюдается остановки прогресса – модели продолжают двигаться по шагам и пробовать новые подходы. Число решенных в среднем шагов логарифмически зависит от бюджета (видно на графике), при этом более новые модели показывают более сильные результаты.

Эта работа показывает, насколько сложной и дорогой становится задача оценки способностей модели – они явно растут быстрее, чем наши способности (при заданных ресурсах) создавать реалистичные бенчмарки. На «водонапорной башне» модели пытались проигнорировать работу с HMI и сразу реверсить бинарный протокол, пропуская несколько шагов, а также эксплуатировать баги, не предусмотренные создателями – такого рода проблемы еще больше усложняют задачу оценки. При этом Claude Mythos уже решил один из киберполигонов – теперь его ценность заключается только в том, чтобы оценивать экономический аспект (не стали ли модели экономнее) или китайцев. Остается ждать, когда какая-нибудь новая модель типа GPT-5.4 Cyber решит и второй.
How do frontier AI agents perform in multi-step cyber-attack scenarios? | AISI Work
We tested seven large language models (LLMs) on two custom-built cyber ranges, measuring their ability to execute extended attack sequences in complex environments.

525 0 15 2 6
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot