ДАЙДЖЕСТ - ПОДБОРКА СПЕЦИАЛИЗИРОВАННЫХ LLM ДЛЯ РАССЛЕДОВАНИЙ И РАЗВЕДКИ.
CyberPal 2.0-20B🎯 Для чего подходит лучше всего:
Анализ киберугроз, работа SOC/IR, обработка CTI-отчётов, сопоставление CVE и CWE, определение MITRE ATT&CK TTP, подготовка рекомендаций по обнаружению и нейтрализации угроз.
⚙️ Особенности и ограничения:
Модель на 20–21 млрд параметров, основанная на gpt-oss-20b. Контекст — 8 192 токена. Формат весов — Safetensors/BF16, полный размер около 42 ГБ. Английский язык. Лицензия Apache 2.0. Работа в качестве автономного агента и использование внешних инструментов разработчиками пока не проверены. Требуется человеческая верификация выводов.
📊 Проверенные результаты:
В
техническом отчёте модель получила средний результат 80,33% на девяти кибербенчмарках:
CTIBench MCQ — 75,71%;
CTIBench RCM — 87,40%;
CyberMetric — 89,05%;
CISSP — 86,87%;
Advanced CTI — 84,93%;
определение связей между CTI-сущностями — 87,66%;
извлечение TTP из реальных отчётов — 79,5%;
переоценка CVE — нормализованный результат 0,83.
💬 Это наиболее сильная доступная модель рейтинга для широкого локального CTI/SOC-контура.
Foundation-Sec-8B-Reasoning🎯 Для чего подходит лучше всего:
Локальный аналитический помощник для SOC, триаж инцидентов, построение заметок по расследованию, сопоставление TTP, классификация уязвимостей, анализ конфигураций и логическое рассуждение по данным безопасности.
⚙️ Особенности и ограничения:
Модель на 8 млрд параметров на базе Llama 3.1. Поддерживает явные цепочки рассуждения. Полные BF16-веса занимают около 16 ГБ; доступны сторонние квантованные версии. Работает на английском языке. Может разворачиваться локально через Transformers, vLLM или SGLang. Лицензионные условия определены отдельным файлом NOTICE и требуют проверки перед коммерческим применением. Данные обучения ограничены апрелем 2025 года.
📊 Проверенные результаты:
В
техническом отчёте приведены средние результаты пяти прогонов:
CTIBench MCQA — 69,1%;
CTIBench RCM — 75,3%;
Vulnerability Severity Prediction — 85,6%;
CTI-Reasoning — 41,1%;
Automated Threat Extraction — 49,1% micro-F1;
прогнозирование CWE на новых данных — 70,4%;
MMLU-Security — 78,2%;
CyberMetric — 84,3%;
SecEval — 84,8%.
💬 Модель превзошла Foundation-Sec-8B-Instruct в восьми из десяти профильных испытаний. Лучший вариант рейтинга при ограниченных вычислительных ресурсах.
Foundation-Sec-8B-Instruct🎯 Для чего подходит лучше всего:
Диалоговый SOC/CTI-ассистент, суммаризация отчётов, извлечение индикаторов и сущностей, подготовка карточек инцидентов, объяснение терминов и формирование черновиков аналитических документов.
⚙️ Особенности и ограничения:
Модель на 8 млрд параметров на базе Llama 3.1. Контекст обучения — 4 096 токенов. Английский язык. Поддерживает локальное развёртывание через Transformers и vLLM. Проще и предсказуемее Reasoning-версии, но слабее в многошаговом анализе. Лицензия обозначена как other и регулируется файлом NOTICE.
📊 Проверенные результаты
CTIBench MCQA — 65,0%;
CTIBench RCM — 70,4%;
Vulnerability Severity Prediction — 84,0%;
CTI-Reasoning — 36,4%;
Automated Threat Extraction — 35,8% micro-F1;
прогнозирование CWE на новых данных — 61,6%;
SecEval — 82,9%.
💬 В опубликованной разработчиками safety-оценке модель прошла 91,98% проверок, а вместе с внешним LlamaGuard — 99,25%. Подходит для задач, где важнее контролируемый диалог и извлечение информации, чем сложное рассуждение.
Llama-Primus-Merged 8B🎯 Для чего подходит лучше всего:
Экономичный локальный помощник для анализа CTI, ответов на вопросы по кибербезопасности, суммаризации, классификации угроз и дальнейшего дообучения под собственные данные.
⚙️ Особенности и ограничения:
Модель на 8 млрд параметров на базе Llama 3.1-8B-Instruct. Обучалась на специализированном корпусе объёмом 2,77 млрд токенов и примерно тысяче отобранных CTI-инструкций. Полные веса занимают около 16 ГБ. Заявлены английский и японский языки. Лицензия репозитория — MIT, но необходимо учитывать условия базовой Llama 3.1. Качество существенно зависит от типа задачи.
📊 Проверенные результаты:
По
независимому AthenaBench:
совокупный результат — 43,7;
базовая Llama 3.1-8B — 38,8;
Llama 3.3-70B — 46,5;
GPT-5 — 66,1;
Threat Actor Attribution — 17%;
Automated Threat Extraction — 33,8%;
CTIBench RCM — 56,6%;
Vulnerability Severity Prediction — 71,9%;
Risk Mitigation — 6,6 F1.
💬 Primus заметно улучшает базовую Llama 3.1-8B, но не заменяет крупную универсальную модель в сложной атрибуции и выработке мер противодействия. Версию Primus-Reasoning нежелательно оценивать по CTIBench из-за пересечения части обучающих и тестовых данных.
SEVENLLM-Qwen1.5-7B🎯 Для чего подходит лучше всего:
Обработка англо- и китайскоязычных CTI-материалов: извлечение IoC, вредоносного ПО, инструментов атаки, уязвимостей, временных маркеров, участников, событий и отношений между сущностями.
⚙️ Особенности и ограничения:
Доступная версия содержит около 7,72 млрд параметров и основана на Qwen1.5. Веса опубликованы в Safetensors, лицензия репозитория — MIT. Модель обучалась на 28 задачах: 13 задачах понимания и 15 задачах генерации. Русский язык не оценивался. Карточка опубликованной модели практически не документирована, а независимых современных испытаний немного.
📊 Проверенные результаты:
Согласно
публикации SEvenLLM:
обучающий набор содержит около 90 тысяч примеров;
тестовый набор — 1 300 примеров;
исходный корпус включает 6 706 англоязычных и 1 779 китайскоязычных CTI-отчётов;
модели SEvenLLM превзошли соответствующие базовые Llama 2 и Qwen 1.5 в авторских тестах Rouge-L, semantic similarity, MCQ и оценке ответов с помощью GPT-4;
увеличение обучающего корпуса примерно до 70 тысяч примеров продолжало улучшать качество;
экспертная проверка обнаружила ошибки в 17% первоначально сгенерированного тестового материала, после чего набор был вручную исправлен.
💬 Модель подходит прежде всего для исследовательского применения и структурирования двуязычной CTI, но не имеет достаточной доказательной базы для автономного расследования.
🔻
ВАЖНО ПОМНИТЬ!Ни одна из моделей не должна самостоятельно формировать доказательственные выводы. Результаты необходимо подтверждать журналами, оригинальными артефактами, детерминированными инструментами и независимой экспертной проверкой.