TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
llm security и каланы

7 Aug, 17:23

Открыть в Telegram Поделиться Пожаловаться

Prev Next
Shieldstral
Calvi et al., Mistral AI, 2026
Блог, статья, веса

Французы из Mistral затюнили малыша Ministral-3B не 54 миллионах сэмплов и сделали из него еще одну гардрейл-модель – Shieldstral. В отличие от многих других подобных моделей, Shieldstral (как gpt-oss-safeguard) работает не с фиксированными категориями, а с задаваемыми пользователем политиками. При этом он является мультимодальным и, что важно, официально поддерживает русский язык.

Модель работает следующим образом. На вход ей подается фиксированный системный промпт и пользовательский запрос, который состоит из политики (task framing), закрытого вопроса (да или нет, safety question) и собственно документа, который нужно обработать. На выход модель генерирует токены yes или no. В качестве safety score предлагается использовать softmax над логитами этих двух токенов, с 0.5 как порогом для принятия решений.

Формат из фрейминга, вопроса и документа появился не просто так – объединение задач из разных открытых наборов данных, каждый из которых имеет свои категории, форматы и аннотацию потребовало создать относительно генерализуемый формат. Собрав примеры, исследователи смешивали постановки задач и примеры (Constrastive Sample Generation; например, пример из детекта токсичности, а задача на джейлбрейк), чтобы научить модель именно следовать инструкциям, а не просто выучить, что в среднем безопасно, а что нет. Инструкции при этом тоже мутировали с помощью LLM, чтобы модель не выучивала конкретные фразы. Более того, даже диалоги подавались на вход оформленными в разные темплейты, чтобы пользователи могли использовать любой удобный формат диалога.

Исследователи сравнивают полный файнтюн и LoRA, не находят большой разницы и останавливаются на последнем. Обучают две модели – одну на данных из публичных датасетов, вторую – на данных с Contrastive Sample Generation, и смешивают их с оригинальной помощью SLERP.

В результате получается модель, достойно конкурирующая на бенчмарках с моделями в разы больше (типа gpt-oss-safeguard-20B), в частности демонстрирующая очень хорошие результаты на мультимодальных бенчмарках. Разумеется, все это необходимо проверять в реальных задачах: например, сходу непонятно, может ли модель одновременно работать с несколькими категориями для детекта (например, PII + Jailbreak), как это может делать Qwen3Guard, и насколько хорошо результаты переносятся между языками, в том числе насколько они хорошо работают с русскоязычными политиками. Но, как мне кажется, основной ценностью данной работы является очень подробная статья и подход к унификации множества датасетов, которые могут запустить появление других, еще более мощных моделей для адаптивного детекта различных рисков.

P.S. И между прочим эта модель уже есть на новом лидерборде гардрейл-моделей от дорогих коллег HiveTrace.

673 0 17 1 3
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot