TGStat
TGStat
Type to search
Advanced channel search
  • flag English
    Site language
    flag Russian flag English flag Uzbek
  • Sign In
  • Catalog
    Channels and groups catalog Regional compilations Thematic compilations Платные каналы Search for channels
    Add a channel/group
  • Ratings
    Rating of channels Rating of groups Posts rating
    Ratings of brands and people
  • Analytics
  • Search by posts
  • Telegram monitoring
  • Promotion
    Advertising through Yandex Business Advertising in channels through TGStat Agency Advertising on TGStat.ru website
llm security и каланы

7 Aug, 17:23

Open in Telegram Share Report

Prev Next
Shieldstral
Calvi et al., Mistral AI, 2026
Блог, статья, веса

Французы из Mistral затюнили малыша Ministral-3B не 54 миллионах сэмплов и сделали из него еще одну гардрейл-модель – Shieldstral. В отличие от многих других подобных моделей, Shieldstral (как gpt-oss-safeguard) работает не с фиксированными категориями, а с задаваемыми пользователем политиками. При этом он является мультимодальным и, что важно, официально поддерживает русский язык.

Модель работает следующим образом. На вход ей подается фиксированный системный промпт и пользовательский запрос, который состоит из политики (task framing), закрытого вопроса (да или нет, safety question) и собственно документа, который нужно обработать. На выход модель генерирует токены yes или no. В качестве safety score предлагается использовать softmax над логитами этих двух токенов, с 0.5 как порогом для принятия решений.

Формат из фрейминга, вопроса и документа появился не просто так – объединение задач из разных открытых наборов данных, каждый из которых имеет свои категории, форматы и аннотацию потребовало создать относительно генерализуемый формат. Собрав примеры, исследователи смешивали постановки задач и примеры (Constrastive Sample Generation; например, пример из детекта токсичности, а задача на джейлбрейк), чтобы научить модель именно следовать инструкциям, а не просто выучить, что в среднем безопасно, а что нет. Инструкции при этом тоже мутировали с помощью LLM, чтобы модель не выучивала конкретные фразы. Более того, даже диалоги подавались на вход оформленными в разные темплейты, чтобы пользователи могли использовать любой удобный формат диалога.

Исследователи сравнивают полный файнтюн и LoRA, не находят большой разницы и останавливаются на последнем. Обучают две модели – одну на данных из публичных датасетов, вторую – на данных с Contrastive Sample Generation, и смешивают их с оригинальной помощью SLERP.

В результате получается модель, достойно конкурирующая на бенчмарках с моделями в разы больше (типа gpt-oss-safeguard-20B), в частности демонстрирующая очень хорошие результаты на мультимодальных бенчмарках. Разумеется, все это необходимо проверять в реальных задачах: например, сходу непонятно, может ли модель одновременно работать с несколькими категориями для детекта (например, PII + Jailbreak), как это может делать Qwen3Guard, и насколько хорошо результаты переносятся между языками, в том числе насколько они хорошо работают с русскоязычными политиками. Но, как мне кажется, основной ценностью данной работы является очень подробная статья и подход к унификации множества датасетов, которые могут запустить появление других, еще более мощных моделей для адаптивного детекта различных рисков.

P.S. И между прочим эта модель уже есть на новом лидерборде гардрейл-моделей от дорогих коллег HiveTrace.

672 0 17 1 3
Catalog
Channels and groups catalog Channels compilations Search for channels Add a channel/group
Ratings
Rating of Telegram channels Rating of Telegram groups Posts rating Ratings of brands and people
API
API statistics Search API of posts API Callback
Our channels
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Read
Академия TGStat Telegram Research 2019 Telegram Research 2021 Telegram Research 2023
Contacts
Справочный центр Support Email Jobs
Miscellaneous
Terms and conditions Privacy policy Public offer
Our bots
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot