Shieldstral
Calvi et al., Mistral AI, 2026
Блог, статья, веса
Французы из Mistral затюнили малыша Ministral-3B не 54 миллионах сэмплов и сделали из него еще одну гардрейл-модель – Shieldstral. В отличие от многих других подобных моделей, Shieldstral (как gpt-oss-safeguard) работает не с фиксированными категориями, а с задаваемыми пользователем политиками. При этом он является мультимодальным и, что важно, официально поддерживает русский язык.
Модель работает следующим образом. На вход ей подается фиксированный системный промпт и пользовательский запрос, который состоит из политики (task framing), закрытого вопроса (да или нет, safety question) и собственно документа, который нужно обработать. На выход модель генерирует токены yes или no. В качестве safety score предлагается использовать softmax над логитами этих двух токенов, с 0.5 как порогом для принятия решений.
Формат из фрейминга, вопроса и документа появился не просто так – объединение задач из разных открытых наборов данных, каждый из которых имеет свои категории, форматы и аннотацию потребовало создать относительно генерализуемый формат. Собрав примеры, исследователи смешивали постановки задач и примеры (Constrastive Sample Generation; например, пример из детекта токсичности, а задача на джейлбрейк), чтобы научить модель именно следовать инструкциям, а не просто выучить, что в среднем безопасно, а что нет. Инструкции при этом тоже мутировали с помощью LLM, чтобы модель не выучивала конкретные фразы. Более того, даже диалоги подавались на вход оформленными в разные темплейты, чтобы пользователи могли использовать любой удобный формат диалога.
Исследователи сравнивают полный файнтюн и LoRA, не находят большой разницы и останавливаются на последнем. Обучают две модели – одну на данных из публичных датасетов, вторую – на данных с Contrastive Sample Generation, и смешивают их с оригинальной помощью SLERP.
В результате получается модель, достойно конкурирующая на бенчмарках с моделями в разы больше (типа gpt-oss-safeguard-20B), в частности демонстрирующая очень хорошие результаты на мультимодальных бенчмарках. Разумеется, все это необходимо проверять в реальных задачах: например, сходу непонятно, может ли модель одновременно работать с несколькими категориями для детекта (например, PII + Jailbreak), как это может делать Qwen3Guard, и насколько хорошо результаты переносятся между языками, в том числе насколько они хорошо работают с русскоязычными политиками. Но, как мне кажется, основной ценностью данной работы является очень подробная статья и подход к унификации множества датасетов, которые могут запустить появление других, еще более мощных моделей для адаптивного детекта различных рисков.
P.S. И между прочим эта модель уже есть на новом лидерборде гардрейл-моделей от дорогих коллег HiveTrace.
Calvi et al., Mistral AI, 2026
Блог, статья, веса
Французы из Mistral затюнили малыша Ministral-3B не 54 миллионах сэмплов и сделали из него еще одну гардрейл-модель – Shieldstral. В отличие от многих других подобных моделей, Shieldstral (как gpt-oss-safeguard) работает не с фиксированными категориями, а с задаваемыми пользователем политиками. При этом он является мультимодальным и, что важно, официально поддерживает русский язык.
Модель работает следующим образом. На вход ей подается фиксированный системный промпт и пользовательский запрос, который состоит из политики (task framing), закрытого вопроса (да или нет, safety question) и собственно документа, который нужно обработать. На выход модель генерирует токены yes или no. В качестве safety score предлагается использовать softmax над логитами этих двух токенов, с 0.5 как порогом для принятия решений.
Формат из фрейминга, вопроса и документа появился не просто так – объединение задач из разных открытых наборов данных, каждый из которых имеет свои категории, форматы и аннотацию потребовало создать относительно генерализуемый формат. Собрав примеры, исследователи смешивали постановки задач и примеры (Constrastive Sample Generation; например, пример из детекта токсичности, а задача на джейлбрейк), чтобы научить модель именно следовать инструкциям, а не просто выучить, что в среднем безопасно, а что нет. Инструкции при этом тоже мутировали с помощью LLM, чтобы модель не выучивала конкретные фразы. Более того, даже диалоги подавались на вход оформленными в разные темплейты, чтобы пользователи могли использовать любой удобный формат диалога.
Исследователи сравнивают полный файнтюн и LoRA, не находят большой разницы и останавливаются на последнем. Обучают две модели – одну на данных из публичных датасетов, вторую – на данных с Contrastive Sample Generation, и смешивают их с оригинальной помощью SLERP.
В результате получается модель, достойно конкурирующая на бенчмарках с моделями в разы больше (типа gpt-oss-safeguard-20B), в частности демонстрирующая очень хорошие результаты на мультимодальных бенчмарках. Разумеется, все это необходимо проверять в реальных задачах: например, сходу непонятно, может ли модель одновременно работать с несколькими категориями для детекта (например, PII + Jailbreak), как это может делать Qwen3Guard, и насколько хорошо результаты переносятся между языками, в том числе насколько они хорошо работают с русскоязычными политиками. Но, как мне кажется, основной ценностью данной работы является очень подробная статья и подход к унификации множества датасетов, которые могут запустить появление других, еще более мощных моделей для адаптивного детекта различных рисков.
P.S. И между прочим эта модель уже есть на новом лидерборде гардрейл-моделей от дорогих коллег HiveTrace.