Anthropic выпустила open source инструмент для оценки безопасности LLM
По мере роста возможностей LLM и необходимость в их систематической оценке. Petri основан на оценках выравнивания из System Cards Claude 4 и 4.5.
Petri автоматизирует тестирование моделей по нескольким направлениям:
1. Склонность к нежелательному поведению
2. Попытки обмана пользователя
3. Чрезмерная угодливость
4. Поддержка заблуждений пользователя.
По мере роста возможностей LLM и необходимость в их систематической оценке. Petri основан на оценках выравнивания из System Cards Claude 4 и 4.5.
Petri автоматизирует тестирование моделей по нескольким направлениям:
1. Склонность к нежелательному поведению
2. Попытки обмана пользователя
3. Чрезмерная угодливость
4. Поддержка заблуждений пользователя.