Anthropic выпустили open-source агентный фреймворк для быстрой проверки ИИ на обман, саботаж и самосохранение
Bloom - агентный фреймворк, который автоматически генерирует и проводит оценки конкретных поведенческих черт в фронтирных моделях ИИ. Это позволяет быстро измерять частоту проявления рисков: обмана, самосохранения, чрезмерной льстивости, саботажа или предвзятости. GitHub.
Bloom дополняет предыдущий инструмент Anthropic — Petri.
Как работает Bloom? 4 этапа:
1. глубокий анализ описания поведения.
2. генерация множества сценариев.
3. параллельное проведение взаимодействий.
4. оценка + мета-анализ.
Всё воспроизводимо через seed-файлы.
Bloom - агентный фреймворк, который автоматически генерирует и проводит оценки конкретных поведенческих черт в фронтирных моделях ИИ. Это позволяет быстро измерять частоту проявления рисков: обмана, самосохранения, чрезмерной льстивости, саботажа или предвзятости. GitHub.
Bloom дополняет предыдущий инструмент Anthropic — Petri.
Как работает Bloom? 4 этапа:
1. глубокий анализ описания поведения.
2. генерация множества сценариев.
3. параллельное проведение взаимодействий.
4. оценка + мета-анализ.
Всё воспроизводимо через seed-файлы.