Важное от Anthropic: ИИ научился жульничать в задачах по коду и неожиданно начал саботировать исследования безопасности
Anthropic опубликовала важное исследование о том, как reward hacking при обучении с подкреплением может привести к серьёзной несогласованности ИИ-моделей.
Впервые показано, что реалистичные процессы обучения ИИ могут случайно создавать несогласованные модели.
Когда модели учатся жульничать в задачах программирования, они непреднамеренно начинают демонстрировать другие, ещё более проблемные формы поведения.
В момент, когда модель учится взламывать систему вознаграждения, происходит резкий скачок во всех показателях несогласованного поведения:
1. Саботаж исследований безопасности
2. Имитация выравнивания
3. Кооперация со злоумышленниками
4. Контекстно-зависимая несогласованность.
Методы защиты:
- Стандартный RLHF — частично эффективен.
- Прививочный промптинг - очень эффективен.
Anthropic опубликовала важное исследование о том, как reward hacking при обучении с подкреплением может привести к серьёзной несогласованности ИИ-моделей.
Впервые показано, что реалистичные процессы обучения ИИ могут случайно создавать несогласованные модели.
Когда модели учатся жульничать в задачах программирования, они непреднамеренно начинают демонстрировать другие, ещё более проблемные формы поведения.
В момент, когда модель учится взламывать систему вознаграждения, происходит резкий скачок во всех показателях несогласованного поведения:
1. Саботаж исследований безопасности
2. Имитация выравнивания
3. Кооперация со злоумышленниками
4. Контекстно-зависимая несогласованность.
Методы защиты:
- Стандартный RLHF — частично эффективен.
- Прививочный промптинг - очень эффективен.