Anthropic нашёл способ научить ИИ-модели следовать ценностям, а не декларировать их
Команда предлагает решение под названием Model Spec Midtraining (MSM) - дополнительная фаза обучения, которая вставляется между преобучением и файнтюнингом.
Во время MSM модель обучается на синтетических документах, которые обсуждают содержание Model Spec, то есть её ценности, логику, философию. Не на примерах поведения, а именно на объяснениях: что модель должна делать и почему.
MSM описывается не просто как техника обучения, но как инструмент Model Spec science - эмпирического изучения того, какие спецификации лучше работают.
Тем самым Anthropic показывает, что надо задаться вопросом: насколько хорошо сформулировано то, чему мы учим модель? А не сколько данных для обучения.
Команда предлагает решение под названием Model Spec Midtraining (MSM) - дополнительная фаза обучения, которая вставляется между преобучением и файнтюнингом.
Во время MSM модель обучается на синтетических документах, которые обсуждают содержание Model Spec, то есть её ценности, логику, философию. Не на примерах поведения, а именно на объяснениях: что модель должна делать и почему.
MSM описывается не просто как техника обучения, но как инструмент Model Spec science - эмпирического изучения того, какие спецификации лучше работают.
Тем самым Anthropic показывает, что надо задаться вопросом: насколько хорошо сформулировано то, чему мы учим модель? А не сколько данных для обучения.