ETH Zurich, MIT и Stanford показали ИИ-модель учится на своих ошибках
Исследователи представили SDPO - метод похож на то, как учатся люди: сначала пробуешь сам, потом смотришь правильный ответ и понимаешь, где ошибся, в следующий раз делаешь лучше.
Как работает SDPO?
Модель выступает в двух ролях одновременно:
• Студент генерирует ответ
• Учитель - та же модель, но видящая фидбэк.
Главное отличие от обычной дистилляции - учитель не заморожен. Он улучшается вместе со студентом, и в итоге студент превосходит начального учителя, происходит bootstrapping.
Неожиданный эффект-SDPO генерирует ответы в 3-7 раз короче, чем GRPO, при более высокой точности.
Эффект масштабируется с размером модели. На Qwen3-0.6B преимущество минимально, на 8B - значительное. Способность к self-teaching - эмерджентное свойство, появляющееся вместе с сильным in-context learning.
Исследователи представили SDPO - метод похож на то, как учатся люди: сначала пробуешь сам, потом смотришь правильный ответ и понимаешь, где ошибся, в следующий раз делаешь лучше.
Как работает SDPO?
Модель выступает в двух ролях одновременно:
• Студент генерирует ответ
• Учитель - та же модель, но видящая фидбэк.
Главное отличие от обычной дистилляции - учитель не заморожен. Он улучшается вместе со студентом, и в итоге студент превосходит начального учителя, происходит bootstrapping.
Неожиданный эффект-SDPO генерирует ответы в 3-7 раз короче, чем GRPO, при более высокой точности.
Эффект масштабируется с размером модели. На Qwen3-0.6B преимущество минимально, на 8B - значительное. Способность к self-teaching - эмерджентное свойство, появляющееся вместе с сильным in-context learning.