Четыре основных подхода к созданию моделей рассуждений (Reasoning LLMs)
→ Хабр
Статья демонстрирует ключевые методы и стратегии создания специализированных LLM с улучшенными возможностями рассуждения.
⭕️ Что такое модели рассуждений?
Это LLM, оптимизированные для решения сложных задач через многоступенчатую генерацию с промежуточными шагами рассуждения (головоломки, математика, программирование).
🔹 4 основных подхода к созданию:
Масштабирование во время инференса — повышение вычислительных ресурсов при генерации (CoT-промпты, поиск по дереву решений)
Чистое обучение с подкреплением (RL) — обучение без SFT с вознаграждениями за точность и формат
SFT + RL — классический подход тонкой настройки + обучение с подкреплением
Дистилляция — обучение меньших моделей на данных, созданных более крупными моделями рассуждений
🔸 Особенности DeepSeek R1:
Рассуждение как эмерджентное свойство возникает из чистого RL
Флагманская модель использует комбинацию SFT + RL
Более эффективна во время инференса по сравнению с OpenAI o1
🔹 Модели с ограниченным бюджетом:
TinyZero — https://github.com/Jiayi-Pan/TinyZero/ — 3B модель рассуждения, обучение которой стоит менее $30
Sky-T1 — https://novasky-ai.github.io/posts/sky-t1/ — 32B модель, обученная всего за $450 на 17 тыс. примеров
🔸 Важно: модели рассуждений не универсальны — они эффективны для сложных задач, но избыточны для простых вопросов, при этом обычно более многословны и дорогостоящи в использовании.
→ Хабр
Статья демонстрирует ключевые методы и стратегии создания специализированных LLM с улучшенными возможностями рассуждения.
⭕️ Что такое модели рассуждений?
Это LLM, оптимизированные для решения сложных задач через многоступенчатую генерацию с промежуточными шагами рассуждения (головоломки, математика, программирование).
🔹 4 основных подхода к созданию:
Масштабирование во время инференса — повышение вычислительных ресурсов при генерации (CoT-промпты, поиск по дереву решений)
Чистое обучение с подкреплением (RL) — обучение без SFT с вознаграждениями за точность и формат
SFT + RL — классический подход тонкой настройки + обучение с подкреплением
Дистилляция — обучение меньших моделей на данных, созданных более крупными моделями рассуждений
🔸 Особенности DeepSeek R1:
Рассуждение как эмерджентное свойство возникает из чистого RL
Флагманская модель использует комбинацию SFT + RL
Более эффективна во время инференса по сравнению с OpenAI o1
🔹 Модели с ограниченным бюджетом:
TinyZero — https://github.com/Jiayi-Pan/TinyZero/ — 3B модель рассуждения, обучение которой стоит менее $30
Sky-T1 — https://novasky-ai.github.io/posts/sky-t1/ — 32B модель, обученная всего за $450 на 17 тыс. примеров
🔸 Важно: модели рассуждений не универсальны — они эффективны для сложных задач, но избыточны для простых вопросов, при этом обычно более многословны и дорогостоящи в использовании.