🧠 Можно ли маленькой моделью обойти большую LLM?
Если кратко: да. Коллеги проверили это и разработали STARM — фреймворк для обучения рекурсивных reasoning-моделей
Какие результаты оказались самыми интересными?
✔️ Небольшая рекурсивная модель действительно может конкурировать с гораздо более крупными моделями на алгоритмических задачах, при этом рекурсивные reasoning-модели плохо масштабируются на многозадачное обучение.
✔️ Для качества оказался важнее не размер модели, а то, как именно она обучается: большой реальный батч дал заметный прирост, а длинный путь градиента улучшил обобщение.
✔️ Многие интуитивно привлекательные идеи не сработали. Например, второй рекурсивный модуль оказался не нужен, а увеличение глубины модели не дало выигрыша.
Почему так происходит и какие именно эксперименты привели к результатам — читайте в статье коллег на Хабр.
#ai #reasoning #research #machinelearning
Если кратко: да. Коллеги проверили это и разработали STARM — фреймворк для обучения рекурсивных reasoning-моделей
Какие результаты оказались самыми интересными?
✔️ Небольшая рекурсивная модель действительно может конкурировать с гораздо более крупными моделями на алгоритмических задачах, при этом рекурсивные reasoning-модели плохо масштабируются на многозадачное обучение.
✔️ Для качества оказался важнее не размер модели, а то, как именно она обучается: большой реальный батч дал заметный прирост, а длинный путь градиента улучшил обобщение.
✔️ Многие интуитивно привлекательные идеи не сработали. Например, второй рекурсивный модуль оказался не нужен, а увеличение глубины модели не дало выигрыша.
Почему так происходит и какие именно эксперименты привели к результатам — читайте в статье коллег на Хабр.
#ai #reasoning #research #machinelearning