Самое обсуждаемое сегодня - работа Meta,где раскрываются секреты масштабирования RL для LLM
Сегодня все хвалят работу команды Meta AI(запрещенная в РФ), которая исследовала, как масштабировать обучение с подкреплением (RL) для LLMs.
Использовали 400 000 GPU-часов на Nvidia GB200, чтобы протестировать разные подходы RL и вывести законы масштабирования, аналогичные тем, что есть для предобучения.
Работа даёт инструмент для планирования RL-экспериментов: тестируй на малом масштабе, экстраполируй результат.
Это экономит ресурсы и делает RL более предсказуемым, как предобучение.
Сегодня все хвалят работу команды Meta AI(запрещенная в РФ), которая исследовала, как масштабировать обучение с подкреплением (RL) для LLMs.
Использовали 400 000 GPU-часов на Nvidia GB200, чтобы протестировать разные подходы RL и вывести законы масштабирования, аналогичные тем, что есть для предобучения.
Работа даёт инструмент для планирования RL-экспериментов: тестируй на малом масштабе, экстраполируй результат.
Это экономит ресурсы и делает RL более предсказуемым, как предобучение.