NVIDIA опубликовала фреймворк для обучения самых сложных моделей
Речь о Megatron Core MoE — фреймворке для тренировки Mixture-of-Experts моделей(MoE). Именно такую архитектуру используют DeepSeek-V3, Qwen3 и тд.
Идея MoE в том, чтобы каждый раз задействовать всю модель, для каждого запроса активируется только часть экспертов.
MoE-модели создали новый класс инфраструктурных проблем, которые не решаются масштабированием старых методов. Нужна была новая архитектура параллелизма. Именно это и есть Megatron Core MoE.
Умение эффективно обучать MoE - это сейчас один из главных конкурентных рвов в ИИ. Не архитектура модели, не данные, а именно инфраструктурный стек.
NVIDIA открывает Megatron Core как open-source, но это не альтруизм, а способ сделать своё железо безальтернативным стандартом для всех, кто хочет тренировать модели следующего поколения.
Больше полезных материалов у нас на Patreon
Речь о Megatron Core MoE — фреймворке для тренировки Mixture-of-Experts моделей(MoE). Именно такую архитектуру используют DeepSeek-V3, Qwen3 и тд.
Идея MoE в том, чтобы каждый раз задействовать всю модель, для каждого запроса активируется только часть экспертов.
MoE-модели создали новый класс инфраструктурных проблем, которые не решаются масштабированием старых методов. Нужна была новая архитектура параллелизма. Именно это и есть Megatron Core MoE.
Умение эффективно обучать MoE - это сейчас один из главных конкурентных рвов в ИИ. Не архитектура модели, не данные, а именно инфраструктурный стек.
NVIDIA открывает Megatron Core как open-source, но это не альтруизм, а способ сделать своё железо безальтернативным стандартом для всех, кто хочет тренировать модели следующего поколения.
Больше полезных материалов у нас на Patreon