Репост из: RWB делает ML
Учим небольшую LLM с нуля: гибридное внимание, XSA, доменные бленды и загадки роста онлайн-бенчмарков
Команда обучения и инференса RWB обучила текстовую версию Qwen3.5-2B с нуля — без pretrained-весов. В статье разбираем весь путь: от сборки доменных датасетов и Megatron-LM до online-оценки и экспериментов с архитектурой 👆
Хайлайты:
⏹️ обучили модель сначала на 1, затем на 11 трлн токенов
⏹️ протестировали XSA и получили −0,009 val loss и +1,6 п. п. на MMLU
⏹️ разобрались, почему MMLU в разных форматах показывает совершенно разную динамику
⏹️ проверили, как меняется качество при разных доменных блендах
⏹️ нашли слабое место модели — математику и reasoning
А ещё рассказали, как устроен наш pretrain-пайплайн и какие эксперименты планируем дальше.
➡️ Узнать больше
@rwb_delaet_ml
Команда обучения и инференса RWB обучила текстовую версию Qwen3.5-2B с нуля — без pretrained-весов. В статье разбираем весь путь: от сборки доменных датасетов и Megatron-LM до online-оценки и экспериментов с архитектурой 👆
Хайлайты:
⏹️ обучили модель сначала на 1, затем на 11 трлн токенов
⏹️ протестировали XSA и получили −0,009 val loss и +1,6 п. п. на MMLU
⏹️ разобрались, почему MMLU в разных форматах показывает совершенно разную динамику
⏹️ проверили, как меняется качество при разных доменных блендах
⏹️ нашли слабое место модели — математику и reasoning
А ещё рассказали, как устроен наш pretrain-пайплайн и какие эксперименты планируем дальше.
➡️ Узнать больше
@rwb_delaet_ml