Что случилосьЯндекс
выложил в открытый доступ базовую LLM, обученную с нуля. Это
AliceAI-Foundation-80B-A3B-Base - базовая ллм моделька под лицензией Apache 2.0. И это первая большая LLM Яндекса, обученная полностью с нуля, без инициализации из весов других моделей! (предыдущая Alice AI LLM 235B стартовала с весов Qwen3-235B-A22B)
🔖Эта модель - MoE Transformer на 80B параметров, из которых 3B активных. Состоит из 48 трансформерных блоков с hidden size 2048 и одного multi‑token prediction слоя. Каждый MoE‑слой содержит 512 routed experts с top‑k 10 и один shared expert. А для роутинга используется auxiliary‑loss‑free подход из DeepSeek‑V3. Из 48 attention‑слоёв 36 используют Kimi Delta Attention, а 12 full attention: после каждых трёх KDA‑слоёв расположен один full‑attention‑слой. Для агрегации представлений по глубине используется Attention Residuals (AttnRes), заменяющий обычное суммирование обучаемым взвешиванием.
На 8 из 10 бенчмарков фактологических знаний и экспертных навыков модель занимает первое место среди сравниваемых открытых претрейнов, и особенно сильна в задачах про Россию и русский язык. особенно круто, что работу с инструментами ребята заложили уже срзау в претрейн, потому что сильного reasoning без tool-use недостаточно для агентов. Напомню, что это базовая модель до посттрейна, и поэтому сравнивать напрямую с готовыми ChatGPT, Claude или Gemini некорректно. У нее еще нет ни инстракт SFT, ни полноценного RL.
Для обучения команда фактически пересобрала весь процесс обучения, начиная с корпуса данных и архитектуры до собственных scaling laws. Этапы претрейна состоят из 4-ех стадий, и их можно будет увидеть в таблице во вложении. Для построения же scaling laws брали модели на 5B и 10B параметров, обучали на 100–600B токенов с оптимизатором Muon и линейным scheduler.
Что интересного - первый запуск с предсказанным LR привёл к росту MoE-активаций и резкому скачку loss. Ребята воспроизвели проблему на небольшой модели и после стабилизации активаций вернулись к исходному прогнозу. Также была и еще одна интересность: конфигурация с меньшим batch size (8M, lr 5,5e-4) обошла большую (16M, lr 7,8e-4) в среднем на 0,46 п. п., причём улучшения были на 10 из 59 бенчмарков.
Кстати, по бенчам сравнивались с Alice AI LLM 235B, Qwen3.5-35B-A3B-Base, GLM-4.5-Air-Base (106B-A12B), Nemotron-3-Super-120B-A12B-Base и DeepSeek-V4-Flash-Base (284B-A13B). У модели при этом меньше и общих, и активных параметров, чем у всех, кроме Qwen. На 8 из 10 бенчмарков фактологических знаний, образования и экспертных навыков модель заняла первое место. Особенно сильна в задачах про Россию и русский язык, а на MATH-500 лучшие скоры.
AliceAI-Foundation-80B-A3B-Base предложена как экспериментальная база, на которой коллеги проверяют архитектурные и обучающие решения для будущей единой рассуждающей модели). На её основе будут развивать агентские возможности Алисы AI: посттрейн, SFT, полноценный RL, RLVR, работу с тулами и поиск.
Если вам нужна сильная русскоязычная базовая модель для дообучения - то это самый лучший вариант! Все необходимые подробности есть в техрепорте на Хабре, а веса лежат на HF!
ТехрепортМодель#llm