Яндекс выложил AliceAI-Foundation-80B-A3B-Base. Это первая суверенная модель полностью обученная с нуля.
Модель действительно обучена с нуля: свой корпус, свой токенизатор, ~18T токенов, лицензия Apache 2.0 без условий. 80B параметров, 3B активных на токен, контекст 262K. И вот это, по-моему, главная новость: предыдущий флагман Alice AI LLM 235B был инициализирован от Qwen. А тут впервые настоящая собственная база. Сами Яндекс называют её экспериментальной и обкатывают на ней архитектуру будущей рассуждающей модели для агентов Алисы AI.
Архитектура любопытная: три слоя линейного внимания Kimi Delta Attention на один слой обычного, MoE на 512 экспертов, из них 10 активных плюс один общий. Отсюда 262K контекста без взрыва KV-кэша.
Цифры. Сравнивали с базовыми Qwen3.5-35B-A3B, Nemotron-3-Super-120B и DeepSeek-V4-Flash. На русских фактах и экспертных знаниях отрыв большой: WikiWebFacts 86.5 против 62.4 у Qwen, право 49.6 против 27.9. На математике и коде паритет с Qwen того же размера: AIME ровно 96.7 у обеих. На английских знаниях проигрывает крупным: TriviaQA 79 против 89. Два самых сильных бенчмарка собственные яндексовские, но выложены с протоколом, перепроверить можно.
Относительно лидеров опенсорса это другая весовая категория: у Kimi K3 и GLM-5.3 десятки миллиардов активных параметров, тут три. В своём классе это уровень Qwen3.5 плюс русский. Догонят ли быстро, не думаю: разрыв сейчас в post-training и RL для агентов, а этого Яндекс пока не показал.
Кому смотреть: если продукт на русском и про знания, а не про код. Плюс Apache 2.0 закрывает вопрос про иностранные веса, который в госкомпаниях задают постоянно. Минус: 160 GB в bf16, запуск на 4 GPU, квантов пока нет, до чата нужен свой SFT.
huggingface.co/yandex/AliceAI-Foundation-80B-A3B-Base
Модель действительно обучена с нуля: свой корпус, свой токенизатор, ~18T токенов, лицензия Apache 2.0 без условий. 80B параметров, 3B активных на токен, контекст 262K. И вот это, по-моему, главная новость: предыдущий флагман Alice AI LLM 235B был инициализирован от Qwen. А тут впервые настоящая собственная база. Сами Яндекс называют её экспериментальной и обкатывают на ней архитектуру будущей рассуждающей модели для агентов Алисы AI.
Архитектура любопытная: три слоя линейного внимания Kimi Delta Attention на один слой обычного, MoE на 512 экспертов, из них 10 активных плюс один общий. Отсюда 262K контекста без взрыва KV-кэша.
Цифры. Сравнивали с базовыми Qwen3.5-35B-A3B, Nemotron-3-Super-120B и DeepSeek-V4-Flash. На русских фактах и экспертных знаниях отрыв большой: WikiWebFacts 86.5 против 62.4 у Qwen, право 49.6 против 27.9. На математике и коде паритет с Qwen того же размера: AIME ровно 96.7 у обеих. На английских знаниях проигрывает крупным: TriviaQA 79 против 89. Два самых сильных бенчмарка собственные яндексовские, но выложены с протоколом, перепроверить можно.
Относительно лидеров опенсорса это другая весовая категория: у Kimi K3 и GLM-5.3 десятки миллиардов активных параметров, тут три. В своём классе это уровень Qwen3.5 плюс русский. Догонят ли быстро, не думаю: разрыв сейчас в post-training и RL для агентов, а этого Яндекс пока не показал.
Кому смотреть: если продукт на русском и про знания, а не про код. Плюс Apache 2.0 закрывает вопрос про иностранные веса, который в госкомпаниях задают постоянно. Минус: 160 GB в bf16, запуск на 4 GPU, квантов пока нет, до чата нужен свой SFT.
huggingface.co/yandex/AliceAI-Foundation-80B-A3B-Base