DeepSeek готовится к выходу новой модели R2 и открывает код новых технологий
#DeepSeek не отстает от гонки за выпуск новых лучших моделей, после выходов Anthropic, OpenAI и Google компания собирается выпустить свою новую модель R2 раньше изначально запланированного срока в мае.
Параллельно с этим компания делает стратегический ход, открывая доступ к двум критически важным технологиям: DeepEP и FlashMLA.
DeepEP — первая библиотека с открытым исходным кодом для эффективной коммуникации в моделях на архитектуре Mixture-of-Experts (MoE). Именно эта технология позволила DeepSeek создать свою модель R1, которая превзошла западных конкурентов при значительно меньших затратах на обучение (около $6 млн).
В дополнение к DeepEP, компания представила FlashMLA — высокоэффективный декодирующий модуль для GPU архитектуры Hopper. Этот компонент достигает впечатляющих показателей: 3000 ГБ/с при операциях с памятью и 580 TFLOPS при вычислительных операциях на GPU H800, что критически важно для быстрой работы крупных моделей.
Интересно, как в этот раз стратегия DeepSeek по открытию своих технологий повлияет на западных конкурентов? Что они сделают? Наблюдаем.
#DeepSeek не отстает от гонки за выпуск новых лучших моделей, после выходов Anthropic, OpenAI и Google компания собирается выпустить свою новую модель R2 раньше изначально запланированного срока в мае.
Параллельно с этим компания делает стратегический ход, открывая доступ к двум критически важным технологиям: DeepEP и FlashMLA.
DeepEP — первая библиотека с открытым исходным кодом для эффективной коммуникации в моделях на архитектуре Mixture-of-Experts (MoE). Именно эта технология позволила DeepSeek создать свою модель R1, которая превзошла западных конкурентов при значительно меньших затратах на обучение (около $6 млн).
В дополнение к DeepEP, компания представила FlashMLA — высокоэффективный декодирующий модуль для GPU архитектуры Hopper. Этот компонент достигает впечатляющих показателей: 3000 ГБ/с при операциях с памятью и 580 TFLOPS при вычислительных операциях на GPU H800, что критически важно для быстрой работы крупных моделей.
Интересно, как в этот раз стратегия DeepSeek по открытию своих технологий повлияет на западных конкурентов? Что они сделают? Наблюдаем.