Китайцы не сдержались и перед Новым годом довыполнили KPI, сделав ещё один громкий анонс.
Alibaba представили новую версию своей модели — Qwen2.5-Max с архитектурой Mixture-of-Expert (это когда для экономии ресурсов в ответ на запрос пользователя активируются не все параметры, а только та часть, которая релевантнее всего на него ответит — нужный «эксперт» внутри модели).
Главная особенность — Qwen2.5-Max обучалась на 20 триллионах токенов. Видимо, компания даже взяла для этого где-то видеокарты. То есть санкции всё-таки «работают»…
На бенчмарках модель показывает себя вроде как даже лучше Deepseek V3, не говоря о многострадальных GPT-4o и Claude Sonnet, которых китайцы совсем уже не жалеют (а зря).
Правда, разница с тем же Deepseek минимальная, а стоит API сильно дороже. Так ещё и модель с закрытым исходным кодом. Но для простых пользователей бесплатно можно использовать через чат. В чате, кстати, ещё есть генерация картинок и видео, хотя по качеству они пока довольно посредственные в сравнении с конкурентами.
Как китайцы умудряются быть такими продуктивными? У этого есть своё объяснение — один из ведущих разработчиков этой модели и исследователь NLP в Alibaba Биньюань Хуэй начинает работать в 10 и заканчивает в 21, хотя даже после этого продолжает проверять прогресс модели и думать над развитием проекта.
Alibaba представили новую версию своей модели — Qwen2.5-Max с архитектурой Mixture-of-Expert (это когда для экономии ресурсов в ответ на запрос пользователя активируются не все параметры, а только та часть, которая релевантнее всего на него ответит — нужный «эксперт» внутри модели).
Главная особенность — Qwen2.5-Max обучалась на 20 триллионах токенов. Видимо, компания даже взяла для этого где-то видеокарты. То есть санкции всё-таки «работают»…
На бенчмарках модель показывает себя вроде как даже лучше Deepseek V3, не говоря о многострадальных GPT-4o и Claude Sonnet, которых китайцы совсем уже не жалеют (а зря).
Правда, разница с тем же Deepseek минимальная, а стоит API сильно дороже. Так ещё и модель с закрытым исходным кодом. Но для простых пользователей бесплатно можно использовать через чат. В чате, кстати, ещё есть генерация картинок и видео, хотя по качеству они пока довольно посредственные в сравнении с конкурентами.
Как китайцы умудряются быть такими продуктивными? У этого есть своё объяснение — один из ведущих разработчиков этой модели и исследователь NLP в Alibaba Биньюань Хуэй начинает работать в 10 и заканчивает в 21, хотя даже после этого продолжает проверять прогресс модели и думать над развитием проекта.