Репост из: LLM Arena
⚡️ Новые модели на арене: обновления декабря и января
❌ В декабре добавили флагманы от Сэма Альтмана и Ляна Вэньфэна: GPT-5.2 и DeepSeek 3.2. В представлении модели не нуждаются, но стоит отметить: они задали новую планку SOTA в задачах Math/Code, подтверждая, что законы масштабирования пока продолжают работать.
Также обновилась на арене и экосистема Яндекса: YandexGPT 5.1 PRO и Alice AI LLM. Архитектуру заметно докрутили — модели стали гораздо лучше держать контекст и сложную инструкцию, став валидным выбором для локальных RAG-сценариев.
❌ Январь: добавили сразу несколько новинок, которые метят в топ лидерборда по эффективности среди свежих моделей:
• Xiaomi MiMo-V2-Flash — MoE (309B total / 15B active). В бенчмарках SWE-bench бьет Claude Sonnet 4.5. По предварительным тестам идеальна для IDE.
• GLM-4.7 — флагман от Z.AI. Значительный буст в мульти-степ задачах и, внезапно, говорят хороша модель для генерации эстетичного фронтенда.
• MiniMax-M2.1 — всего 10B активных параметров. Лидер по соотношению latency/quality. По заявлениям выдает довольно быстро чистый и лаконичный код.
Протестировать можно уже на LLM Arena! Напоминаем, нам очень важны ваши голоса на анонимной арене, так мы можем быстрее обновлять рейтинг, добавляя новые модели.
❌ В декабре добавили флагманы от Сэма Альтмана и Ляна Вэньфэна: GPT-5.2 и DeepSeek 3.2. В представлении модели не нуждаются, но стоит отметить: они задали новую планку SOTA в задачах Math/Code, подтверждая, что законы масштабирования пока продолжают работать.
Также обновилась на арене и экосистема Яндекса: YandexGPT 5.1 PRO и Alice AI LLM. Архитектуру заметно докрутили — модели стали гораздо лучше держать контекст и сложную инструкцию, став валидным выбором для локальных RAG-сценариев.
❌ Январь: добавили сразу несколько новинок, которые метят в топ лидерборда по эффективности среди свежих моделей:
• Xiaomi MiMo-V2-Flash — MoE (309B total / 15B active). В бенчмарках SWE-bench бьет Claude Sonnet 4.5. По предварительным тестам идеальна для IDE.
• GLM-4.7 — флагман от Z.AI. Значительный буст в мульти-степ задачах и, внезапно, говорят хороша модель для генерации эстетичного фронтенда.
• MiniMax-M2.1 — всего 10B активных параметров. Лидер по соотношению latency/quality. По заявлениям выдает довольно быстро чистый и лаконичный код.
Протестировать можно уже на LLM Arena! Напоминаем, нам очень важны ваши голоса на анонимной арене, так мы можем быстрее обновлять рейтинг, добавляя новые модели.