🟣Alibaba: 3 релиза за 2 недели
3 августа компания анонсировала флагманскую Qwen3.8-Max, MoE на 2.4 трлн параметров (~95 млрд активных), контекст 1M токенов, модель позиционируют как «вторую после Fable 5». 27 июля тихо, без техотчёта и бенчмарков, вышла бюджетная vision-language Qwen3.7 Flash ($ 0,03 — $ 0,13 за 1M токенов, контекст 1M). 21 июля представили Qwen-Image-3.0, генерация изображений с промптом до 4 500 токенов и рендером текста от 10px, но впервые в линейке без открытых весов, бенчмарков и техотчёта.
🟣DeepSeek: Flash выходит из preview
31 июля DeepSeek перевёл DeepSeek-V4-Flash из preview в стабильную версию (билд 0731), архитектура не менялась, пересобран только пост-трейнинг — заметный рост на агентных бенчмарках (Terminal-Bench 2.1: 82.7, DeepSWE: 54.4), нативная поддержка Responses API и Codex. Цены и название в API прежние.
🟣Thinking Machines Lab: младшая модель обгоняет старшую
30 июля Thinking Machines Lab выпустила Inkling-Small — открытую MoE на 276B параметров (12B активных), которая по эффективности и части reasoning/agentic бенчмарков обгоняет старшую Inkling (975B/41B, релиз 15 июля). Обе модели доступны на Hugging Face.
🟣Agnes AI: бюджетный reasoning с сильным кодингом
24 июля сингапурская Agnes AI представила Agnes 2.5 Pro Alpha — бюджетную reasoning-модель (39 баллов по Artificial Analysis Intelligence Index, контекст 1M, $ 0,45 — $ 0,90 за 1M токенов) с неожиданно сильным coding-скором (58,8) при скромном расходе токенов на рассуждения.
🟣Anthropic: Opus 5 приближается к Fable 5
24 июля Anthropic выпустила Claude Opus 5 — по цене и скорости на уровне Opus 4.8, но по интеллектуальным бенчмаркам (Frontier-Bench, ARC-AGI 3, OSWorld 2.0) приближается к Fable 5, по внутренним оценкам — самая согласованная (aligned) модель компании на сегодня.
🟣Black Forest Labs: единая модель для видео, изображений и звука
23 июля Black Forest Labs анонсировала FLUX 3 (Early Access) — мультимодальную flow-модель, обучаемую совместно на видео, изображениях и аудио в единой архитектуре. Поддерживает генерацию видео с нативным звуком до 20 секунд и первые эксперименты с action-prediction для робототехники.
🟣Google: три Gemini для агентных сценариев
21 июля Google выпустила три модели линейки Gemini: 3.6 Flash (на 17% эффективнее по токенам, чем 3.5 Flash, $ 1,50 — $ 7,50 за 1M), сверхбыстрый 3.5 Flash-Lite (350 ток/с, $ 0,3 — $ 2,5) и специализированный 3.5 Flash Cyber для поиска и патчинга уязвимостей в связке с автономным агентом CodeMender, доступ ограничен госорганизациями и партнёрами.
🟣Poolside: компактная модель против гигантов
21 июля Poolside выпустила Laguna S 2.1 — компактную MoE (118B/8B активных), обученную менее чем за 9 недель, которая на Terminal-Bench 2.1 (70,2) и других long-horizon coding-бенчмарках конкурирует с моделями на порядок крупнее. Веса открыты на Hugging Face.
🟣Moonshot AI: первая открытая модель класса 3T
16 июля Moonshot AI представила Kimi K3 — первую открытую модель класса 3T (2,8 трлн параметров) на архитектуре Kimi Delta Attention, с нативным зрением и контекстом 1M токенов. По собственным данным компании, модель уступает только Claude Fable 5 и GPT-5.6 Sol.
Новые статьи от AI VK на Хабре
🟣Как создавали нейропоиск Discovery AI — технологию для крупнейшей контентной базы в РФ
🟣Как мы подружили LLM с А/Б‑тестами: от сломанного BI до HTML‑отчётов с ИИ‑аналитиком внутри
🟣LLM и психолингвистика: HELPER
🟣Как мы ускорили разметку видеопоиска в десятки раз и не потеряли качество: опыт внедрения VLM-асессора
#aivkhub #дайджест
3 августа компания анонсировала флагманскую Qwen3.8-Max, MoE на 2.4 трлн параметров (~95 млрд активных), контекст 1M токенов, модель позиционируют как «вторую после Fable 5». 27 июля тихо, без техотчёта и бенчмарков, вышла бюджетная vision-language Qwen3.7 Flash ($ 0,03 — $ 0,13 за 1M токенов, контекст 1M). 21 июля представили Qwen-Image-3.0, генерация изображений с промптом до 4 500 токенов и рендером текста от 10px, но впервые в линейке без открытых весов, бенчмарков и техотчёта.
🟣DeepSeek: Flash выходит из preview
31 июля DeepSeek перевёл DeepSeek-V4-Flash из preview в стабильную версию (билд 0731), архитектура не менялась, пересобран только пост-трейнинг — заметный рост на агентных бенчмарках (Terminal-Bench 2.1: 82.7, DeepSWE: 54.4), нативная поддержка Responses API и Codex. Цены и название в API прежние.
🟣Thinking Machines Lab: младшая модель обгоняет старшую
30 июля Thinking Machines Lab выпустила Inkling-Small — открытую MoE на 276B параметров (12B активных), которая по эффективности и части reasoning/agentic бенчмарков обгоняет старшую Inkling (975B/41B, релиз 15 июля). Обе модели доступны на Hugging Face.
🟣Agnes AI: бюджетный reasoning с сильным кодингом
24 июля сингапурская Agnes AI представила Agnes 2.5 Pro Alpha — бюджетную reasoning-модель (39 баллов по Artificial Analysis Intelligence Index, контекст 1M, $ 0,45 — $ 0,90 за 1M токенов) с неожиданно сильным coding-скором (58,8) при скромном расходе токенов на рассуждения.
🟣Anthropic: Opus 5 приближается к Fable 5
24 июля Anthropic выпустила Claude Opus 5 — по цене и скорости на уровне Opus 4.8, но по интеллектуальным бенчмаркам (Frontier-Bench, ARC-AGI 3, OSWorld 2.0) приближается к Fable 5, по внутренним оценкам — самая согласованная (aligned) модель компании на сегодня.
🟣Black Forest Labs: единая модель для видео, изображений и звука
23 июля Black Forest Labs анонсировала FLUX 3 (Early Access) — мультимодальную flow-модель, обучаемую совместно на видео, изображениях и аудио в единой архитектуре. Поддерживает генерацию видео с нативным звуком до 20 секунд и первые эксперименты с action-prediction для робототехники.
🟣Google: три Gemini для агентных сценариев
21 июля Google выпустила три модели линейки Gemini: 3.6 Flash (на 17% эффективнее по токенам, чем 3.5 Flash, $ 1,50 — $ 7,50 за 1M), сверхбыстрый 3.5 Flash-Lite (350 ток/с, $ 0,3 — $ 2,5) и специализированный 3.5 Flash Cyber для поиска и патчинга уязвимостей в связке с автономным агентом CodeMender, доступ ограничен госорганизациями и партнёрами.
🟣Poolside: компактная модель против гигантов
21 июля Poolside выпустила Laguna S 2.1 — компактную MoE (118B/8B активных), обученную менее чем за 9 недель, которая на Terminal-Bench 2.1 (70,2) и других long-horizon coding-бенчмарках конкурирует с моделями на порядок крупнее. Веса открыты на Hugging Face.
🟣Moonshot AI: первая открытая модель класса 3T
16 июля Moonshot AI представила Kimi K3 — первую открытую модель класса 3T (2,8 трлн параметров) на архитектуре Kimi Delta Attention, с нативным зрением и контекстом 1M токенов. По собственным данным компании, модель уступает только Claude Fable 5 и GPT-5.6 Sol.
Новые статьи от AI VK на Хабре
🟣Как создавали нейропоиск Discovery AI — технологию для крупнейшей контентной базы в РФ
🟣Как мы подружили LLM с А/Б‑тестами: от сломанного BI до HTML‑отчётов с ИИ‑аналитиком внутри
🟣LLM и психолингвистика: HELPER
🟣Как мы ускорили разметку видеопоиска в десятки раз и не потеряли качество: опыт внедрения VLM-асессора
#aivkhub #дайджест