#дайджест
Дайджест AI/ML за неделю 3–9 августа 2026
Alibaba: Wan 3.0Омнимодальная видеомодель: на вход можно подавать текст, изображения, аудио и видео. Интерфейс также умеет извлекать контекст из файлов, веб-страниц и сложных изображений, чтобы использовать их как референсы. Максимальная длительность — до 30 (!) секунд за одну генерацию.
Публичная бета доступна в Alibaba Cloud Model Studio и Qwen Cloud.
Пост,
ПопробоватьxAI: Grok Imagine Image 2.0 Новая версия с хорошим рывком по качеству, проигрывает только GPT-Image 2 1320 vs 1380 Elo в генерации и 1439 vs 1463 в редактировании. Есть все современные инструменты редактирования, ресайз, работа с референсными изображениями, масками и сегментацией
API пока нет, только на сайте.
Grok ImagineMiniMax: открытые веса H3Два чекпойнта видеомодели: FL2VA для генерации по тексту и первому/последнему кадру и Ref2VA для работы с наборами изображений, видео и аудио. На выходе H3 делает ролики 15 секунд, 24 fps с нативным звуком.
Внутри трансформер на 33B параметров. Локально открытый H3-Base генерирует видео в 768. H3-Context-IR, который разбирает сложный мультимодальный контекст, в релиз не вошёл. Как и Апскейлер до 2к H3-Regenerate-2K. Реализация sparse attention тоже будет когда-нибудь потом. В общем веса открыли, но полный продакшен-пайплайн все еще требует API MiniMax.
GitHub,
весаMeta: Muse Code и Muse Spark 1.2Meta тоже сделала себе суверенный Claude Code - Muse Code.
Работает все это на Muse Spark 1.2 новой версии модели Meta, акцент на агентном кодинге с долгим горизонтом планирования. В экспериментах агенты до суток оптимизировали GPU-ядра и делали больше тысячи вызовов инструментов. Muse Code пока в бете, Spark 1.2 доступна в нем и через Meta Model API.
БлогпостCMU: Lift4DСистема превращает одно обычное видео движущегося объекта в 4D объект из Gaussian Splatting. Восстанавливает геометрию, внешний вид и движение, включая стороны, которые камера не видела. Результат можно крутить вертеть по всем осям, включая время.
Проект,
GitHubAlibaba: Wan-Animate-2Открытая 14B-модель которая анимирует персонажей с изображения движениями из референсного видео. В отличие от первого Animate, модель принимает исходное видео прямо внутри DiT, раньше отдельно извлекалась поза и по ней уже происходила генерация, также можно менять ракурс итогового видео через промпт.
Выложили базовые и дистиллированные веса: вторая версия работает за 10 шагов вместо 40. 720p рассчитан на 8×A800, а 480p проверяли на 2×A800. Отличный локальный генератор для всех, у кого локально стоит небольшой дата-центр.
GitHub,
весаTencent: Hunyuan3D-Buffalo 1.0К генератору 3D моделей Hunyuan3D-2.1 пришили 3D-VLM, которая может делать VLM штуки, вроде понимать что такое крылья и где у машины перед. В итоге хотят добиться более точного редактирования 3D моделей. Но пока это исследовательская работа и красивая страница с примерами. Ссылка на код подписана Stay Tuned, весов тоже нет.
Проект,
статьяLiquid AI: LFM2.5-2.6BМаленькая текстовая модель для локальных агентов: 2.69B параметров, 128К контекста, function calling и обязательный ризонинг. Модель натренировали примерно на 34T токенов и отдельно доучили работать с инструментами внутри агентных окружений.
Liquid заявляет до 220 токенов/с при потреблении меньше 2.5 ГБ памяти. По сравнению с 4B моделями Qwen и Gemma немного выигрывает по агентным бенчам и проигрывает по всему остальному.
Блогпост,
весаМенее значительные релизы:Alibaba: Qwen3.8-MaxУже обозревали, но теперь из названия убрали Preview. Доступна через QwenCloud API и продукты Qwen.
Веса пообещали на следующей неделе.
Анонс,
документацияLightX2V: MiniMax-H3 Turbo 4-Step - LoRA, которая сокращает генерацию H3 с 50 до 4 шагов.
GitHub,
весаOpenAI: GPT-5.6 Luna теперь безлимитна для бесплатных пользователей через ChatGPT. Также минорно улучшили Sol.
БлогFLUX 3 Video вышел в API