LongCat-Video:
A Unified Foundational Video Generation ModelНовый опенсорсный видеогенератор и доставка еды.
И да, это новая базовая модель, а не нашлепки над WAN или миксы из WAN и CogVideo, коих развелось немеренно.
И судя по размеру (13.6B параметров) она в той же лиге, что и WAN.
Как следует из названия, ее главная фишка - это способность создавать длинные (несколькоминутные) видео с (как пишут авторы) сохранением консистентности.
Сейчас вы идете вот сюда:
https://meituan-longcat.github.io/LongCat-Video/и мотаете на Long Video Gallery, чтобы посмотреть примеры.
Кроме того, еще одна фишка - продолжение видосов: Video Continuation - даже можно указывать в промпте временные метки типа:
0:00
The kitchen is bright and airy, featuring white cabinets and a wooden countertop. A loaf of freshly baked bread rests on a cutting board, and a glass and a carton of milk are positioned nearby. A woman wearing a floral apron stands at the wooden countertop, skillfully slicing a golden-brown loaf of bread with a sharp knife. The bread is resting on a cutting board, and crumbs scatter around as she cuts.
0:06
Camera zooms out, The woman puts down the knife in her hand, reaches for the carton of milk and then pours it into the glass on the table.
0:11
The woman puts down the milk carton.
0:16
The woman picks up the glass of milk and takes a sip.
Само собой у них есть text2video и image2video (6 секунд), 720p.
Причем генерация идет в два этапа, где второй - это рефайнер\улучшайзер первого этапа генерации. Также внутри есть лора-дистиллятор, которая позволяет считать всего на 16 шагах.
Про потребление видеопамяти(VRAM) ничего не написано, но судя по весам и тестам на H800, где-то 60 гиг
А про скорость есть табличка в техрепорте:
93 кадра в 720р и 50 шагов - 24 минуты
93 кадра в 480р и 16 шагов - 1 минута
Код есть, можно расчехлять H100 или ждать Киджая для Комфи.
Но самое интересное дальше.
Авторы - компания Meituan — крупнейшая в Китае платформа «local life» (супер-приложение для локальных услуг): еда с доставкой, «мгновенная» розница, купоны/бронирования офлайн-услуг, отели и путешествия, транспорт/велошеринг и сервисы для бизнесов. Компания монетизирует комиссию с заказов, рекламу внутри экосистемы и платные B2B-инструменты для продавцов.
Да-да, доставщики еды теперь тренируют базовые модели для видеогенерации.
Живите теперь с этим.
Еда тут:
https://meituan-longcat.github.io/LongCat-Video/Информативный Апдейт от подписчика Бориса:Что я понял из папиры:
1. в одной модели: t2v, i2v, + продолжение видоса.
2. генерация минут(!), а не только секунд
3. Нет фигни которая была в скользящем окне WANа, когда у тебя с кажой итерацией росла контарстность и шум + артекфакт в деталях накапливались. К концу видоса каечство падать не должно.
4. Модель с нуля тренили на продолжение видео
5. "Запоминает" начальные кадры один раз и не пересчитывает каждый шаг
6. Coarse-to-fine генерация. Сначала делает видео: 480p, 15 FPS (быстро и дешево), Потом апскейлит до 720p, 30 FPS
7. Block sparse attention — считает только 10% от обычного внимания, но результат почти такой же. Непонятно как это коррелируется\работает с sage. (Block Attention с KVCache их собственная разработка)
8. По азявлени авторов: Модель понимает физику мира лучше всех . По физике/здравому смыслу — 1-е место (обходит даже Google Veo)
9. Юзают энкодер ВАНа - 2.1, но архитектура не ван
10. НЕ дифузная модель , а флоу (Flow Matching). Физика обрастает пикселями, а не предсказание пикселей во времени без учета физики. Тренили с поощрением по референсным образцам - т.е. в теории физику можно дообучать.
ЗЫ чуваки решили проблему GRPO. крутой метод обучения из мира LLM. Но когда попытались применить к видео (Flow Matching), всё сломалось: градиенты пропадали, обучение тормозило. Они починили математику - теперь все круто.
Про лоры не понятно но поскольку Dit есть - то наверное можно.
@cgevent