📺 Автоматический монтаж и реально мощные контент-заводы выходят на новый уровень!
Наконец-то можно заставить робота смотреть вместо вас тонны видео, анализировать смыслы и делать точную разметку сквозь гигабайты футажей.
Знакомьтесь — Twelve Labs. Ребята выкатили Pegasus 1.5, которая делает с видео то же самое, что LLM в своё время сотворили с текстом.
🔖=)))))
💰 Короче, вы просто задаёте JSON схему, и она маркирует появление бренда или находит нужный ракурс, выдавая идеальный Time-Based Metadata.
Что это значит на практике?
❗️ Контент-заводы входят в свой прайм!
Берём пачку трендов из TikTok, разбираем их на молекулы — ракурсы, склейки, объекты — и скармливаем эту сырую математику в Seedance 2.0 для потоковой генерации. Компьютер сам отсмотрит терабайты исходников, напишет промпты и сделает идеальные монтажные склейки.
Но Twelve Labs, чтобы завлечь аудиторию (и собрать данные), с порога открывают API и дают 10 часов видеоанализа бесплатно.
Скорость обработки при этом такая, будто серверы стоят прямо у вас в коридоре — около 60x от реального времени.
Кое-что из тестов покажу в комментариях.
Готовимся: скоро 100% контента будут делать роботы, а мы будем только его потреблять. Наверное, это и есть прогресс.
Кстати, подпишись на @VoogieBoogie
Наконец-то можно заставить робота смотреть вместо вас тонны видео, анализировать смыслы и делать точную разметку сквозь гигабайты футажей.
Для маркетологов наступает эра абсолютного счастья, для всех остальных — время готовиться к еще более бесконечным потокам «нейрослопа».
Знакомьтесь — Twelve Labs. Ребята выкатили Pegasus 1.5, которая делает с видео то же самое, что LLM в своё время сотворили с текстом.
И по пути она элегантно обходит Gemini 3 Pro на 30% в задачах сегментации контента.
🔖=)))))
😊 Официально:
Video Foundation Model с поддержкой 36 языков и пониманием движений камеры на уровне оператора.
Фактически: Поиск по Entity (загрузил фото кроссовка — нашёл его во всём архиве) и Composed Image Retrieval (снайперская точность через картинку + текст одновременно).
На самом деле: Конвейер по разборке реальности в чистый, структурированный код.Система способна прожевать до 4 часов видео за один API-запрос — на лету, без мучительных пайплайнов индексации.
💰 Короче, вы просто задаёте JSON схему, и она маркирует появление бренда или находит нужный ракурс, выдавая идеальный Time-Based Metadata.
В моей работе другие модели ломали JSON в 30% случаев, а здесь массив таймкодов вылетает сразу в бэкенд — чисто, быстро и почти пугающе.
Что это значит на практике?
❗️ Контент-заводы входят в свой прайм!
Берём пачку трендов из TikTok, разбираем их на молекулы — ракурсы, склейки, объекты — и скармливаем эту сырую математику в Seedance 2.0 для потоковой генерации. Компьютер сам отсмотрит терабайты исходников, напишет промпты и сделает идеальные монтажные склейки.
Сценариев столько, что доступ к таким вещам стоило бы выдавать только по спецпропускам.
Но Twelve Labs, чтобы завлечь аудиторию (и собрать данные), с порога открывают API и дают 10 часов видеоанализа бесплатно.
Скорость обработки при этом такая, будто серверы стоят прямо у вас в коридоре — около 60x от реального времени.
Кое-что из тестов покажу в комментариях.
Готовимся: скоро 100% контента будут делать роботы, а мы будем только его потреблять. Наверное, это и есть прогресс.
Кстати, подпишись на @VoogieBoogie