TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Dendi Math&AI

9 Sep, 10:17

Открыть в Telegram Поделиться Пожаловаться

00:04
00:04
00:04
00:04
Prev Next
🤖 Всё никак не добирался написать, но новость интересная и точно заслуживает вашего внимания. Недавно мы выложили в открытый доступ Kandinsky WM 1.0 — линейку генеративных моделей для Physical AI

Один из больших трендов сейчас — развитие Physical AI Foundational Models (FM), которые способны полноценно моделировать физический мир.

И многие сильные команды приходят к Physical AI FM именно через видеогенерацию. Это довольно естественный путь: обучаясь на видео, модель получает представление о движении, динамике и взаимодействии объектов. Следующий шаг — связать эту модель с действиями агента. Отсюда, в частности, вырастает направление World Action Models: моделей, которые связывают действия робота с тем, как вследствие этих действий изменится наблюдаемый мир (и, наоборот, как выбрать оптимальное действие робота в соответствии с наблюдаемым / предсказанным поведением мира, среды).

При этом сама видеогенерация постепенно становится частью более широких omni-моделей. Например, Cosmos 3 от NVIDIA умеет работать с текстом, изображениями, видео, звуком, действиями на вход и на выход и может использоваться для разных robotics задач. Atlas от World Labs работает с текстом, изображениями, видео и 3D и позволяет восстанавливать реальные сцены и строить на их основе симуляции.

Мы развиваем Kandinsky в том же направлении: используем накопленный опыт в видеогенерации, чтобы строить модели для роботов и беспилотников. Kandinsky WM 1.0 — наш первый открытый релиз в этом треке. Мы выложили open source три специализированные модели:
🚗 K5-AV (Autonomous Vehicle) для генерации автомобильных сцен,
🦾 K5-RO (Robotics) для генерации различных сцен манипуляции с предметами,
🌍 K5-PH (Physics) для генерации сцен со сложной физикой в целом: движением людей, протеканием процессов и взаимодействием объектов.

Все модели получены дообучением нашей базовой модели генерации видео Kandinsky-5 Video Lite (2B). Модели умеют генерировать 5 секунд видео по первому кадру и текстовому описанию (то есть работают в режиме I2V).

Разрабатывали эти модели мы в первую очередь для генерации синтетических данных для обучения других моделей — в основном VLA — которые управляют роботами и беспилотными авто. Особенно важны тут редкие сценарии: сцены ДТП, видео экстремальной погоды или кейсы с отказом оборудования. Собирать такие данные в реальности дорого, очень сложно, а иногда и просто небезопасно. С помощью генеративной модели такие данные можно получасть практически неограниченно. Но у такого подхода есть и обратная сторона: если VideoGen модель неправильно воспроизводит физику, то в обучающие данные для VLA попадут ошибки. К сожалению, такого рода галлюцинации характеры для всех современных VideoGen моделей, потому что при их обучении больше фокусируются на эстетическом (визуальном) качестве, чем на физической достоверности.

Улучшить физичность по сути можно 2 способами: добавляя больше данных со сложной динамикой в претрейн и используя различные приёмы на этапе alignment (например, RL с физическими reward-моделями). Претрейн у нас уже был фиксирован (Lite), поэтому мы фокусировались на alignment: cначала делали SFT на качественных данных каждого домена (AV, RO, PH). Затем — RL с хитрыми reward-моделями за физическую достоверность (подробности можно почитать в статье на хабр)

⚡️По бенчмаркам: на Physics-IQ Verified для модели K5-PH получили рост общего score 16,0 (Lite) → 25,8 (Lite SFT PH) → 30,8 (K5-PH). Бенчмарк проверяет, как модели в режиме генерации видео продолжают реальный физический эксперимент по первому кадру. Домены экспериментов: механика твёрдых тел, динамика жидкостей, оптика, термодинамика и магнетизм.

Модели сейчас тестим с коллегами из Центра робототехники (ребята в том числе помогали с обучающими данными для K5-RO) и с AIRI в рамках развития симулятора XSIM World.

Веса и код моделей выложены под открытой лицензией MIT.
Полезные ссылки:
👉 Хабр
👉 GitHub
👉 HuggingFace

@dendi_math_ai

2k 2 38 11 33
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot