Репост из: Neurogen
FLUX 3
Image + Video + Audio + Action
Black Forest Labs представили новую мультимодальную foundation-модель, которая обучается одновременно на изображениях, видео, аудио и действиях в единой архитектуре
- Изображения фиксируют пространственную структуру в момент времени
- Видео добавляют измерение времени и физические законы
- Аудио раскрывает причинно-следственные связи между механикой и акустикой
- Язык связывает восприятие с целями и инструкциями
Обучаясь на всём сразу, модель получает взаимные ограничения: звук должен соответствовать удару, движение - массе, будущее — прошлому
🔘Возможности видео-модуля:
- Text-to-video и image-to-video с нативной аудиодорожкой
- Video-to-video - перенос персонажей и элементов в новую сцену
- Video-audio continuation - генеративное продолжение
- Keyframe-to-video для контролируемых переходов
- Мультиязычные диалоги с синхронизацией по губам
- Огромное стилистическое разнообразие, от camcorder-footage до кинематографа
- Agentic chaining - сшивка клипов в многоминутные многосценные сюжеты
- Сильная типографика и анимированный дизайн
🔘Video Evaluations
FLUX 3 Image
Синтез и редактирование в широком диапазоне стилей, соотношений сторон и разрешений. Заявлено значительное улучшение работы со сложными промптами и многоязычным текстом высокой точности прямо на изображении.
FLUX 3 Image Samples
FLUX-mimic — от генерации к физическому AI
Совместно с mimic robotics BFL разработали FLUX-mimic — video-action модель на базе бэкбоуна FLUX 3, уже работающую на производстве Audi
Сейчас в раннем доступе все, можно подать заявку на сайте, ждем веса и раскатку, в ближайшие недели по идее
https://bfl.ai/models/flux-3
Image + Video + Audio + Action
Black Forest Labs представили новую мультимодальную foundation-модель, которая обучается одновременно на изображениях, видео, аудио и действиях в единой архитектуре
- Изображения фиксируют пространственную структуру в момент времени
- Видео добавляют измерение времени и физические законы
- Аудио раскрывает причинно-следственные связи между механикой и акустикой
- Язык связывает восприятие с целями и инструкциями
Обучаясь на всём сразу, модель получает взаимные ограничения: звук должен соответствовать удару, движение - массе, будущее — прошлому
🔘Возможности видео-модуля:
- Text-to-video и image-to-video с нативной аудиодорожкой
- Video-to-video - перенос персонажей и элементов в новую сцену
- Video-audio continuation - генеративное продолжение
- Keyframe-to-video для контролируемых переходов
- Мультиязычные диалоги с синхронизацией по губам
- Огромное стилистическое разнообразие, от camcorder-footage до кинематографа
- Agentic chaining - сшивка клипов в многоминутные многосценные сюжеты
- Сильная типографика и анимированный дизайн
🔘Video Evaluations
FLUX 3 Image
Синтез и редактирование в широком диапазоне стилей, соотношений сторон и разрешений. Заявлено значительное улучшение работы со сложными промптами и многоязычным текстом высокой точности прямо на изображении.
FLUX 3 Image Samples
FLUX-mimic — от генерации к физическому AI
Совместно с mimic robotics BFL разработали FLUX-mimic — video-action модель на базе бэкбоуна FLUX 3, уже работающую на производстве Audi
Сейчас в раннем доступе все, можно подать заявку на сайте, ждем веса и раскатку, в ближайшие недели по идее
https://bfl.ai/models/flux-3