ByteDance выпустила новую open-source модель для генерации изображений.
По первым отзывам, она показывает результаты лучше, чем Qwen-Image и Z-Image.
Главная особенность — модель работает в autoregressive-режиме.
Это означает, что изображение создаётся поэтапно, как текст в LLM, а не одним «шумовым» проходом, как в диффузионных моделях.
Такой подход даёт:
- лучшее понимание сцены и объектов
- более логичную композицию
- стабильность персонажей и деталей
- более «осмысленную» генерацию
Похожий принцип уже используют современные системы вроде GPT-Image и других новых генераторов.
GitHub: https://github.com/shallowdream204/BitDance
По первым отзывам, она показывает результаты лучше, чем Qwen-Image и Z-Image.
Главная особенность — модель работает в autoregressive-режиме.
Это означает, что изображение создаётся поэтапно, как текст в LLM, а не одним «шумовым» проходом, как в диффузионных моделях.
Такой подход даёт:
- лучшее понимание сцены и объектов
- более логичную композицию
- стабильность персонажей и деталей
- более «осмысленную» генерацию
Похожий принцип уже используют современные системы вроде GPT-Image и других новых генераторов.
GitHub: https://github.com/shallowdream204/BitDance