Репост из: Psy Eyes
Alibaba: выпустили Qwen Image, чтобы Контексту не скучно было. Это генератор и редактор картинок текстом с 20B параметров и MMDiT архитектурой.
В плане редактирования изображения Qwen-Image позволяет выполнять перенос стиля, вставку или удаление объектов, улучшение деталей, редактирование текста на картинках, и изменение человеческих поз.
Помимо этого модель работает с задачами на понимание изображения: обнаружение объектов, семантическая сегментация, получение карты глубины (Depth) и краев (Canny), генерация новой точки обзора, и апскейл.
Очень хорошо следует промту (порой слишком): с первого раза кота сделала киберпанковым, а не просто вписала в киберпанковый сеттинг. Поддерживает работу с разными стилями картинки. Анатомия ок, но кожа может быть пластиковой — естественные фото как у Flux Krea проблематично получить (по крайне мере короткими промтами на fp8). Детальность картинки может хромать артефактами на вещах вокруг основного объекта в сцене. Для повышения детальности можно попробовать снизить shift, или увеличить если будет много блюра/темноты.
Текст, там где его мало и он крупный рендерит хорошо, а там где его много и он разный уже может сильно уходить в артефакты. Работает с текстом только на английском и китайском. Что интересно: укажешь два раза в промте неоновый знак Psy Eyes, он тебе два и сделает, а не воспримет как один и тот же знак, если ты только не укажешь это в промте.
Модель локально доступна в двух вариантах: fp8 версия весит ~20 ГБ, а вот bf16 уже ~41 ГБ. В качестве текстового энкодера используется Qwen 2.5 VL 7B, который тоже есть в fp8 и fp16.
На 4090 при дефолтных настройках, где и модель и энкодер fp8, а разрешение стоит 1328x1328, одна картинка в 20 шагов генерится ~58 секунд (2,46 сек/ит). VRAM кушается целиком, остальные 11-13 ГБ выгружаются в RAM. 1024x1024 генерится уже 33 сек (1,36 сек/ит).
Comfy, что первая генерация на 4090 примерно 94 сек, а вторая 71 сек. Я вижу что вторая генка действительно чуть быстрее на пару сек, но не с таким разбегом.
Немного странно, что в конце генерации пишется Requested to load WanVAE, а не Qwen Image VAE, но так как в папке с VAE вановского ничего нет, то ок.
Воркфлоу для редактирования пока не видно — есть только для генерации.
Демо (Хаггинг)
Демо (Qwen Chat)
Официальный анонс
Comfy анонс
Comfy воркфлоу
Гитхаб (Comfy)
Гитхаб (Qwen)
В плане редактирования изображения Qwen-Image позволяет выполнять перенос стиля, вставку или удаление объектов, улучшение деталей, редактирование текста на картинках, и изменение человеческих поз.
Помимо этого модель работает с задачами на понимание изображения: обнаружение объектов, семантическая сегментация, получение карты глубины (Depth) и краев (Canny), генерация новой точки обзора, и апскейл.
Очень хорошо следует промту (порой слишком): с первого раза кота сделала киберпанковым, а не просто вписала в киберпанковый сеттинг. Поддерживает работу с разными стилями картинки. Анатомия ок, но кожа может быть пластиковой — естественные фото как у Flux Krea проблематично получить (по крайне мере короткими промтами на fp8). Детальность картинки может хромать артефактами на вещах вокруг основного объекта в сцене. Для повышения детальности можно попробовать снизить shift, или увеличить если будет много блюра/темноты.
Текст, там где его мало и он крупный рендерит хорошо, а там где его много и он разный уже может сильно уходить в артефакты. Работает с текстом только на английском и китайском. Что интересно: укажешь два раза в промте неоновый знак Psy Eyes, он тебе два и сделает, а не воспримет как один и тот же знак, если ты только не укажешь это в промте.
Модель локально доступна в двух вариантах: fp8 версия весит ~20 ГБ, а вот bf16 уже ~41 ГБ. В качестве текстового энкодера используется Qwen 2.5 VL 7B, который тоже есть в fp8 и fp16.
На 4090 при дефолтных настройках, где и модель и энкодер fp8, а разрешение стоит 1328x1328, одна картинка в 20 шагов генерится ~58 секунд (2,46 сек/ит). VRAM кушается целиком, остальные 11-13 ГБ выгружаются в RAM. 1024x1024 генерится уже 33 сек (1,36 сек/ит).
Comfy, что первая генерация на 4090 примерно 94 сек, а вторая 71 сек. Я вижу что вторая генка действительно чуть быстрее на пару сек, но не с таким разбегом.
Немного странно, что в конце генерации пишется Requested to load WanVAE, а не Qwen Image VAE, но так как в папке с VAE вановского ничего нет, то ок.
Воркфлоу для редактирования пока не видно — есть только для генерации.
Демо (Хаггинг)
Демо (Qwen Chat)
Официальный анонс
Comfy анонс
Comfy воркфлоу
Гитхаб (Comfy)
Гитхаб (Qwen)