TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
AIсповедь

5 Aug 2025, 20:08

Открыть в Telegram Поделиться Пожаловаться

Репост из: Psy Eyes
Prev Next
Alibaba: выпустили Qwen Image, чтобы Контексту не скучно было. Это генератор и редактор картинок текстом с 20B параметров и MMDiT архитектурой.

В плане редактирования изображения Qwen-Image позволяет выполнять перенос стиля, вставку или удаление объектов, улучшение деталей, редактирование текста на картинках, и изменение человеческих поз.

Помимо этого модель работает с задачами на понимание изображения: обнаружение объектов, семантическая сегментация, получение карты глубины (Depth) и краев (Canny), генерация новой точки обзора, и апскейл.

Очень хорошо следует промту (порой слишком): с первого раза кота сделала киберпанковым, а не просто вписала в киберпанковый сеттинг. Поддерживает работу с разными стилями картинки. Анатомия ок, но кожа может быть пластиковой — естественные фото как у Flux Krea проблематично получить (по крайне мере короткими промтами на fp8). Детальность картинки может хромать артефактами на вещах вокруг основного объекта в сцене. Для повышения детальности можно попробовать снизить shift, или увеличить если будет много блюра/темноты.

Текст, там где его мало и он крупный рендерит хорошо, а там где его много и он разный уже может сильно уходить в артефакты. Работает с текстом только на английском и китайском. Что интересно: укажешь два раза в промте неоновый знак Psy Eyes, он тебе два и сделает, а не воспримет как один и тот же знак, если ты только не укажешь это в промте.

Модель локально доступна в двух вариантах: fp8 версия весит ~20 ГБ, а вот bf16 уже ~41 ГБ. В качестве текстового энкодера используется Qwen 2.5 VL 7B, который тоже есть в fp8 и fp16.

На 4090 при дефолтных настройках, где и модель и энкодер fp8, а разрешение стоит 1328x1328, одна картинка в 20 шагов генерится ~58 секунд (2,46 сек/ит). VRAM кушается целиком, остальные 11-13 ГБ выгружаются в RAM. 1024x1024 генерится уже 33 сек (1,36 сек/ит).

Comfy, что первая генерация на 4090 примерно 94 сек, а вторая 71 сек. Я вижу что вторая генка действительно чуть быстрее на пару сек, но не с таким разбегом.

Немного странно, что в конце генерации пишется Requested to load WanVAE, а не Qwen Image VAE, но так как в папке с VAE вановского ничего нет, то ок.

Воркфлоу для редактирования пока не видно — есть только для генерации.

Демо (Хаггинг)
Демо (Qwen Chat)
Официальный анонс
Comfy анонс
Comfy воркфлоу
Гитхаб (Comfy)
Гитхаб (Qwen)

28 0 0
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot