Репост из: Neurogen
Microsoft Lens как обучить SOTA text-to-image в 3.8B параметров и не сжечь дата-центр
Microsoft Research выкатили text-to-image модель в ответ на гонку 12B+ диффузионок. Генерирует в нативном 1440x1440 при 3.8В параметров
Цензура очень слабая, можно сказать нету
Собственный корпус у нее состоит из 800М пар (картинка + длинная подпись от GPT-4.1), внутри также энкодер GPT-OSS, FLUX.2 semantic VAE для латентов с семантикой и еще пару фишек
Каждая картинка приходит с длинным описанием от GPT-4.1, это увеличивает полезный сигнал на токен в разы по сравнению с шумными alt-тегами LAION-эпохи
Сильные стороны читаемый текст внутри картинки, фотореалистичная макросъёмка и сложные сцены с массой объектов
🔘Три чекпоинта
- Lens — основной, RL-tuned, 20 шагов, CFG 5.0
- Lens-Turbo — дистиллят, 4 шага, CFG 1.0
- Lens-Base — голый supervised, 50 шагов
Попробовать - принимает нецензурные промпты
HuggingFace
Github
Microsoft Research выкатили text-to-image модель в ответ на гонку 12B+ диффузионок. Генерирует в нативном 1440x1440 при 3.8В параметров
Цензура очень слабая, можно сказать нету
Собственный корпус у нее состоит из 800М пар (картинка + длинная подпись от GPT-4.1), внутри также энкодер GPT-OSS, FLUX.2 semantic VAE для латентов с семантикой и еще пару фишек
Каждая картинка приходит с длинным описанием от GPT-4.1, это увеличивает полезный сигнал на токен в разы по сравнению с шумными alt-тегами LAION-эпохи
Сильные стороны читаемый текст внутри картинки, фотореалистичная макросъёмка и сложные сцены с массой объектов
🔘Три чекпоинта
- Lens — основной, RL-tuned, 20 шагов, CFG 5.0
- Lens-Turbo — дистиллят, 4 шага, CFG 1.0
- Lens-Base — голый supervised, 50 шагов
Попробовать - принимает нецензурные промпты
HuggingFace
Github