Postlar filtri


Neurogen dan repost
MiniMax-H3 × Z-Image

На Hugging Face появился интересный эксперимент

Идея: взять движок MiniMax-H3 и перенести в него профиль пространственного внимания Z-Image, чтобы модель лучше работала с мелкими текстурами и деталями

🔘Получилось:

- более детализированное окружение
- улучшенная текстура лиц + сохраняется идентичность
- детализация стабильнее сохраняется между последовательными кадрами
- сохраняются возможности H3 по генерации видео + аудио

Все это без переобучения и вмешательства какого то в архитектуру

Работает как drop-in replacement для стандартных H3-чекпоинтов

Ну и самое главное что есть ггуф кванты сразу под разные vram

Q4_0 — 11.5 / 19.9 GB
Q5_1 — 15.2 / 25.9 GB
Q8_0 — 21.5 GB

Автор рекомендует именно curve-zs05 версии. Для 16 GB — Q4_0, для 24 GB — Q5_1, для 32 GB — Q8_0

Установка: файл помещается туда же, где лежат H3-чекпоинты, после чего выбирается в loader. Существующие H3 workflow менять не нужно

https://huggingface.co/joeygambino/MiniMax-H3-x-Z-Image-GGUF


Метаверсище и ИИще dan repost
GPT image 2.5

На арене новый чекройнт от openAI под названием luna-lisa-alpha

Обновили knowledge coutoff

Приподубрали зерно

Вроде не желтит

Ждём официального анонса.

@cgevent


CGIT_Vines dan repost
Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish
Meshy обновился до 7 версии!

Это самая назойливая компания в плане рекламы, но по 7 версии не рассказали почти ничего нового. Из того что видно глазами, как будто просто навалили больше поликаунта и улучшили распознавание текста и мелких элементов.

Из рекламных моделей лиса с кривой рожей) кстати у всех генераторов (HY3D, Tripo, Meshy) проблемы с пониманием перспективы. Лису в комменты кину.

@CGIT_Vines


Метаверсище и ИИще dan repost
Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish
MiniMax H3 - длинные видосы. Для гиков.

Сразу два проекта пытаются сделать очень ловкий продолжатор:
H3 Motion Context и H3 Continuum.

Оба пришли к одной правильной идее: хватит декодировать последний кадр в картинку, снова запихивать его через VAE и надеяться, что лицо, одежда, цвет и движение не поплывут. Вместо этого следующий кусок получает сырой video+audio latent предыдущего. Motion Context по умолчанию переносит последние 22 видеокадра и отдельно 24 кадра аудиоконтекста (ровно 1 с), после чего повторившийся кусок автоматически отрезается. Авторы особенно заморочились со звуком:
аудио помещается именно в предыдущую часть таймлайна, а не подаётся как обычный reference.

Motion Context - более компактный и типа более педантичный инструмент именно для бесшовного продолжения одного дубля. Уже есть Ref2VA, сохранение references и стресс-тест на 16 клипов / 4:34 видео на RTX 5070 Ti. Но автор советует не включать Spectrum: прогнозирование transformer steps может портить pinned latent context, особенно звук. Turbo тоже работает, но чем агрессивнее ускорение, тем хуже continuity. То есть идея здесь простая: сначала не сломать временную непрерыность, потом уже думать, как ее ускорять.

H3 Continuum 3.3 идёт гораздо дальше и превращает эту идею в production-систему. Он автоматически генерирует до 16 связанных чанков, умеет T2VA/I2VA/FL2VA/Ref2VA, держит до трёх reference images, reference audio, отдельные prompts для каждого участка и Timeline Video conditioning. Есть автоматическое сохранение каждого raw AV latent, Resume после падения и "Regenerate From Chunk N", поэтому ради неудачного 40-го секунды не приходится пересчитывать всю минуту. Со Spectrum здесь, наоборот, все шиштяк: на каждом новом стыке первые два transformer evaluations обязательно считает настоящий H3, и только затем Spectrum начинает прогнозировать шаги. Поэтому рекомендуемый quality-режим - около 20 steps + Spectrum, speed-режим - Turbo 8-step без Spectrum. Turbo + Spectrum пока считается экспериментом.

На итоге:
Motion Context - для максимально чистого непрерывного дубля, особенно с речью или музыкой.
Continuum - для производства длинных 30-80-секундных сцен, где нужны персонажи, references, таймлайн, восстановление после падения и нормальное управление десятком генераций.

Ссылки:

H3 Motion Context
https://github.com/NikoDemon80/ComfyUI-H3-Motion-Context

Motion Context MultiRef
https://github.com/seitanism/ComfyUI-H3-Motion-Context-MultiRef

H3 Continuum
https://github.com/ukr8b3g-cmyk/ComfyUI-H3-Continuum

Реддит тред Motion Context
https://www.reddit.com/r/StableDiffusion/comments/1vhppmv/clip_chaining_for_minimax_h3_motion_and_audio/

Motion Context v0.2 / Ref2VA
https://www.reddit.com/r/StableDiffusion/comments/1vjvx4l/h3_motion_context_v020_reference_mode_support_and/

@cgevent


эйай ньюз dan repost
Qwen 3.8 27B релизнулся

На этой неделе у любителей локальных моделей праздник. Сначала Muse Glimmer, сейчас Qwen 3.8 27B, плюс релизы моделей побольше.

Веса

@ai_newz


BLGN dan repost
https://youtu.be/aAg9iDh9_BQ?si=mpiIR7_Bg-LfzaL7

20-ти минутная AI короткометражка на очень достойном уровне.

Я бы даже сказал уже ебать как хорошо. Вышло даже лучше чем у Бломкампа с его недавним NIGHTBORNE.

Чо, пацаны, в баристы или кальянщики?


Neurogen dan repost
MiniMax Music 3

Генерация полноценных песен до 5 минут из текста на 8GB VRAM

MiniMax выпустили высокопроизводительную модель для генерации музыки, способную создавать структурно связные песни длительностью до пяти минут по текстовому описанию и лирике. Модель выдаёт стерео-аудио 32 кГц / 16-бит

8B параметров (инициализирован из Qwen3-8B) отвечает за долгосрочную музыкальную структуру

Local LLM: 0.6B параметров (покадровые акустические детали)
Flow Matching: 2.4B параметров (непрерывный синтез скрытых состояний)
Flow-VAE Decoder: 123M параметров (финальное декодирование в волновую форму)
Формат вывода: 32 kHz, 16-bit stereo WAV
Максимальная длительность: ~5 минут (9 000 акустических кадров при 25 кадрах/сек)
Лимит промпта: 5 000 токенов

🔘Что умеет модель

Полные песни с долгосрочной связностью

Поддерживает нативно всю структуру композиции: [Intro], [Verse], [Pre-Chorus], [Chorus], [Post-Chorus], [Bridge], [Instrumental], [Solo], [Outro] с сохранением темы, ритма, вокальной идентичности и развития аранжировки

Тонкий контроль через два входа

Lyrics — сам текст песни с секционными тегами
Music description — жанр, темп, тональность, эмоциональная прогрессия, тембр вокала, инструментовка

Structured Caption для максимального контроля

Global Metadata: жанр, поджанр, BPM, тональность, сценарий прослушивания
Vocal Details: пол вокалиста, тембр, стиль, гармонии, бэк-вокал
Arrangement: основные и второстепенные инструменты, грув, бас, перкуссия, эффекты

Работает на 8GB видеокартах благодаря apply_group_offloading (медленнее, но помещается)

⚠️Ограничения

- Требуется CUDA для инференса
- Только non-streaming генерация
- Секционные теги задают направление, но не гарантируют точное соблюдение темпа/тональности/структуры
- Лирика и описание - инструменты влияния, а не жёсткие правила

Hugging Face
Demo-страница с примерами
GitHub
ComfyUI туториал
SGLang cookbook


Метаверсище и ИИще dan repost
Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish
Для Минимаксеров: ComfyUI Minimax-H3 FaceRefine

Улучшатор маленьких лиц, которые обычно портятся.

- tracks, crops, regenerates faces at native resolution to fix distance-blurring
- YOLOv8 + InsightFace for identity-locked tracking
- img2img latent injection + temporal denoise scaling
- влезает в 12GB VRAM via GGUF.

https://github.com/Carasibana/ComfyUI-H3-FaceRefine

@cgevent


Метаверсище и ИИще dan repost
Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish
Мемные миры

Зацепило. Не просто обычный оживляж мемов и I2V, а разметка и монтаж.

Подробнее про воркфлоу и промпт тут:
https://x.com/Flovaai/status/2087541198529683866

Там как бы:
reference image → Flova задаёт режиссуру/движение камеры → Seedance 2.5 генерирует продолжение сцены → модель удерживает персонажей и перестраивает композицию → псина

@cgevent


Метаверсище и ИИще dan repost
Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish
Wan 3.0 начинают раскатывают по API

Сейчас подтверждённо доступен:

WaveSpeedAI - LIVE, Playground + API.
480p - $0.06/сек
720p - $0.12/сек
1080p - $0.24/сек.

Pixazo:
480p - $0.043/сек
720p - $0.085/сек
1080p - $0.17/сек.

wan.video - официальный Public Beta. Цена в публичном интерфейсе зависит от кредитной системы/аккаунта.

VivaReel - Wan 3.0 доступен через пользовательский интерфейс.

Фал и репликейт - coming soon

Ссылки:

https://wavespeed.ai/collections/wan-3.0
https://www.pixazo.ai/models/wan
https://help.aliyun.com/zh/model-studio/wan3-0-video
https://wan.video/
https://vivareel.ai/

@cgevent


Neurogen dan repost
LTX-2.5

Обновился опенсорсный видеогенератор, на этот раз его назвали не только open-weights видео-, а еще и world моделью

Судя по цифрам не фейк, 10-секундный клип 720p из картинки за 6.8 секунды на паре NVIDIA GB200, это быстрее реального времени

до 4K HDR (native), 720p / 1080p через API, 6.8 сек на 10-сек 720p клип (2× NVIDIA GB200)

Managed API ~23.7 сек на 1080p

VRAM 16 GB от Mac до датацентр-GPU

Заявленная экономика: ~1/8 стоимости и 1/7 времени рендера относительно сопоставимых моделей

Также сильно прокачали свой пайплайн, не буду углубляться в духоту, но могу подытожить, что они проделали большую работу, обнова вышла действительно годной, особенно в новом видеодекодере и новым приятным требованиям по враму

Попробовать
Про релиз
Hugging Face веса тут будут
ComfyUI будет интеграция



12 ta oxirgi post ko‘rsatilgan.