MITV


Гео и язык канала: Россия, Русский
Категория: Технологии



Гео и язык канала
Россия, Русский
Категория
Технологии
Статистика
Фильтр публикаций


Репост из: Stefan Falkok SI
danbooru.csv
5.3Мб
danbooru_e621_merged.csv
8.5Мб
инструкции те же
а если вы ставили мою сборку в комфи - махинации с tag fts делать необязательно

а кто ставил фордж нео - путь для меня вот

...\sd-webui-forge-classic-neo\extensions\a1111-sd-webui-tagcomplete-main\tags

база данбоору и е621 за октябрь 2026






Репост из: Neurogen
Годнота подъехала. Видео на MiniMax H3 дома с 8 ГБ VRAM

FlashML-org выкатили локальный движок генерации видео на MiniMax H3 - FreeVideo, рассчитанный на обычную домашнюю карту

Минимум 8гб VRAM и 16гб RAM, тяжёлое выгружается из видеопамяти в оперативку и на диск

Движок сам подстраивается под железо: на новых картах - нативный FP8, на старых - FP8-веса с BF16-вычислениями; attention-бэкенд выбирается автопробой

10-секундный клип: 122 секунды на RTX 5090, ~9 минут на RTX 4060 Ti, 5060 Ti - 486 сек, 4060 Ti 16 ГБ - 558 сек, 4060 Ti 8 ГБ - 603 сек

Работают текст-промпт, первая и последняя кадры, референсы картинкой, видео и аудио. Четыре уровня качества: Light / Medium / High / Max

Видео несёт в себе workflow - кидаете mp4 на канвас ComfyUI, и восстанавливаются промпт, seed и все настройки

Есть и Mac на M5 с 24 ГБ десять секунд в 960×544 - около 22 минут

🔘Как попробовать (2 минуты)

Windows - скачать FreeVideo.exe, указать существующий ComfyUI (свои модели переиспользуются), нажать Install & launch

Можно через ComfyUI - cd ComfyUI/custom_nodes, git clone https://github.com/FlashML-org/FreeVideo.git, перезапустить ComfyUI, потом Workflow → Browse Templates → FreeVideo → FreeVideo-All-in-One

Linux - git clone … && cd FreeVideo && ./setup.sh, дальше ./freevideo generate --prompt-file prompt.txt --out video.mp4

Первый тест делайте в Light и на коротком кадре, разгонитесь потом

https://github.com/FlashML-org/FreeVideo


Репост из: Александр Карабатов
Обновил KarPlayer - SRT плеер для Android устройств
https://github.com/unclekara/KarPlayer

- libsrt обновлен на 1.5.7
- Media3 / ExoPlayer обновлен с 1.3.1 до 1.11.1
- улучшена работа с Multi-track audio
- улучшена точность настройки параметров SEI тайкмода


Для работы с таймкодом нужен релей-сервер, который встроит в ваш поток этот самый таймкод
https://github.com/unclekara/KarRelay

Помимо работы с таймкодом релей может принять SRT и раздать его на несколько плееров, и это пожалуй его основное назначение. Можно также объединить несколько входящих SRT в один канал, открыть его на плеере и переключаться между SRT источниками на лету не трогая сам плеер, в общем некий SRT-свитчер/хаб.
Сейчас релей ограничен демкой с ограничениями, но желающие поковыряться без ограничений и по полной могут получить ключик в лс на безвозмездной основе


Репост из: Метаверсище и ИИще
Ну, за аватаров.

Tavus показала Griffin - новый real-time AI-аватар, который уже выглядит не как очередная “говорящая фотография”, а как попытка генерировать целиком живого собеседника во время разговора.

Спойлер, про слепые тесты Туринга в конце.

Griffin получает вашу речь и видео, продолжает слушать и смотреть на вас даже в тот момент, когда отвечает сам, а параллельно генерирует голос, лицо, взгляд, мимику, жесты и весь кадр виртуального кожаного. То есть он умеет не только синхронно шевелить губами, но и кивнуть во время вашей фразы, отвести взгляд, отреагировать выражением лица, вставить короткую реплику или остановиться, когда его перебили.

Причём это, внимание, real-time генерация, а не заранее сделанный ролик.

Видеочасть Griffin-Lite работает в 720p при 25 fps. Модель генерирует видео кусками по 320 ms: один latent = 8 кадров. На каждый такой кусок приходится всего 3 diffusion steps, после чего он сразу декодируется и отправляется зрителю на том конце. Средняя задержка от входящего аудио до соответствующей реакции в видео в тестах Tavus составляет 0.43 секунды на NVIDIA H100.

Но здесь важная оговорка: из этого не следует, что весь Griffin “работает с latency 430 ms”. В полном разговорном тесте NVIDIA медианная реакция Griffin была около 1.9-2.2 секунды в зависимости от задачи. 0.43 секунды - именно latency видеогенератора после поступления управляющего аудиосигнала.

По железу Tavus раскрывает только часть картины. Именно тест видеогенератора проводился на H100. В credits компания отдельно благодарит Baseten, Daily и Cerebrium за инфраструктуру research preview, но сколько GPU требуется на одну сессию и на каких именно конфигурациях работает весь Griffin, Tavus пока не сообщает. Поэтому утверждать, что “один Griffin = один H100”, нельзя.

И попробовать всё это тоже, блин, пока нельзя.

Конкуренты.

Google неделю назад выпустила Gemini 3.8 Live with Live Avatar. Писал про это недавно. Это тоже настоящий потоковый аватар: Gemini одновременно получает аудио и изображение с камеры, ведёт native speech-to-speech диалог и генерирует синхронного аватара в 24 fps. Он видит камеру и screen sharing, поддерживает 97 языков и tool calling прямо во время разговора. Live Avatar уже доступен в Gemini Enterprise, хотя создание собственного аватара по фотографии пока требует allowlist.

Runway Characters идёт немного с другой стороны. Из одной картинки можно сделать real-time персонажа с голосом и характером, который разговаривает через WebRTC, может видеть webcam и screen share. В Runway уже можно попробовать это самому: веб-версия ограничивает разговор двумя минутами, API - пятью минутами, цена самого Characters сейчас составляет 2 кредита за 6 секунд, то есть около $0.20 за минуту. Причём Runway позволяет вообще принести свой STT + LLM + TTS, а Characters использовать только как real-time видеослой.

А Vidu S2-Avatar вообще уже продаётся как полноценная streaming-модель. Она принимает изображение персонажа и ведёт real-time голосовой диалог, поддерживает interruption, управление движениями, а во время разговора ей можно дать фотографию предмета, одежды или нового фона - персонаж может взять предмет, переодеться или изменить окружение прямо в потоке. У S2 есть публичный demo и API.

То есть сам факт “живого аватара в реальном времени” уже не мегафича. Google это делает, Runway это делает, Vidu это делает.

Интерес Griffin скорее в другом: Tavus пытается связать понимание разговора и генерацию невербального(!!!) поведения гораздо теснее. Видео здесь должно быть не просто визуализацией уже готового аудио. Разговорная модель отдельно управляет gesture, gaze, emotion и может менять их уже в следующем 320-ms куске видео.

Зато Tavus уже неистово хайпуют: “первая модель, прошедшая video Turing test”.

54 человека посадили на минутный видеозвонок. Им сказали, что сейчас их соединят с другим участником исследования. На самом деле напротив кожаных сидел Griffin-Lite, который в реальном времени генерировал лицо, голос и ответы.

После звонка 26 из 54 человек - 48% - сказали, что разговаривали с настоящим человеком. Для предыдущей версии Tavus результат был 1 из 41.

Вот эти 48% Tavus и называет прохождением video Turing test. Штош.

Строго говоря, никакого общепринятого стандарта “video Turing test” не существует, а эксперимент был крохотным и ещё немного подталкивал кожаных в нужную сторону: им изначально сказали, что они встретятся с другим человеком, а вопрос про ИИ появился только после разговора.

Но результаты всё равно нарядные.

Почти половина кожаных в условно слепом тесте просто не заметила, что напротив них вообще нет кожаного.

И, наверное, именно поэтому Tavus пока не даёт Griffin всем желающим. Представляю, какое количество мошеннических схем можно замутить с таким видосом.

Но вы мысленно готовьтесь жить в новом мире. Где вообще никому и ничему нельзя верить не то что на слово, а и на глаз.

https://www.tavus.io/

https://research.nvidia.com/labs/amri/projects/video-fdb/
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-with-live-avatar/
https://help.runwayml.com/hc/en-us/articles/49557780326163-Runway-Charactershttps://s.vidu.com/vidu-stream/

@cgevent


https://huggingface.co/Asirus/minimax_h3_ref2va_pruned_int8_convrot_taomate_8_step

Я собрал собственную merged-версию MiniMax H3 Ref2VA, в которую непосредственно интегрирована TaoMate 3-Step MAXQUALITY LoRA. Главная задача этой сборки — получить качественную reference-driven audio/video генерацию: несколько референсных изображений персонажа + аудио → стабильное видео с сохранением внешности и хорошим lip-sync.
⚙️ Рекомендуемые настройки
Steps: 8
Sampler: Euler
Scheduler: Simple
CFG: 1.0
Video Sigma Shift: 12
Audio Sigma Shift: 3
Denoise: 1.0
После серии тестов я остановился именно на 12 / 3. На 8 / 3 изображение местами получается немного «пережаренным» — особенно кожа и мелкая детализация. При Video Sigma Shift 12 картинка выглядит более естественно, при этом сохраняется высокая детализация и стабильность.
🧬 Из чего создана модель
В качестве базы использован официальный:
MiniMax H3 Ref2VA — pruned INT8 ConvRot-256
и наша:
TaoMate H3 3-Step MAXQUALITY BF16 LoRA
TaoMate не подключается как отдельная LoRA во время генерации — она полностью встроена непосредственно в веса модели.
🔬 Как выполнялся merge
Мы не делали обычный:
INT8 model + LoRA Loader
📦 Структура финальной модели
Всего в checkpoint:
932 тензора
Из них TaoMate интегрирована в:
208 LoRA target modules / 416 LoRA tensors
Распределение:
200 модулей — основной Transformer
8 модулей — Token Refiner
При этом важные компоненты не были принудительно переведены в INT8:
Main Transformer: INT8 ConvRot-256
Token Refiner: BF16
AdaLN: исходная precision Ref2VA — FP16 + FP32
ConvRot Group Size: 256
Scaling: row-wise
TaoMate Merge Strength: 0.9
Таким образом, мы сохранили высокоточную структуру критически важных компонентов и не стали ради уменьшения размера квантовать всё подряд.
🎯 Для чего эта модель
В первую очередь модель предназначена для Ref2VA-сценариев:
Reference Image(s) + Audio → Video + Audio
Особенно хорошо она подходит для:
сохранения внешности персонажа по одному или нескольким reference images;
персонажей, которые говорят или поют;
audio-driven facial animation;
lip-sync;
cinematic video generation;
multi-reference workflows;
высококачественной генерации на 8 шагах.
В моих тестах модель показала очень хорошее сохранение идентичности персонажа, стабильность лица и естественную артикуляцию при работе с аудио.
🏆 Отдельно про качество
Интересный результат дал двухпроходный workflow:
Pass 1: около 0.4 MP — основная структура и движение
Pass 2: около 1 MP — детализация и refinement
Такой подход позволяет получить значительно более качественный финальный результат, чем пытаться сразу делать весь процесс на максимальном разрешении.




Репост из: GitHub Community
Hunyuan3D-2-WinPortable — портативный пакет для запуска Hunyuan3D версий 2.0 и 2.1 на Windows.

🐱 GitHub


https://github.com/asirusasr-maker/ComfyUI-Gemini_3x_Pro
🚀 ComfyUI-Gemini_3x_Pro v2.0.5 — это основной мультимодальный набор нод для Gemini в ComfyUI. Главная нода принимает текст, системные инструкции, изображения, видео и аудио, позволяет анализировать этот контент и за считанные секунды получать промпты, описания, ответы и другие результаты, практически не нагружая локальную систему — основная работа выполняется через Gemini API.
🎙 В наборе также есть Audio Recorder — можно прямо из ComfyUI записать свой голос, а полученную запись передать в мультимодальную ноду для транскрипции, анализа и дальнейшей обработки. Полученную транскрипцию можно затем отправить в любые другие ноды или использовать как готовый текст для генерации промптов, контента и сценариев.
🔊 Есть TTS-нода для генерации голоса, Gemini Live / Audio для работы с голосовыми сессиями, Image Generation с актуальной линейкой Nano Banana Pro / Nano Banana 2 / Nano Banana 2 Lite, а также Video Generation. Добавлены автоматический retry и fallback между моделями, чтобы при временной перегрузке одной модели запрос автоматически переходил к другой.
📦 И главное: ComfyUI-Gemini_3x_Pro v2.0.5 теперь официально зарегистрирована в ComfyUI Registry и доступна прямо через ComfyUI Manager — достаточно найти ComfyUI Gemini 3x Pro и установить нужную версию.




Репост из: Stefan Falkok SI
minimax-h3_ref2v_8step_nsfw_rc1.safetensors
1.9Гб
То, что удалили профиль его и его лора

это не значит, что у меня их нет)




Репост из: GitHub Community
Видео недоступно для предпросмотра
Смотреть в Telegram
KrillinAI — это инструмент для локализации и улучшения аудио- и видеоконтента, позволяющий переводить и озвучивать видео на более чем 100 языков.

🐱 GitHub


Репост из: GitHub Community
Visual Enhancer — это портативное приложение для Windows, которое с помощью искусственного интеллекта улучшает изображения и видео на графических процессорах NVIDIA RTX.

Его настраиваемый конвейер обработки изображений и видео сочетает в себе нейронный рендеринг NVIDIA DLSS 5 через Neuroframe Engine, обычное масштабирование, суперразрешение DLSS, суперразрешение NVIDIA RTX Video, цветокоррекцию и повышение резкости.

Обработка видео также поддерживает NVIDIA RTX Video HDR и NVIDIA DLSS Frame Generation в качестве независимых этапов обработки. Настраивайте и включайте отдельные этапы обработки, просматривайте результат и экспортируйте отдельные файлы или пакеты.

Режим Live позволяет использовать нейронный рендеринг DLSS 5 для локальных видео и поддерживаемых онлайн-трансляций во время воспроизведения.

🐱 GitHub











Показано 20 последних публикаций.