MITV


Channel's geo and language: Russia, Russian
Category: Technologies



Channel's geo and language
Russia, Russian
Statistics
Posts filter


Forward from: Метаверсище и ИИще
Ну, за аватаров.

Tavus показала Griffin - новый real-time AI-аватар, который уже выглядит не как очередная “говорящая фотография”, а как попытка генерировать целиком живого собеседника во время разговора.

Спойлер, про слепые тесты Туринга в конце.

Griffin получает вашу речь и видео, продолжает слушать и смотреть на вас даже в тот момент, когда отвечает сам, а параллельно генерирует голос, лицо, взгляд, мимику, жесты и весь кадр виртуального кожаного. То есть он умеет не только синхронно шевелить губами, но и кивнуть во время вашей фразы, отвести взгляд, отреагировать выражением лица, вставить короткую реплику или остановиться, когда его перебили.

Причём это, внимание, real-time генерация, а не заранее сделанный ролик.

Видеочасть Griffin-Lite работает в 720p при 25 fps. Модель генерирует видео кусками по 320 ms: один latent = 8 кадров. На каждый такой кусок приходится всего 3 diffusion steps, после чего он сразу декодируется и отправляется зрителю на том конце. Средняя задержка от входящего аудио до соответствующей реакции в видео в тестах Tavus составляет 0.43 секунды на NVIDIA H100.

Но здесь важная оговорка: из этого не следует, что весь Griffin “работает с latency 430 ms”. В полном разговорном тесте NVIDIA медианная реакция Griffin была около 1.9-2.2 секунды в зависимости от задачи. 0.43 секунды - именно latency видеогенератора после поступления управляющего аудиосигнала.

По железу Tavus раскрывает только часть картины. Именно тест видеогенератора проводился на H100. В credits компания отдельно благодарит Baseten, Daily и Cerebrium за инфраструктуру research preview, но сколько GPU требуется на одну сессию и на каких именно конфигурациях работает весь Griffin, Tavus пока не сообщает. Поэтому утверждать, что “один Griffin = один H100”, нельзя.

И попробовать всё это тоже, блин, пока нельзя.

Конкуренты.

Google неделю назад выпустила Gemini 3.8 Live with Live Avatar. Писал про это недавно. Это тоже настоящий потоковый аватар: Gemini одновременно получает аудио и изображение с камеры, ведёт native speech-to-speech диалог и генерирует синхронного аватара в 24 fps. Он видит камеру и screen sharing, поддерживает 97 языков и tool calling прямо во время разговора. Live Avatar уже доступен в Gemini Enterprise, хотя создание собственного аватара по фотографии пока требует allowlist.

Runway Characters идёт немного с другой стороны. Из одной картинки можно сделать real-time персонажа с голосом и характером, который разговаривает через WebRTC, может видеть webcam и screen share. В Runway уже можно попробовать это самому: веб-версия ограничивает разговор двумя минутами, API - пятью минутами, цена самого Characters сейчас составляет 2 кредита за 6 секунд, то есть около $0.20 за минуту. Причём Runway позволяет вообще принести свой STT + LLM + TTS, а Characters использовать только как real-time видеослой.

А Vidu S2-Avatar вообще уже продаётся как полноценная streaming-модель. Она принимает изображение персонажа и ведёт real-time голосовой диалог, поддерживает interruption, управление движениями, а во время разговора ей можно дать фотографию предмета, одежды или нового фона - персонаж может взять предмет, переодеться или изменить окружение прямо в потоке. У S2 есть публичный demo и API.

То есть сам факт “живого аватара в реальном времени” уже не мегафича. Google это делает, Runway это делает, Vidu это делает.

Интерес Griffin скорее в другом: Tavus пытается связать понимание разговора и генерацию невербального(!!!) поведения гораздо теснее. Видео здесь должно быть не просто визуализацией уже готового аудио. Разговорная модель отдельно управляет gesture, gaze, emotion и может менять их уже в следующем 320-ms куске видео.

Зато Tavus уже неистово хайпуют: “первая модель, прошедшая video Turing test”.

54 человека посадили на минутный видеозвонок. Им сказали, что сейчас их соединят с другим участником исследования. На самом деле напротив кожаных сидел Griffin-Lite, который в реальном времени генерировал лицо, голос и ответы.

После звонка 26 из 54 человек - 48% - сказали, что разговаривали с настоящим человеком. Для предыдущей версии Tavus результат был 1 из 41.

Вот эти 48% Tavus и называет прохождением video Turing test. Штош.

Строго говоря, никакого общепринятого стандарта “video Turing test” не существует, а эксперимент был крохотным и ещё немного подталкивал кожаных в нужную сторону: им изначально сказали, что они встретятся с другим человеком, а вопрос про ИИ появился только после разговора.

Но результаты всё равно нарядные.

Почти половина кожаных в условно слепом тесте просто не заметила, что напротив них вообще нет кожаного.

И, наверное, именно поэтому Tavus пока не даёт Griffin всем желающим. Представляю, какое количество мошеннических схем можно замутить с таким видосом.

Но вы мысленно готовьтесь жить в новом мире. Где вообще никому и ничему нельзя верить не то что на слово, а и на глаз.

https://www.tavus.io/

https://research.nvidia.com/labs/amri/projects/video-fdb/
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-with-live-avatar/
https://help.runwayml.com/hc/en-us/articles/49557780326163-Runway-Charactershttps://s.vidu.com/vidu-stream/

@cgevent


https://huggingface.co/Asirus/minimax_h3_ref2va_pruned_int8_convrot_taomate_8_step

Я собрал собственную merged-версию MiniMax H3 Ref2VA, в которую непосредственно интегрирована TaoMate 3-Step MAXQUALITY LoRA. Главная задача этой сборки — получить качественную reference-driven audio/video генерацию: несколько референсных изображений персонажа + аудио → стабильное видео с сохранением внешности и хорошим lip-sync.
⚙️ Рекомендуемые настройки
Steps: 8
Sampler: Euler
Scheduler: Simple
CFG: 1.0
Video Sigma Shift: 12
Audio Sigma Shift: 3
Denoise: 1.0
После серии тестов я остановился именно на 12 / 3. На 8 / 3 изображение местами получается немного «пережаренным» — особенно кожа и мелкая детализация. При Video Sigma Shift 12 картинка выглядит более естественно, при этом сохраняется высокая детализация и стабильность.
🧬 Из чего создана модель
В качестве базы использован официальный:
MiniMax H3 Ref2VA — pruned INT8 ConvRot-256
и наша:
TaoMate H3 3-Step MAXQUALITY BF16 LoRA
TaoMate не подключается как отдельная LoRA во время генерации — она полностью встроена непосредственно в веса модели.
🔬 Как выполнялся merge
Мы не делали обычный:
INT8 model + LoRA Loader
📦 Структура финальной модели
Всего в checkpoint:
932 тензора
Из них TaoMate интегрирована в:
208 LoRA target modules / 416 LoRA tensors
Распределение:
200 модулей — основной Transformer
8 модулей — Token Refiner
При этом важные компоненты не были принудительно переведены в INT8:
Main Transformer: INT8 ConvRot-256
Token Refiner: BF16
AdaLN: исходная precision Ref2VA — FP16 + FP32
ConvRot Group Size: 256
Scaling: row-wise
TaoMate Merge Strength: 0.9
Таким образом, мы сохранили высокоточную структуру критически важных компонентов и не стали ради уменьшения размера квантовать всё подряд.
🎯 Для чего эта модель
В первую очередь модель предназначена для Ref2VA-сценариев:
Reference Image(s) + Audio → Video + Audio
Особенно хорошо она подходит для:
сохранения внешности персонажа по одному или нескольким reference images;
персонажей, которые говорят или поют;
audio-driven facial animation;
lip-sync;
cinematic video generation;
multi-reference workflows;
высококачественной генерации на 8 шагах.
В моих тестах модель показала очень хорошее сохранение идентичности персонажа, стабильность лица и естественную артикуляцию при работе с аудио.
🏆 Отдельно про качество
Интересный результат дал двухпроходный workflow:
Pass 1: около 0.4 MP — основная структура и движение
Pass 2: около 1 MP — детализация и refinement
Такой подход позволяет получить значительно более качественный финальный результат, чем пытаться сразу делать весь процесс на максимальном разрешении.




Forward from: GitHub Community
Hunyuan3D-2-WinPortable — портативный пакет для запуска Hunyuan3D версий 2.0 и 2.1 на Windows.

🐱 GitHub


https://github.com/asirusasr-maker/ComfyUI-Gemini_3x_Pro
🚀 ComfyUI-Gemini_3x_Pro v2.0.5 — это основной мультимодальный набор нод для Gemini в ComfyUI. Главная нода принимает текст, системные инструкции, изображения, видео и аудио, позволяет анализировать этот контент и за считанные секунды получать промпты, описания, ответы и другие результаты, практически не нагружая локальную систему — основная работа выполняется через Gemini API.
🎙 В наборе также есть Audio Recorder — можно прямо из ComfyUI записать свой голос, а полученную запись передать в мультимодальную ноду для транскрипции, анализа и дальнейшей обработки. Полученную транскрипцию можно затем отправить в любые другие ноды или использовать как готовый текст для генерации промптов, контента и сценариев.
🔊 Есть TTS-нода для генерации голоса, Gemini Live / Audio для работы с голосовыми сессиями, Image Generation с актуальной линейкой Nano Banana Pro / Nano Banana 2 / Nano Banana 2 Lite, а также Video Generation. Добавлены автоматический retry и fallback между моделями, чтобы при временной перегрузке одной модели запрос автоматически переходил к другой.
📦 И главное: ComfyUI-Gemini_3x_Pro v2.0.5 теперь официально зарегистрирована в ComfyUI Registry и доступна прямо через ComfyUI Manager — достаточно найти ComfyUI Gemini 3x Pro и установить нужную версию.




Forward from: Stefan Falkok SI
minimax-h3_ref2v_8step_nsfw_rc1.safetensors
1.9Gb
То, что удалили профиль его и его лора

это не значит, что у меня их нет)




Forward from: GitHub Community
Video is unavailable for watching
Show in Telegram
KrillinAI — это инструмент для локализации и улучшения аудио- и видеоконтента, позволяющий переводить и озвучивать видео на более чем 100 языков.

🐱 GitHub


Forward from: GitHub Community
Visual Enhancer — это портативное приложение для Windows, которое с помощью искусственного интеллекта улучшает изображения и видео на графических процессорах NVIDIA RTX.

Его настраиваемый конвейер обработки изображений и видео сочетает в себе нейронный рендеринг NVIDIA DLSS 5 через Neuroframe Engine, обычное масштабирование, суперразрешение DLSS, суперразрешение NVIDIA RTX Video, цветокоррекцию и повышение резкости.

Обработка видео также поддерживает NVIDIA RTX Video HDR и NVIDIA DLSS Frame Generation в качестве независимых этапов обработки. Настраивайте и включайте отдельные этапы обработки, просматривайте результат и экспортируйте отдельные файлы или пакеты.

Режим Live позволяет использовать нейронный рендеринг DLSS 5 для локальных видео и поддерживаемых онлайн-трансляций во время воспроизведения.

🐱 GitHub












Привет, ребята! Вышло большое обновление, решил поделиться своим пет-проектом.

Труба — голосовой ассистент для Windows с открытым кодом: гитхаб

Речь распознаёт и озвучивает локально (GigaAM, Silero или Higgs TTS 3 на видеокарте, можно клонировать голос).

Думает облачная LLM с инструментами:
DeepSeek, OpenAI, OpenRouter или локальная через Ollama. Старый Android-телефон служит динамиком и сенсорной панелью, как Stream Deck.

Умеет искать в интернете, управлять программами, файлами, музыкой и раскладкой, ставить напоминания, пересказывать и читать вслух документы, вести заметки в Obsidian.

Из интересного: чтобы не было ложных действий, модель цитирует просьбу пользователя, а вторая модель проверяет, правда ли он просит.

Буду рад обратной связи, особенно по другим моделям.


🎬 ComfyUI-MiniMax-H3-LongMedia 0.6.60
Director прошёл очередной техосмотр и теперь ещё немного меньше похож на набор нод, которые случайно оказались в одном workflow и решили не расходиться.
Что приехало в релиз:
• RefMod Sources — теперь можно собирать наборы из изображений, видео и аудио, вставлять картинки прямо из буфера обмена и сразу видеть расход visual tokens для каждого источника и всего набора целиком.
Наконец можно узнать, кто именно съел контекст, а не просто смотреть на пустую тарелку.
• Character RefMod — персонаж в MultiClip теперь стабильнее сохраняет идентичность между клипами и заметно реже использует монтажный стык как возможность полностью пересмотреть свою внешность.
• Latent Hi-Res + Refine — overlap теперь передаётся через границы клипов, поэтому геометрия и цвет продолжают существовать в одной реальности, а не знакомятся заново каждые несколько секунд.
• Director — улучшили cut markers, работу с промежутками между клипами, Fit, сортировку Takes и сохранение позиции галереи.
Постепенно Director превращается в монтажку. Никто не ожидал такого развития событий.
• Preview-кэш — старые видеополосы и миниатюры теперь нормально освобождаются.
GPU официально освобождён от должности хранителя архива превью за последние три поколения workflow.
• motion_repair — настройка теперь сохраняется после перезагрузки workflow и больше не смотрит на вас так, будто вы впервые встретились.
Отдельно обновили справку: теперь она описывает реальные параметры узлов, включая устаревшие настройки, которые всё ещё могут жить в старых workflow и иногда выходить на поверхность как цифровая археология.
Про RefMod, потому что тут терминология традиционно пытается открыть портал в другое измерение:
style задаёт модели общий ориентир, но сам по себе автоматически стиль не переносит.
Encode создаёт VAE reference.
А уже силу влияния задаёт слой RefMod.
То есть:
Encode — вот референс.
RefMod — насколько серьёзно к нему относиться.
Да, на этот раз параметры действительно делают примерно то, что написано на упаковке.
VizartVJ
Шум рождает изображение.

ГЛАВНАЯ ПО ТЫКАНЬЮ ТУТ






Forward from: Turk
Замена головы с помощью лоры на квен имадж 2.1, кому интересно

https://huggingface.co/Alissonerdx/BFS-Best-Face-Swap/tree/main/workflows

Там же лежат и для креи такие же, но они не работают так же более менее прилично

20 last posts shown.