Нейронавт | Нейросети в творчестве


Гео и язык канала: Россия, Русский
Категория: Технологии


Канал про нейросети в компьютерной графике, в кино и вообще
В папках и запусках не участвую
для связи @Neuronauticus
РКН: https://hf.ru/link8e56d

Зарегистрирован в РКН
Связанные каналы  |  Похожие каналы

Гео и язык канала
Россия, Русский
Категория
Технологии
Статистика
Фильтр публикаций


AutoClip

Еще один инструмент для монтажа, нарезает длинные видео на клипы. Подкаст, интервью или лекцию превращает в короткие ролики под соцсети

• Авто-нарезка на клипы с субтитрами, обложкой и текстом поста
• Адаптация под Douyin, TikTok, Reels, YouTube Shorts
• Кадр следует за говорящим
• До 10 готовых клипов на ролик
• Файл или ссылка на YouTube/Bilibili

• Монтаж и рендер локально, анализ модель на выбор
• Часовое видео — 10 клипов за 7-30 минут на M-серии Mac
• Десктоп, веб, CLI/MCP

MIT, платишь только за модели по своему ключу. v1.5.0 добавила десктоп, #CLI и #MCP

#videoediting #agent

MAX


Tesseract by Mirage

Видеоредактор для ИИ-агентов. Агент монтирует видео, делает моушен-графику и дизайн в проекте Premiere или After Effects. В итоге получаешь редактируемый проект

• Агент монтирует видео и анимацию по брифу и референсам
• Редактируемые слои: текст, фигуры, маски, ключевые кадры, adjustment layers
• Правка одного элемента без пересоздания всего проекта
• Импорт/экспорт проектов Premiure Pro и After Effects
• Превью до финального рендера, правки по ходу работы
• Экспорт в 4K 60 fps

Важные параметры
• Нативное ядро для macOS, Windows, Linux
• Работает с любым агентом: ChatGPT, Claude, Muse, Grok Bot, Instinct
• Локальный движок бесплатный, подписка агента отдельно
• Без Adobe-подписки

Тот же движок, что питает Captions (миллионы видео). Не генерирует футаж и аватары — только редактирует существующее и делает графику. Конвертация Adobe частичная, экспорт After Effects экспериментальный

mirage.app/tesseract/converters

#videoediying #plugin


Youtu-Parsing-Omni

Компактная омнимодальная парсинг-модель от Tencent: один 5B трансформер превращает в структурированный JSON почти что угодно — документ, картинку, график, чертеж, аудио и видео.

• Парсинг документов: лейаут, текст, таблицы, формулы, порядок чтения
• Картинки, графики, блок-схемы, геометрические фигуры
• Аудио: ASR, спикеры, сцены, акустические события
• Видео: кадры, OCR+ASR, отчёт о клипе
• Один унифицированный JSON-конверт для семи семейств задач
• Распознавание химструктур (ChemOCR) и нот (PDMX)

• 5B параметров, один энкодер на все модальности
• #SOTA на OmniDocBench v1.6 (96.96)
• Лучшая опенсорс на OmniParsingBench (75.08), после Gemini-3-Pro
• vLLM-плагин для быстрого сервинга

github.com/TencentCloudADP/youtu-parsing
learn2play.fun

#omnimodal #multimodal #any2json #vlm #alm

MAX


PAMI

Генерация взаимодействий человека с объектами по тексту и мешу объекта. Из фразы вроде «возьми штатив, перенеси и поставь обратно» получается анимированное движение тела плюс точная траектория объекта. Тюбинген + MPI.

• Полное тело + объект, скоординированные во времени
• Часть-якорное голосование: движение объекта привязывается к частям тела (корпус, запястья, лодыжки)
• Точный контакт рук с объектом — без дрейфа, проваливания и «парящих» предметов
• Рекурсивный рефайнер доводит геометрию контакта, сенсоры ближнего и дальнего действи

Код ждем

#HOI #animation

MAX


SynthID Detector

Google открыл всем детектор для проверки картинок и видео на ИИ. Раньше SynthID был доступен только избранным партнёрам и инструментам Google, теперь попробовать может любой.

#detection #watermark

MAX

1k 4 39 16 7

#humor

MAX

986 2 18 1 11

LIFT

Фреймворк для контролируемой генерации видео. Добавляет к управлению камерой контроль будущего лейаута: ты задаешь, что и где появится в финальном кадре.

• Задаешь траекторию камеры + лейаут финального кадра рамками и подписями
• Видео идет от первого кадра к заданному последнему, следуя камере
• Работает при больших сменах ракурса, когда камера открывает невидимые в начале области
• Боксы объектов в последнем кадре как явный сигнал управления
• Два режима: только камера / камера + лейаут

Гитхаб
HF
Демо

#t2v #cameracontrol #layoutcontrol

MAX


ROME (Building Rome from a Single Image)

Метод от Applied Intuition + университетов

• Из одного фото — детальный 3D-меш всей сцены
• Завершает геометрию за пределами того, что видно на снимке
• Интерактивное измерение расстояний в метрах прямо во вьюере
• Сравнивалось с World Tracing, GenRecon, VolFill, Lyra 2.0

• Адаптивные чанки: мелкие вблизи, крупные для дальних зданий
• Автогрессивная генерация — соседние чанки переиспользуют латенты, геометрия согласованна
• 2D-3D кондиционирование: каждый воксель знает, свободен он, видим или скрыт

В веб-вьювере меши упрощены до ~1.5M граней, в статье и видео — полное разрешение

Код ждем

#scenereconstruction #imageto3d #image2mesh

MAX


Iris-3B

Генератор картинок от Sperid Labs, который рисует каждый пиксель напрямую — без VAE и латентного пространства. Prompt → 1024px картинка, ничего не теряется в сжатом латенте.

• Генерация изображений из текста напрямую в пиксели
• Монокулярная оценка глубины
• Реставрация и апскейл изображений
• Все на одном бэкбоне без изменения архитектуры, просто финтюн под задачу

• 3B параметров + замороженный текстовый энкодер Qwen3-VL-4B (Apache 2.0)
• Веса ~12 ГБ на text-to-image, еще по ~12 ГБ на depth и upscaler
• Нужен NVIDIA GPU с CUDA

Альтернатива vision-фундаментам вроде DINOv2

huggingface.co/speridlabs/iris-3b
github.com/speridlabs/iris-3b

Спасибо @m_franz

#imagerestoration #i2d #depth #t2i

MAX


nanoMuse

Открытый аналог метовского Muse — персональный агент на каждом твоем устройстве. Один агент, одни руки на экране телефона и компьютера, память в файлах, модель на твой выбор.

Определяет персонального агента через пять вопросов и три горизонта

• Действует на экране телефона и компьютера
• Общий диалог между устройствами через релей, который можно поднять самому
• Память — обычные Markdown-файлы, которые человек может читать и править
• Модель выбираешь любую
• Знает твои аккаунты и устройства, помнит контекст неделями
• Sentinel проверяет каждое действие

• GPL-3.0
• Полная аналогия Muse: один разговор на все устройства
• Память с провенансом, оценка «рук», открытая модель для них — в роадмапе

github.com/nano-muse/nanoMuse

#agent #computeruse

MAX


Видео недоступно для предпросмотра
Смотреть в Telegram
Odyssey-3 уже можно попробовать (через квн)
Писал о нем в сентябре

Но на многое хоть что-нибудь не рассчитывайте
Даже начеррипиканые миры работают через пень-колоду, а свой создать - вообще ничего не шевелится

#world #interactive #agent

MAX


Принимать по одной ложке на ночь пока не слиопнется

#humor

MAX


Magnific One

Генератор картинок с арт-дирекшеном от Magnific. Создаtшь идею, а creative-direction слой принимает решения, как арт-директор. Фокус на брендинг

• Изображения до 4K: фото, иллюстрации, макеты
• До 10 рефов на вход, из них максимум 5 на стиль
• Хорошо рендерит текст
• Brand Kit: загружаешь лого, PDF, сайт — модель держит фирменный стиль в каждом кадре
• Draft-режим: 8-16 вариаций из одного промта по цене одного изображения
• Auto-layers: картинка разбивается на слои, можно менять типографику, текст, цвета и элементы без перегенерации
• Простые промты без деталей, есть промт-гайд

~1.5 минуты на картинку
Про дрейф картинки при множестве правок ничего не сказано

Попробовать
Промпт-гайд

#t2i #imageediting

MAX


Видео недоступно для предпросмотра
Смотреть в Telegram
WallGS Pro

Плагин для #UE
Умеет рендерить и анимировать гауссианы. UE 5.3–5.8, от ПК до Android и VR. В Pro-версии появилось главное — #relighting

Что нового в Pro
• Релайтинг: пересветить скан можно двумя способами — через proxy-меш или автоматически по нормалям
• Сплаты попадают в Lumen-отражения
• Импорт сплатов на лету
• Culling volumes: обрезка сцен объемами
• 4DGS-анимации, LOD и DLSS-пресеты

Что вообще умеет
• 3DGS и 4DGS, коллизии в один клик, авто-LOD
• Android и Meta Quest через Vulkan
• Подготовка ассетов в 10 раз быстрее NanoGS, файлы на треть меньше

Есть бесплатный Windows-вьюер без установки Unreal.

Pro-версия — на FAB, релайтинг пока экспериментальный

#gaussian #plugin

MAX


Видео недоступно для предпросмотра
Смотреть в Telegram
GRACE

Метод сжатия латентов от KAIST AI и Kakao Corp: сжимает видео-автоэнкодер так, что DiT работает на 8× меньшем числе токенов. Ускорение 11.1× при том же качестве по VBench.

• Сжимает предобученный автоэнкодер #Wan21 без потери совместимости с DiT
• Генерация видео с 8× меньшим числом латент-токенов
• Качество на уровне полного пайплайна по VBench
• Без переобучения DiT с нуля — легкая адаптация LoRA

• Wan2.1-I2V-14B: 32.8k → 4.3k токенов
• Ускорение 11.1× при 480×832, 15.5× при 736×1280
• Инференс 78 с против 863 с на A100 80GB
• Асимметричный денойзинг: база чистится раньше остатка

github.com/cvlab-kaist/GRACE
huggingface.co/chimaharicox/GRACE

#optimiozation #t2v #i2v

MAX


#Yue2 / #minimaxMusic / #acestep15

github.com/jplenio/Plenio-Music-Production-System - Plenio 0.3: описание песни → локальная LLM пишет, YuE2/Minimax Music 3 исполняет, Plenio сводит/мастерит. Все в #ComfyUI, без облака. Редактор партитуры (пианолла, нотация, ABC), стемы с фейдерами и эффектами, графический EQ с матчингом референса, мастеринг до −14 LUFS. Шесть шаблонов, режим ревью. Refine и Stems пока экспериментальные

github.com/Garionhk/GoKuk - Gokuk: портативное Windows-приложение для полных песен на YuE2 без ComfyUI. Чипы стиля, кавер с SheetSage2, редактор партитуры до генерации, библиотека. Windows 10/11, NVIDIA 12GB+, ~25GB диска. Лицензии CC BY-NC — только некоммерческое

github.com/yeufonic/yeufonic - Yeufonic: веб-приложение вокруг ComfyUI/YuE2 без проводов, Docker или Windows-инсталлятор, локальный трейн LoRA

github.com/HerkulesTerminator/comfyui-music-generator/tree/main - ACE-Step 1.0 + YuE2 - эйсстеп хорош креативно, прогоняем его ноты через YuE2 = хороший звук #workflow

#LoRA

huggingface.co/pduncan/YuE2_Deathmetalv1_lora -дэт-металл

Обновления

github.com/pytraveler/YuE2-ComfyUI/releases/tag/v0.12.0 - YuE2-ComfyUI 0.12.0: точнее распознавание слов (поле language — русский больше не переводится на английский; second_hearing: Whisper слушает второй раз, ошибки 9% вместо 15%). RTX 20xx/GTX 16: последняя стадия в FP16 — длинные песни доходят до конца. Фикс падения при отмене в первую секунду

huggingface.co/deAPI-ai/minimax-music3-11b-int8 - MiniMax Music 3 ужат до ~12Gb (int8)

#musicediting


#krea2

Инструменты

github.com/capitan01R/ComfyUI-Krea2T-Enhancer - Krea2T Enhancer: нода улучшения следования промпту. Текстовый энхансер — младшая версия. Прирост качества и точности промпта
Есть для #klein github.com/capitan01R/ComfyUI-Flux2Klein-Enhancer

civitai.com/articles/35976/comfyui-tutorial-qwen-image-2-1-vs-flux-2-krea-turbo-which-makes-better-character-sheets - сравнение #charactersheet: Qwen 2.1 против FLUX.2 Krea Turbo. Схожая консистентность, но Qwen в ~3 раза быстрее. Оба подхода в одном воркфлоу

huggingface.co/lvladikov/Krea2-Turbo-Distill-2step-LoRA - 2-шаговая дистилляция, детали на уровне учителя, до 2048×2048. Мелкие объекты — слабое место

pastebin.com/raw/S6ziW7yZ - вариативность Krea 2 без лор: текстовый энкодер как LLM для разворачивания промпта. Два рычага: seed промпта (сильно) и seed сэмплера (тонко). Qwen 2.1 PE-системный промпт работает, обычный Qwen3VL цензуре почти не мешает. +4 сек на генерацию

lumenastrum.github.io/clio-style-preview/gallery/ - галерея стилей Clio с превью

civitai.red/models/2961766/moonmaster-krea2-turbo-model-suite - Narrative Drift: чекпоинт Krea 2 Turbo под иллюстрацию и диджитал-арт. Насыщенные цвета, графические тени, арт-дирекшн. Без триггера, Euler · Simple · 8 шагов · CFG 1. BF16/FP8/INT8


Google Labs Playground

Платформа для создания игр с помощью ИИ в браузере. Описываешь идею — получаешь играбельную игру, которую можно публиковать и шерить

• Генерация игр по описанию
• Разные жанры: платформеры, аркады, квизы, головоломки, спорт
• Публикация и общий доступ по ссылке
• Раздел Discovery — игры других пользователей за вдохновением

В Discovery уже лежат готовые примеры: платформер про сонные облака, ретро-танчики, пиксельный шутер с осьминогом и другие. Игры запускаются в браузере, без установки

#gamedev #game

MAX

Показано 18 последних публикаций.