Дайджест:
📹 ВИДЕО + АРТ 🎨
StyleCrafter: меняем стиль видео одной реф картинкой.
LooseControl: контроль генерации 2D изображений с помощью 3D коробок.
DeepCache: улучшаем скорость и качество генерации диффузионных моделей без тренировки и дистилляции — за счёт кэширования. Вот ещё Cache Me if You Can на эту тему от запрещёнки вышло.
Получаем OpenPose из любого видео. Погонять локально.
MagicAnimate: анимируем картинки используя видео реф, который можно получить с помощью Video2DensePose (ещё колаб). Код здесь.
AnimateDiff + IPadapter для анимации по одному изображению.
Neurogen: появилась текстовые модели и генерация изображений через DALLE 3 в NeuroGPT, а также дипфейкер Rope обновился до V1.5.
LucidDreamer: ещё одно демо генератора 3D на основе гауссианов.
Marigold: диффузионная модель и протокол для получения монокулярной карты глубины изображения.
PatchFusion: тоже на тему получения карты глубины, только с улучшением разрешения и повышением детализации.
InstaFlow: появилось демо модели для генерации картинок в 1 шаг. Правда за это время уже успели выйти SDXL Turbo и LCM.
VMC: меняем стиль видео с сохранением движения в кадре.
AnimateZero: ещё одна модель для анимации картинок. SVD или AnimateDiff выглядят по-качественнее.
DynamiCrafter: тоже модель для анимации изображений.
Генерация картинок с переложением стиля на основе рефа.
Учёным удалось с 75% точностью получить картинки из мыслей пациентов.
EfficientSAM: улучшенная версия SAM для выделения объектов на картинках.
Получение гауссианов из небольшого количества кадров.
ALIGN: API для разработчиков игр и приложений, чтобы фильтровать контент, который генерят пользователи и не быть удалённым с App Store / Google Play.
Я заметил, что часто помимо ссылок на демо на Gradio стали появляться варики для запуска на своём железе через Docker. Кому интересно погоняйте на Fooocus, Seamless или LaVie скажите как оно.
Google: показали модель FACTOR для генерации видео с контролем кадра через рисование как объекты должны двигаться. Кода нет.
🎸 ЗВУК 🎸
Музыкант Vinay сделал хип-хоп альбом с помощью MusicGen за 24 часа. Деньги с продаж пойдут на благотворительность.
Запрещёнка выпустила серию моделей для работы с голосом. Seamless M4T V2 стала основой для SeamlessExpressive (переводит нюансы речи), SeamlessStreaming (перевод голоса и и текста а реальном времени). Колаб тут.
Rask AI: липсинк перевод голоса на видео с не одним спикером.
🤖 ЧАТЫ 🤖
Сформирован альянс "The AI Alliance", нацеленный помочь развить опенсорсные проекты в сфере нейронок, потому что AI не должен контролироваться какой-то одной компанией.
Perplexity: выпустили две новые модели на 7B и 70B, которые всегда онлайн и владеют актуальными данными, плюс API перешел на оплату по мере использования.
StabilityAI: выпустили ещё один маленький чат-бот StableLM Zephyr 3B с фокусом на мобилы. Говорят на тестах не хуже 7B моделей, хоть она и в половину меньше.
HuggingFace: курс по разработке игр с помощью AI на Unity и UE.
Датасет с википедией/викимедией в тренде на HF. Как запихнуть в колаб.
Nous: обновили чат-бота до v2.5 и внедрили возможность общения по картинкам (VLM).
Optium-Nvdia: изменение в одной строчке кода дало х28 к производительности.
#Gemini #openai #chatgpt
📹 ВИДЕО + АРТ 🎨
StyleCrafter: меняем стиль видео одной реф картинкой.
LooseControl: контроль генерации 2D изображений с помощью 3D коробок.
DeepCache: улучшаем скорость и качество генерации диффузионных моделей без тренировки и дистилляции — за счёт кэширования. Вот ещё Cache Me if You Can на эту тему от запрещёнки вышло.
Получаем OpenPose из любого видео. Погонять локально.
MagicAnimate: анимируем картинки используя видео реф, который можно получить с помощью Video2DensePose (ещё колаб). Код здесь.
AnimateDiff + IPadapter для анимации по одному изображению.
Neurogen: появилась текстовые модели и генерация изображений через DALLE 3 в NeuroGPT, а также дипфейкер Rope обновился до V1.5.
LucidDreamer: ещё одно демо генератора 3D на основе гауссианов.
Marigold: диффузионная модель и протокол для получения монокулярной карты глубины изображения.
PatchFusion: тоже на тему получения карты глубины, только с улучшением разрешения и повышением детализации.
InstaFlow: появилось демо модели для генерации картинок в 1 шаг. Правда за это время уже успели выйти SDXL Turbo и LCM.
VMC: меняем стиль видео с сохранением движения в кадре.
AnimateZero: ещё одна модель для анимации картинок. SVD или AnimateDiff выглядят по-качественнее.
DynamiCrafter: тоже модель для анимации изображений.
Генерация картинок с переложением стиля на основе рефа.
Учёным удалось с 75% точностью получить картинки из мыслей пациентов.
EfficientSAM: улучшенная версия SAM для выделения объектов на картинках.
Получение гауссианов из небольшого количества кадров.
ALIGN: API для разработчиков игр и приложений, чтобы фильтровать контент, который генерят пользователи и не быть удалённым с App Store / Google Play.
Я заметил, что часто помимо ссылок на демо на Gradio стали появляться варики для запуска на своём железе через Docker. Кому интересно погоняйте на Fooocus, Seamless или LaVie скажите как оно.
Google: показали модель FACTOR для генерации видео с контролем кадра через рисование как объекты должны двигаться. Кода нет.
🎸 ЗВУК 🎸
Музыкант Vinay сделал хип-хоп альбом с помощью MusicGen за 24 часа. Деньги с продаж пойдут на благотворительность.
Запрещёнка выпустила серию моделей для работы с голосом. Seamless M4T V2 стала основой для SeamlessExpressive (переводит нюансы речи), SeamlessStreaming (перевод голоса и и текста а реальном времени). Колаб тут.
Rask AI: липсинк перевод голоса на видео с не одним спикером.
🤖 ЧАТЫ 🤖
Сформирован альянс "The AI Alliance", нацеленный помочь развить опенсорсные проекты в сфере нейронок, потому что AI не должен контролироваться какой-то одной компанией.
Perplexity: выпустили две новые модели на 7B и 70B, которые всегда онлайн и владеют актуальными данными, плюс API перешел на оплату по мере использования.
StabilityAI: выпустили ещё один маленький чат-бот StableLM Zephyr 3B с фокусом на мобилы. Говорят на тестах не хуже 7B моделей, хоть она и в половину меньше.
HuggingFace: курс по разработке игр с помощью AI на Unity и UE.
Датасет с википедией/викимедией в тренде на HF. Как запихнуть в колаб.
Nous: обновили чат-бота до v2.5 и внедрили возможность общения по картинкам (VLM).
Optium-Nvdia: изменение в одной строчке кода дало х28 к производительности.
#Gemini #openai #chatgpt