Видео недоступно для предпросмотра
Смотреть в Telegram
Про диффузионные модели я пишу сравнительно часто. Два-три года назад они удивляли нас тем, как здорово им удаётся рисовать изображения по текстовому запросу, но сейчас обыватели к этому инструменту попривыкли, а исследователи двигаются дальше.
Взять хотя бы игровые нейродвижки, некоторые из которых я тут освещаю, а некоторые — нет. Современные игры — это чаще всего работа с 3D-объектами, наполняющими сцену, которую мы видим на плоском экране монитора. В этом смысле перед нейродвижком ставится задача рисовать, по сути, все те же изображения, просто связанные друг с другом игровой логикой.
А что насчёт генерации честного 3D, но тоже с помощью диффузии? Казалось бы, это всего лишь +1 к размерности, что для математики не проблема. На практике всё несколько сложнее, но эта идея оказалось вполне работоспособной. Правда, на этом пути возникло несколько трудностей.
Например, даже обычные рисовалки вроде MidJorney не обладают воспроизводимостью: один и тот же запрос приводит к разным изображениям. В трёхмерной анимации или дизайне требования более строгие: например, вам нужен ряд разных фигур, но в одной позе, но существующие модели такое выдать не способны.
Эту проблему решает новый подход, разработанный в том числе и учёными из AIRI. Они придумали трюк, который математически связывает все однотипные промпты, делая генерацию разных объектов более однородной. Более того, такая связь позволяет непрерывно превращать одних трёхмерных существ в других без смены позы или редактировать результат.
Подробности — в свежей статье на Хабре от одной из участниц научной команды
Взять хотя бы игровые нейродвижки, некоторые из которых я тут освещаю, а некоторые — нет. Современные игры — это чаще всего работа с 3D-объектами, наполняющими сцену, которую мы видим на плоском экране монитора. В этом смысле перед нейродвижком ставится задача рисовать, по сути, все те же изображения, просто связанные друг с другом игровой логикой.
А что насчёт генерации честного 3D, но тоже с помощью диффузии? Казалось бы, это всего лишь +1 к размерности, что для математики не проблема. На практике всё несколько сложнее, но эта идея оказалось вполне работоспособной. Правда, на этом пути возникло несколько трудностей.
Например, даже обычные рисовалки вроде MidJorney не обладают воспроизводимостью: один и тот же запрос приводит к разным изображениям. В трёхмерной анимации или дизайне требования более строгие: например, вам нужен ряд разных фигур, но в одной позе, но существующие модели такое выдать не способны.
Эту проблему решает новый подход, разработанный в том числе и учёными из AIRI. Они придумали трюк, который математически связывает все однотипные промпты, делая генерацию разных объектов более однородной. Более того, такая связь позволяет непрерывно превращать одних трёхмерных существ в других без смены позы или редактировать результат.
Подробности — в свежей статье на Хабре от одной из участниц научной команды