После того как вышла SDXL пользователи приуныли - медленная, жрет много памяти, нужно принципиально новое железо.
Когда-то Мостак обещал нам дистилляцию Stable Diffusion и генерацию картинок в 30fps, но он у нас мастак обещаний, и проще выпускать тучу сырых продуктов на хайпе (StableLM, StableAudio, StableVicuna), чем допиливать имеющиеся.
Поэтому люди берут ускорение Stable Diffusion в свои руки.
Мы уже видели проекты типа InstaFlow (типа генерация картинки в SD за один sample step)
Сейчас всех будоражат Latent Consistency Models - это дистилляция (сжатие с потерей точности) уже готовых моделей, в результате чего генерация идет гораздо быстрее и всего за несколько шагов. Все это напоминает квантизацию языковых моделей, чтобы они влезали в память и запускались на старом нормальном железе.
Да, результаты ЧУТЬ хуже, но выигрыш по времени совсем не чуть, а огого.
И если для пожатых языковых LLM, модели явно тупеют, то отличить "отупевшую" картинку не всегда можно.
А тут вот еще Nvidia выкатила TensorRT - ускорялку выполнения(инференса) моделей на своих картах.
К чему это я?
Для производства этих всех смешных стилизованных видео не нужно вот это вот идеальное качество. Главное гнать картинку с как можно большей частотой кадров. Да, есть любители рассматривать видосы на паузе, но это не мы.
И недалек тот день, когда мы уже будем получать поток картинок из Stable Diffusion в реальном времени. Сначала на ПК, а потом и на телефонах.
И понесутся стримы по закоулочкам, когда в кадре будет лютая ИИ-дичь, которую новые нормальные тиктокеры будут отлично потреблять (не путать с анимацией, видео, кино и прочим олдскулом).
Дальше буду интересные вопросы с авторским правом. Ибо можно взять любой копирайтный контент и превратить его в ИИ-дичь - и никакой детектор или судья не сможет ничего внятного сказать про сходства или отличия.
И останется только подождать, пока нынешние подростки, уже потихонечку насмотренные на этой дерганой картинке, начнут делать видео и игры в соответствии со своей насмотренностью.
Держите поток в 7 кадров в секунду из Stable Diffusion на 4090. Там те самые пожатые, Latent Consistency Models, которые присунули в ComfyUI
Осталось ускориться в 4 раза.
Скрадено с реддита и у Нейронавтика
Когда-то Мостак обещал нам дистилляцию Stable Diffusion и генерацию картинок в 30fps, но он у нас мастак обещаний, и проще выпускать тучу сырых продуктов на хайпе (StableLM, StableAudio, StableVicuna), чем допиливать имеющиеся.
Поэтому люди берут ускорение Stable Diffusion в свои руки.
Мы уже видели проекты типа InstaFlow (типа генерация картинки в SD за один sample step)
Сейчас всех будоражат Latent Consistency Models - это дистилляция (сжатие с потерей точности) уже готовых моделей, в результате чего генерация идет гораздо быстрее и всего за несколько шагов. Все это напоминает квантизацию языковых моделей, чтобы они влезали в память и запускались на старом нормальном железе.
Да, результаты ЧУТЬ хуже, но выигрыш по времени совсем не чуть, а огого.
И если для пожатых языковых LLM, модели явно тупеют, то отличить "отупевшую" картинку не всегда можно.
А тут вот еще Nvidia выкатила TensorRT - ускорялку выполнения(инференса) моделей на своих картах.
К чему это я?
Для производства этих всех смешных стилизованных видео не нужно вот это вот идеальное качество. Главное гнать картинку с как можно большей частотой кадров. Да, есть любители рассматривать видосы на паузе, но это не мы.
И недалек тот день, когда мы уже будем получать поток картинок из Stable Diffusion в реальном времени. Сначала на ПК, а потом и на телефонах.
И понесутся стримы по закоулочкам, когда в кадре будет лютая ИИ-дичь, которую новые нормальные тиктокеры будут отлично потреблять (не путать с анимацией, видео, кино и прочим олдскулом).
Дальше буду интересные вопросы с авторским правом. Ибо можно взять любой копирайтный контент и превратить его в ИИ-дичь - и никакой детектор или судья не сможет ничего внятного сказать про сходства или отличия.
И останется только подождать, пока нынешние подростки, уже потихонечку насмотренные на этой дерганой картинке, начнут делать видео и игры в соответствии со своей насмотренностью.
Держите поток в 7 кадров в секунду из Stable Diffusion на 4090. Там те самые пожатые, Latent Consistency Models, которые присунули в ComfyUI
Осталось ускориться в 4 раза.
Скрадено с реддита и у Нейронавтика