Неделя была достаточно жаркой по релизам.Погнали.
🔹 Наконец-то вышел GPT Images 1.5 .Многие очень ждали.Писал тут.Это абсолютно новая модель - не как предыдущая, которая была основана на базе Sora.Как обычно,она еще лучше держит промпт,увереннее работает с текстом и деталями,а также наконец-то избавилась от фирменной «желтизны»,с которой все боролись.Но, по факту,модель не лучше новой Banana.
🔹 Wan 2.6.Новая видеомодель Alibaba,заточенная под reference‑to‑video:она берет картинку или видео‑референс и генерирует клипы с тем же персонажем и стилем,держит стабильный дизайн,плавное движение и адекватную сцену,а также поддерживает multi‑shot и липсинк для серийных роликов.Как все знаем Wan открыт и можно это делать у себя на железе или в облаке.Попробовать можно тут.Презентация в комментариях.
🔹 Trellis.2.Новая модель от Microsoft.Модель заметно уступает некоторым закрытым аналогам,но у нее есть большой плюс:она открытая, можно запускать на своем железе или в облаке.По сравнению с первой версией она стала значительно лучше.Попробовать можно тут,а код тут.Презентация - в комментариях.Также,чтобы далеко не ходить,Hunyuan 3D v3 вышел в полноценный релиз - раньше, как оказалось,была только бета.По сути, поправили баги,ускорили обработку, качество почти не изменилось.И да,добавили тарифные планы,что,скорее всего,означает плавный уход от полностью бесплатной модели.
🔹 Вышел Flux.2 [max].Флагманская версия Flux 2 для продакшена.Она дает максимальное качество картинки в линейке,лучше других держит промпт,текст и сложные сцены, аккуратно редактирует уже готовые изображения и поддерживает до 10 референсов в одном запросе.Модель умеет подтягивать актуальную инфу или референсы из веба/документов и строить картинку на их основе,а не фантазировать в вакууме,поэтому результат получается более предсказуемым и привязанным к задаче.
🔹 SAM audio - это новая открытая модель от Meta,которая позволяет «выдернуть» любой нужный звук из сложной аудиозаписи по простому запросу:можно текстом описать звук (например,«голос ведущего»,«шум ветра»),указать нужный кусок по времени или даже ткнуть в объект на видео,а модель вернет отдельно чистый целевой звук и остальной фон,что делает очистку аудио,вырезание шумов,вытаскивание вокала или реплик из микса сильно проще обычных плагинов.Потестить тут.Скачать тут.Презентация в комментариях.
🔹 Qwen-Image-Layered.Разбивает сгенерированное изображение на слои.Насколько понял до 10 и более слоев может вытягивать.Хороший инструмент, мне как раз такое было нужно.Потестить тут.Скачать модель тут.Презентация в комментариях.
🔹 Kling Video 2.6.Не новый на рынке,но новый для Kling инструмент.Управления движение на основе видео.Пока с виду все еще как игрушка,но виден большой прогресс от первых моделей,которые были в начале.Презентация в комментариях.
🔹 Reve V1.1- это обновлённая модель для генерации и редактирования изображений,которая лучше понимает текст,аккуратнее работает с референсами и правками и позволяет в одном потоке делать три вещи:с нуля генерировать картинки по промпту,менять уже готовые изображения по текстовому описанию и сочетать несколько референсов в одном результате
🔹 Seedance 1.5.Новая видеомодель от ByteDance,которая по тексту или одной картинке делает короткие кинематографичные ролики с уже синхронизированным звуком:она хорошо понимает сложные промпты,держит стиль и персонажей от начала до конца,умеет подстраивать движение под музыку и речь и сразу выдает готовый контент формата TikTok,который можно почти без правок отправлять в соцсети или использовать в рекламе.Попробовать тут.Пример в комментариях.
🔹 Gemini 3 Flash - это новая быстрая модель от Google,которая по уровню «ума» приблизилась к Pro‑версии,но отвечает заметно быстрее и дешевле,при этом умеет сразу работать с текстом,изображениями,видео,аудио и PDF,разбирать их «на лету» и превращать в понятные планы,объяснения или код,поэтому её сделали моделью по умолчанию в приложении Gemini и для большинства повседневных задач теперь достаточно именно её.Графики в комментариях.
P.S.Аудио версия в комментария.
@VAI_ART
#VAI_News
🔹 Наконец-то вышел GPT Images 1.5 .Многие очень ждали.Писал тут.Это абсолютно новая модель - не как предыдущая, которая была основана на базе Sora.Как обычно,она еще лучше держит промпт,увереннее работает с текстом и деталями,а также наконец-то избавилась от фирменной «желтизны»,с которой все боролись.Но, по факту,модель не лучше новой Banana.
🔹 Wan 2.6.Новая видеомодель Alibaba,заточенная под reference‑to‑video:она берет картинку или видео‑референс и генерирует клипы с тем же персонажем и стилем,держит стабильный дизайн,плавное движение и адекватную сцену,а также поддерживает multi‑shot и липсинк для серийных роликов.Как все знаем Wan открыт и можно это делать у себя на железе или в облаке.Попробовать можно тут.Презентация в комментариях.
🔹 Trellis.2.Новая модель от Microsoft.Модель заметно уступает некоторым закрытым аналогам,но у нее есть большой плюс:она открытая, можно запускать на своем железе или в облаке.По сравнению с первой версией она стала значительно лучше.Попробовать можно тут,а код тут.Презентация - в комментариях.Также,чтобы далеко не ходить,Hunyuan 3D v3 вышел в полноценный релиз - раньше, как оказалось,была только бета.По сути, поправили баги,ускорили обработку, качество почти не изменилось.И да,добавили тарифные планы,что,скорее всего,означает плавный уход от полностью бесплатной модели.
🔹 Вышел Flux.2 [max].Флагманская версия Flux 2 для продакшена.Она дает максимальное качество картинки в линейке,лучше других держит промпт,текст и сложные сцены, аккуратно редактирует уже готовые изображения и поддерживает до 10 референсов в одном запросе.Модель умеет подтягивать актуальную инфу или референсы из веба/документов и строить картинку на их основе,а не фантазировать в вакууме,поэтому результат получается более предсказуемым и привязанным к задаче.
🔹 SAM audio - это новая открытая модель от Meta,которая позволяет «выдернуть» любой нужный звук из сложной аудиозаписи по простому запросу:можно текстом описать звук (например,«голос ведущего»,«шум ветра»),указать нужный кусок по времени или даже ткнуть в объект на видео,а модель вернет отдельно чистый целевой звук и остальной фон,что делает очистку аудио,вырезание шумов,вытаскивание вокала или реплик из микса сильно проще обычных плагинов.Потестить тут.Скачать тут.Презентация в комментариях.
🔹 Qwen-Image-Layered.Разбивает сгенерированное изображение на слои.Насколько понял до 10 и более слоев может вытягивать.Хороший инструмент, мне как раз такое было нужно.Потестить тут.Скачать модель тут.Презентация в комментариях.
🔹 Kling Video 2.6.Не новый на рынке,но новый для Kling инструмент.Управления движение на основе видео.Пока с виду все еще как игрушка,но виден большой прогресс от первых моделей,которые были в начале.Презентация в комментариях.
🔹 Reve V1.1- это обновлённая модель для генерации и редактирования изображений,которая лучше понимает текст,аккуратнее работает с референсами и правками и позволяет в одном потоке делать три вещи:с нуля генерировать картинки по промпту,менять уже готовые изображения по текстовому описанию и сочетать несколько референсов в одном результате
🔹 Seedance 1.5.Новая видеомодель от ByteDance,которая по тексту или одной картинке делает короткие кинематографичные ролики с уже синхронизированным звуком:она хорошо понимает сложные промпты,держит стиль и персонажей от начала до конца,умеет подстраивать движение под музыку и речь и сразу выдает готовый контент формата TikTok,который можно почти без правок отправлять в соцсети или использовать в рекламе.Попробовать тут.Пример в комментариях.
🔹 Gemini 3 Flash - это новая быстрая модель от Google,которая по уровню «ума» приблизилась к Pro‑версии,но отвечает заметно быстрее и дешевле,при этом умеет сразу работать с текстом,изображениями,видео,аудио и PDF,разбирать их «на лету» и превращать в понятные планы,объяснения или код,поэтому её сделали моделью по умолчанию в приложении Gemini и для большинства повседневных задач теперь достаточно именно её.Графики в комментариях.
P.S.Аудио версия в комментария.
@VAI_ART
#VAI_News