Вы будете смеяться, но у нас новый генератор картинок и новый генератор видео.Метачка представила Muse Image и Muse Video – генераторы с рассуждением, поиском и нативным звуком
Это первые модели генерации, созданные подразделением Meta Superintelligence Labs. Главная ставка сделана не только на качество картинки, но и на «агентный» подход: перед генерацией система может обдумать запрос, обратиться к интернету, написать и выполнить код, найти визуальные референсы, а затем самостоятельно исправить результат.
Сразу про доступ:
Muse Image уже доступна в приложении и на сайте Meta AI, в Instagram Stories в США и в WhatsApp в ограниченном числе стран. Позже модель появится в Facebook, Messenger и рекламной системе Advantage+ Creative.
Сколько стоит генерация (непонятно совсем):
Базовая генерация Muse Image в Meta AI заявлена как
бесплатная для повседневного использования. После достижения бесплатных лимитов Метачка предлагает переходить на платные планы Meta One.
*
Meta One Plus – $7,99 в месяц;
*
Meta One Premium – $19,99 в месяц.
Premium предоставляет больше вычислительной мощности, более высокие лимиты на сложные запросы и расширенные возможности генерации изображений и видео.
При этом Метачка
не опубликовала количество кредитов в каждом тарифе и не сообщила стоимость одной генерации в кредитах. Неизвестно, одинаково ли списываются кредиты за создание картинки, редактирование, использование нескольких референсов и дополнительные циклы самокоррекции. Цена на Muse Video также не раскрыта.
Теперь для гиков.
В отличие от обычной схемы «промпт – изображение», Muse Image работает совместно с мультимодальной моделью
Muse Spark. Spark анализирует запрос и составляет план, а Muse Image занимается визуальной частью. Обе модели могут совместно использовать инструменты и распределять между собой этапы выполнения задачи.
Muse Image получила два интересных инструмента:
Поиск в интернете. Модель может искать свежую информацию и визуальные референсы. Это должно уменьшить количество ошибок при генерации реальных мест, актуальных событий, известных объектов и информационной графики.
Исполнение кода. Во время обучения с подкреплением модель научили писать и запускать код для построения графиков, схем и работающих QR-кодов. Полученный программным способом результат затем используется как условие для финальной генерации. В связке с Muse Spark система также способна создавать анимированные GIF, страницы с изображениями и простые интерактивные игры.
Второе важное отличие –
самокоррекция. После первой генерации Muse Image может проанализировать картинку, локально исправить неправильную деталь, полностью пересобрать изображение или сменить подход и подключить дополнительные инструменты. Метачка утверждает, что такое поведение не прописывали вручную: оно сформировалось во время RL-обучения, потому что самостоятельные исправления повышали итоговую оценку модели.
Редактирование и работа с рефами
Muse Image поддерживает генерацию по тексту, редактирование и многократные последовательные правки в одном диалоге. Пользователь может обвести или зарисовать область на фотографии и текстом объяснить, что нужно удалить, заменить или дорисовать.
Модель также умеет пользовать рефы. В Meta AI разрешено упоминать аккаунты инсты через
@username – тогда система получает возможность использовать публичные фотографии соответствующего профиля для генерации.
Параметры модели
Нет НИЧЕГО. Ни разрешений ни длительностей.
Muse Video пока не запущена публично.
По бенчами Muse Image занимала второе место в рейтингах Arena сразу по трём категориям:
* генерация изображения по тексту;
* редактирование одной картинки;
* редактирование с несколькими изображениями.
Muse Video находилась на третьем месте в Arena среди моделей text-to-video.
Мое диванное мнение такое: Метачка отчаянно тормозит на рынке генераторов контента, но пытается очень плотно встроить их во все свои продукты, чтобы пользователи не ходили налево.
@cgevent