TGStat
TGStat
Type to search
Advanced channel search
  • flag English
    Site language
    flag Russian flag English flag Uzbek
  • Sign In
  • Catalog
    Channels and groups catalog Regional compilations Thematic compilations Платные каналы Search for channels
    Add a channel/group
  • Ratings
    Rating of channels Rating of groups Posts rating
    Ratings of brands and people
  • Analytics
  • Search by posts
  • Telegram monitoring
  • Promotion
    Advertising through Yandex Business Advertising in channels through TGStat Agency Advertising on TGStat.ru website
Concise Research

14 Jul, 13:27

Open in Telegram Share Report

Forward from: ML Underhood
Prev Next
Рассказываем о новой unified-модели в Alice AI

С недавних пор в Алисе AI и Шедевруме появилась обновлённая модель — Alice AI ART 2.0. Пользователи уже сейчас могут протестировать два базовых сценария её работы: Text-to-Image и Image-to-Image.

Для Яндекса этот релиз — первый шаг к тому, чтобы получить unified-модель с едиными метриками и стеком, которая одинаково хорошо умеет и в T2I, и в I2I. Команда генеративных моделей в компьютерном зрении рассказала на Хабре об экспериментах на этом пути, которые сработали и не сработали. Делимся основным.

С чего начали

Стартовали, имея две сущности. С одной стороны, картиночный генератор Alice AI ART 1.0 — свёрточная модель с текстовым энкодером на базе LLM. С другой — редактирование с отдельной базовой моделью и пайплайном инференса. Это разделение было дорогим и приносило много сложностей. Каждое обновление приходилось дважды переносить, данные готовились по-разному, метрики T2I и I2I было тяжело сравнивать между собой, стадии обучения были рассогласованы.

Что хотели от релиза

Цели было две: свести две модели в одну и при этом поднять качество каждой. В T2I целились на рост релевантности и отрисовки текста на картинке. В I2I старались поднять общее качество, но с акцентом на важных для наших пользователях задачах: любые изменения с участием людей и стилизация. Критически важно было, чтобы объединённая модель не уступала по качеству раздельным, а лучше — превосходила их.

Главный герой этого обновления — unified-претрейн

Он включает данные обоих типов: «текст → картинка» и «картинка + инструкция → картинка». Была гипотеза, что общий визуальный и текстовый контекст перетекает между задачами и улучшает качество. Например, концепты (объекты, предметы, действия, стили), выученные на T2I, становятся доступны в I2I без дополнительного сбора данных. И это действительно подтвердилось.

Мы также унифицировали архитектуру, перейдя на single-stream MMDiT с VLM в качестве текстово-картиночного энкодера, и увеличили размер генератора по сравнению с Alice AI ART 1.0. Важным оказалось использовать:

🔴Joint attention — текстовые и визуальные токены идут через общий аттеншн, а не двумя раздельными ветками.
🔴U-RoPE — позиционное кодирование, дружелюбное к разным разрешениям и к конкатенации картинка + текст (что особенно важно для I2I).

Результаты

Alice AI ART 2.0 стала намного более качественной в обеих задачах и по нашим замерам заметно отстаёт только от Gemini 3.1 Flash.

Но главный показатель — это реакция пользователей. Скачивание результатов генерации и редактирования выросло на 37 %, а запросов на генерацию с персонажем стало больше на 23 %.

В обзоре мы пробежались по верхам. В основном посте — подробно об аналитике и замерах, динамике обучений. Есть также таблицы с результатами и рассказ о том что у нас не сработало.

ML Underhood

538 0 2 15
Catalog
Channels and groups catalog Channels compilations Search for channels Add a channel/group
Ratings
Rating of Telegram channels Rating of Telegram groups Posts rating Ratings of brands and people
API
API statistics Search API of posts API Callback
Our channels
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Read
Академия TGStat Telegram Research 2019 Telegram Research 2021 Telegram Research 2023
Contacts
Справочный центр Support Email Jobs
Miscellaneous
Terms and conditions Privacy policy Public offer
Our bots
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot