TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Dealer.AI

27 Feb, 18:17

Открыть в Telegram Поделиться Пожаловаться

Perplexity выпустил свои топовые эмбеддеры на базе Qwen3.

Ребята из известного поискового решения с LLM выдали комьюнити новенькие чекпы эмбеддеров на 0.6B и 4B параметров. Возможно, именно это пригодится вам для решения соревки по RAG выше.

Что сделали интересного? Помимо стандартного подхода к контрастивному обучению в несколько стадий, самое интересное это выравнивание внимания.

Поясню, что это такое. Для начала вспомним, что Qwen у нас декодер, а значит маска внимания казуальная - всегда смотрит назад, от текущего токена, к первому. И относительно этого стейта и вектора предсказывает токен дальше или даёт эмбеддинг фразы. Так вот, тут была куча постов, про то, что все-таки, для задач поиска лучше двустороннее внимание, как у BERT. Проблема там и в размытыии контекста на всю фразу и в том, что в принципе казуальное внимание обслуживает задачу генерации, а не реконструкции/поиска.

И вот за слово реконструкция мы зацепимся. Ведь у нас какой вариант получить biencoder внимание? Поменять маску и дотюнить контрастивно. Это уже все использовали. Ребята пошли дальше и взяли задачу реконструкции пространства вложений для токенов из Text Diffusion. И вместо MLM или контрастивного претрена на двусторонней маске, модель училась восстанавливать замаскированные токены, используя контекст с обеих сторон и операции зашумления/реконструкции. Это позволило получить биэнкодер, способный создавать более насыщенные семантические представления, чем MLM подход от BERT или контрастив претрен.

Училось это все в 4 этапа:
1. Обучение на 250B токенах делать реконструкцию,

2. Далее уже шёл тюн контрастивно на парах запрос-документ, это мы называли ранее контрастив претрен.

3. Чекп с п.2 идёт на обучение с триплетами запрос-документ, где есть зазор, и параллельно учится на чанках документов с функциями ошибок in-batch* и in-sequence*.

*in_batch – это поиск верного чанка из целевого документа против остальных чанков чужих документов, in_sequence – это чанки внутри целевого документа против друг-друга.

4. Далее чекпы с п.3 используют SLERP merging. Это нужно для того, чтобы сохранить свойства как поиска документов, так и поиска чанков внутри документа.

Итого мы получаем модель, заточенную под RAG задачи. При этом выровненную с помощью Text Diffusion подхода. Очень интересная статья. Кстати, вот вам к соревнованию ещё один опус "RAG умер, да здравствует RAG 2026".

Upd. Для ленивых эмбы тут.
SLERP For Model Merging – A Primer
We will now dive deeper in the technique we used in the post called SLERP, which stands for Spherical LinEar inteRPolation and look at some code on how it is implemented.

5.4k 5 187 15 14
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot