Perplexity выпустил свои топовые эмбеддеры на базе Qwen3.
Ребята из известного поискового решения с LLM выдали комьюнити новенькие чекпы эмбеддеров на 0.6B и 4B параметров. Возможно, именно это пригодится вам для решения соревки по RAG выше.
Что сделали интересного? Помимо стандартного подхода к контрастивному обучению в несколько стадий, самое интересное это выравнивание внимания.
Поясню, что это такое. Для начала вспомним, что Qwen у нас декодер, а значит маска внимания казуальная - всегда смотрит назад, от текущего токена, к первому. И относительно этого стейта и вектора предсказывает токен дальше или даёт эмбеддинг фразы. Так вот, тут была куча постов, про то, что все-таки, для задач поиска лучше двустороннее внимание, как у BERT. Проблема там и в размытыии контекста на всю фразу и в том, что в принципе казуальное внимание обслуживает задачу генерации, а не реконструкции/поиска.
И вот за слово реконструкция мы зацепимся. Ведь у нас какой вариант получить biencoder внимание? Поменять маску и дотюнить контрастивно. Это уже все использовали. Ребята пошли дальше и взяли задачу реконструкции пространства вложений для токенов из Text Diffusion. И вместо MLM или контрастивного претрена на двусторонней маске, модель училась восстанавливать замаскированные токены, используя контекст с обеих сторон и операции зашумления/реконструкции. Это позволило получить биэнкодер, способный создавать более насыщенные семантические представления, чем MLM подход от BERT или контрастив претрен.
Училось это все в 4 этапа:
1. Обучение на 250B токенах делать реконструкцию,
2. Далее уже шёл тюн контрастивно на парах запрос-документ, это мы называли ранее контрастив претрен.
3. Чекп с п.2 идёт на обучение с триплетами запрос-документ, где есть зазор, и параллельно учится на чанках документов с функциями ошибок in-batch* и in-sequence*.
*in_batch – это поиск верного чанка из целевого документа против остальных чанков чужих документов, in_sequence – это чанки внутри целевого документа против друг-друга.
4. Далее чекпы с п.3 используют SLERP merging. Это нужно для того, чтобы сохранить свойства как поиска документов, так и поиска чанков внутри документа.
Итого мы получаем модель, заточенную под RAG задачи. При этом выровненную с помощью Text Diffusion подхода. Очень интересная статья. Кстати, вот вам к соревнованию ещё один опус "RAG умер, да здравствует RAG 2026".
Upd. Для ленивых эмбы тут.
Ребята из известного поискового решения с LLM выдали комьюнити новенькие чекпы эмбеддеров на 0.6B и 4B параметров. Возможно, именно это пригодится вам для решения соревки по RAG выше.
Что сделали интересного? Помимо стандартного подхода к контрастивному обучению в несколько стадий, самое интересное это выравнивание внимания.
Поясню, что это такое. Для начала вспомним, что Qwen у нас декодер, а значит маска внимания казуальная - всегда смотрит назад, от текущего токена, к первому. И относительно этого стейта и вектора предсказывает токен дальше или даёт эмбеддинг фразы. Так вот, тут была куча постов, про то, что все-таки, для задач поиска лучше двустороннее внимание, как у BERT. Проблема там и в размытыии контекста на всю фразу и в том, что в принципе казуальное внимание обслуживает задачу генерации, а не реконструкции/поиска.
И вот за слово реконструкция мы зацепимся. Ведь у нас какой вариант получить biencoder внимание? Поменять маску и дотюнить контрастивно. Это уже все использовали. Ребята пошли дальше и взяли задачу реконструкции пространства вложений для токенов из Text Diffusion. И вместо MLM или контрастивного претрена на двусторонней маске, модель училась восстанавливать замаскированные токены, используя контекст с обеих сторон и операции зашумления/реконструкции. Это позволило получить биэнкодер, способный создавать более насыщенные семантические представления, чем MLM подход от BERT или контрастив претрен.
Училось это все в 4 этапа:
1. Обучение на 250B токенах делать реконструкцию,
2. Далее уже шёл тюн контрастивно на парах запрос-документ, это мы называли ранее контрастив претрен.
3. Чекп с п.2 идёт на обучение с триплетами запрос-документ, где есть зазор, и параллельно учится на чанках документов с функциями ошибок in-batch* и in-sequence*.
*in_batch – это поиск верного чанка из целевого документа против остальных чанков чужих документов, in_sequence – это чанки внутри целевого документа против друг-друга.
4. Далее чекпы с п.3 используют SLERP merging. Это нужно для того, чтобы сохранить свойства как поиска документов, так и поиска чанков внутри документа.
Итого мы получаем модель, заточенную под RAG задачи. При этом выровненную с помощью Text Diffusion подхода. Очень интересная статья. Кстати, вот вам к соревнованию ещё один опус "RAG умер, да здравствует RAG 2026".
Upd. Для ленивых эмбы тут.