Кто важнее: эмбеддинг или реранкер?
Хотел выбрать лучшую эмбеддинг-модель для своего IP agent с системой RAG. Прогнал 6 моделей (OpenAI, Voyage, Cohere, e5-small, GigaEmbeddings, Yandex) на 858 актах СИП и 30 юридических вопросах. Итог совершенно другой - выбор эмбеддинга далеко не главное, что решает качество поиска.
Три вывода, к которым пришёл:
1️⃣Реранкер важнее эмбеддинга. Он подтягивает слабые модели к уровню сильных. У Cohere и Yandex реранкер буквально удваивает качество. Если у вас есть приличный реранкер, разница между дорогим API и бесплатной локалкой почти незаметна.
2️⃣Но эмбеддинг решает, что вообще попадёт в корзину кандидатов. Реранкер физически не видит того, что эмбеддинг не нашёл. А у каждой модели свои «слепые пятна».
3️⃣ Гибрид из двух разных эмбеддингов даёт +28 процентных пунктов покрытия корзины. OpenAI вместе с бесплатной e5-small находят 81.7% идеальных дел против 53.7% только OpenAI. Есть неплохая альтернатива - связка GigaEmbeddings + e5-small даёт почти те же значения - 81.3%.
➡️ Подробно описал в Telegraph: методология, метрики (nDCG@5, MRR), bootstrap-проверка на случайность, oracle-анализ гибрида, стоимость и время индексации по каждой модели, честный список ограничений самого теста.
Хотел выбрать лучшую эмбеддинг-модель для своего IP agent с системой RAG. Прогнал 6 моделей (OpenAI, Voyage, Cohere, e5-small, GigaEmbeddings, Yandex) на 858 актах СИП и 30 юридических вопросах. Итог совершенно другой - выбор эмбеддинга далеко не главное, что решает качество поиска.
Три вывода, к которым пришёл:
1️⃣Реранкер важнее эмбеддинга. Он подтягивает слабые модели к уровню сильных. У Cohere и Yandex реранкер буквально удваивает качество. Если у вас есть приличный реранкер, разница между дорогим API и бесплатной локалкой почти незаметна.
2️⃣Но эмбеддинг решает, что вообще попадёт в корзину кандидатов. Реранкер физически не видит того, что эмбеддинг не нашёл. А у каждой модели свои «слепые пятна».
3️⃣ Гибрид из двух разных эмбеддингов даёт +28 процентных пунктов покрытия корзины. OpenAI вместе с бесплатной e5-small находят 81.7% идеальных дел против 53.7% только OpenAI. Есть неплохая альтернатива - связка GigaEmbeddings + e5-small даёт почти те же значения - 81.3%.
➡️ Подробно описал в Telegraph: методология, метрики (nDCG@5, MRR), bootstrap-проверка на случайность, oracle-анализ гибрида, стоимость и время индексации по каждой модели, честный список ограничений самого теста.