TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Draft AI | Иван Кундиль

23 Apr, 10:10

Открыть в Telegram Поделиться Пожаловаться

Апелляция на собственный бенчмарк: как я искусственно раздул метрики реранкера

Недавно я публиковал бенчмарк эмбеддинг-моделей для юридического RAG и делал в нём крайне убедительные выводы: про реранкер, про эмбеддинги, про гибриды. Как оказалось, часть этих выводов была неверной.

На эту мысль меня подтолкнула Екатерина, отдельное ей спасибо. В методике моего расчета была брешь, которую я не заметил.

Что переделал: разметил 2751 пару (вместо 635) на уровне сырой выдачи, до этапа реранкинга, добавил к тесту еще одну локальную модель - deepvk/USER2-base. Вопросов по-прежнему 30. Что получилось:

〰️Реранкер не даёт значимого прироста. Разница между выдачей "до" и "после" реранкера на моих данных в пределах погрешности, а для некоторых моделей эффект даже отрицательный (видно в таблице). То есть фактически прироста нет. Оговорка: вывод касается только конкретного реранкера, который у меня установлен. С другим реранкером результат может быть совсем иной.

〰️Вывод про гибрид двух эмбеддингов устоял, но стал скромнее. Эффект от объединения двух моделей на честной разметке уменьшился, но остался. Оговорка: это сработает только если найти «нормальный» реранкер, который хорошо сортирует результаты. Без него гибрид расширяет корзину кандидатов, но до пользователя нужные дела всё равно могут не дойти. А существует ли "нормальный" реранкер - я пока не знаю.

〰️ О рейтинге эмбеддингов. На старой разметке все модели после реранкера были статистически неотличимы. К тесту я добавил ещё одну модель, которую часто рекомендуют в юридическом сообществе нейросетей, — deepvk/USER2-base. Значения и рейтинг в таблице к посту. Из рейтинга выделяется топ-3, но в рамках теста разница между этими тремя моделями считается погрешностью (30 вопросов — это небольшая выборка для уверенных выводов). Так что на этой выборке их результаты можно считать равными.

Главная находка - USER2-base. Локальная русская модель от deepvk, бесплатная, при этом по качеству не уступает OpenAI ($2.84 за индексацию моего корпуса) и Voyage ($0.63). Без API, без санкционных рисков.

Полная версия поста с таблицами и детальным разбором.

576 1 10 3 15
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot