TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
AGI Boardroom | Никита Худов

24 Sep, 22:39

Открыть в Telegram Поделиться Пожаловаться

Собрал свой AI бенмчарк из 3000+ вопросов по вину и сравнил разные LLM по уровню винных знаний

Еще немного контента про мой проект Vinum ex Machina, который изучает потенциал AI в винной сфере. Сегодня расскажу про OenoBench — винный AI бенчмарк, с которого в целом этот проект и начался. Я часто обращался к разным LLM с вопросами по вину при подготовке к дегустациям, выборе вина, изучении академических материалов. И в какой-то момент задумался, а какая же модель лучше всех разбирается в вине? Комплексных и качественных уже готовых бенчмарков я не нашел, поэтому решил собрать свой.

Что было сделано:
- Сбор достоверных фактов. Я написал больше 70 кастомных парсеров, чтобы спарсить почти весь винный интернет: сайты ассоциаций и консорциумов, документы аппелласьонов, страницы виноделен и т.д. Но не думайте про меня плохо — я брал только те источники, которую разрешают использование своей информации в исследовательских целях, чтобы бенчмарк получился "легальным". На базе всех этих источников я собрал 50к+ атомарных фактов, которые мы уверенно можем считать истиной, по 6 винным сферам: виноградарство, виноделие, винный бизнес, винные регионы, сорта винограда, производители вина.
- Формирование датасета вопросов. Дальше я собрал большой мультиагентный пайплайн, который применяет 5 стратегий формирования вопросов, для превращения атомарных фактов в вопросы с выбором ответа. Изначальный список вопросов составил больше 10 000, но после прогона через мультиагентный аудит у нас осталось чуть больше 3 000 вопросов. Подробнее этот технический процесс описан в препринте.
- Оценка моделей. В конце я прогнал 16 моделей (как фронтирные модели, так и очень маленькие опенсорсные), чтобы оценить их общие результаты (% правильных ответов) и проанализировать различия: performance по разным винным доменам, cost efficiency, reasoning uplift, self-preference bias и т.д. Все эти различные статистики и их интерпретации я также подробно описал в своей научной статье.

Несколько интересных выводов:
- Высокие результаты моделей. Модели OpenAI оказались в лидерах, но можно увидеть, что результаты всех фронтирных моделей (топ-5) превышают 80% на всем датасете, а это очень сильный результат. Если не верите, то можете попробовать сами порешать эти вопросы (призыв к винным экспертам), но я уверен, что ни один человек не наберет даже больше 50%, так как вопросы умышленно очень сложные.
- Небольшое отставание open-source. Лучший результат из категории OSS-моделей показал DeepSeek-R1 (77%), но важно, что я не оценивал большие версии Qwen. Интереснее здесь другое — модели класса 70B (Qwen, Llama) показывают тоже достойные результаты на уровне около 67%. Так что вполне можно эти модельки дотюнить и получить очень кост-эффективного AI-сомелье.
- Wine business оказался слабой темой. Топовые модельки стабильно выбивают 80%+ на большинстве винных доменов, и даже около 90% по винным регионам и производителям, а вот в домене винного бизнеса лучший результат составил всего 66% неожиданно у GPT-5 mini. Это интересная аномалия, которую еще предстоит поисследовать.

Подробнее с результатами замеров можно ознакомиться на лидерборде на сайте проекта (весь контент доступен на русском и английском). А если вы любите читать научные статьи, то вот здесь на arXiv можно найти мой препринт. А вот здесь на Hugging Face я выложил весь датасет с вопросами-ответами. Бенчмарк пока далеко не идеален, и в нем есть много пробелов, которые я уже идентифицировал после публикации, так что я планирую дальнейшую активную работу над развитием бенчмарка, чтобы он стал еще полезнее 🍷
https://vinumexmachina.com/benchmarks/oenobench/

361 0 4 1 5
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot