TGStat
TGStat
Type to search
Advanced channel search
  • flag English
    Site language
    flag Russian flag English flag Uzbek
  • Sign In
  • Catalog
    Channels and groups catalog Regional compilations Thematic compilations Платные каналы Search for channels
    Add a channel/group
  • Ratings
    Rating of channels Rating of groups Posts rating
    Ratings of brands and people
  • Analytics
  • Search by posts
  • Telegram monitoring
  • Promotion
    Advertising through Yandex Business Advertising in channels through TGStat Agency Advertising on TGStat.ru website
Mindventure 🏄‍♂️ Антона Астафурова

21 Jun, 10:23

Open in Telegram Share Report

AI Evals, или почему, когда кажется – креститься недостаточно

Во время своего sick leave я много читал про AI-скиллы для продуктовых менеджеров, и меня заинтересовал один – AI Evals. Вообще у меня есть травма: когда я работал в TikTok, результаты моей работы было сложно оцифровать на 100% и померить импакт (такая специфика позиции и рынка). С тех пор мне важно, чтобы я мог четко сказать, какого конкретно результата достигли изменения, сделанные моей командой.

Когда вы делаете AI-продукт, вам нужно как-то оценивать эффективность того, как он решает задачи пользователей. Где-то это проще (прямая воронка), где-то сложнее (дерево сценариев), но когда юзер сталкивается с чат-интерфейсом и мы переходим во что-то сгенерированное нейросетью, ревью такого продукта уходит на качественно другой уровень.

AI Evals как раз про это. Чтобы не скатываться в субъективное «переписал промпт - вроде стало лучше», берем набор проверочных запросов к вашей AI-системе с заранее известным «правильным» ответом. Берёте несколько реальных сценариев использования, для каждого фиксируете критерий хорошего ответа, прогоняете и считаете процент попаданий.

Почему это важно для продуктовых менеджеров:
- позволяет более уверенно катить изменения;
- сравнивать модели не по ощущениям, а по факту;
- убеждать стейкхолдеров данными.

Пример: AI-ассистент для саппорта. Берёте 40 реальных тикетов, и для каждого пишете критерий: для тикета «как вернуть товар?» таким критерием будет, скажем, «хороший ответ называет срок рефанда и предлагает следующий шаг». Прогоняете через вашу продовую модель (например, Opus 4.8). Дальше просите другую модель, так называемую LLM-as-a-judge (нейронка как судья, оценщик), оценить каждый ответ: «соответствует критериям? да/нет». Метрика: % ответов «да» — допустим, 64%. Далее меняете промпт, прогоняете снова. Стало 77% — катим.

В общем, чуйка чуйкой, но data driven mindset никто не отменял.

Mindventure 🏄‍♂️

101 0 0 6 6
Catalog
Channels and groups catalog Channels compilations Search for channels Add a channel/group
Ratings
Rating of Telegram channels Rating of Telegram groups Posts rating Ratings of brands and people
API
API statistics Search API of posts API Callback
Our channels
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Read
Академия TGStat Telegram Research 2019 Telegram Research 2021 Telegram Research 2023
Contacts
Справочный центр Support Email Jobs
Miscellaneous
Terms and conditions Privacy policy Public offer
Our bots
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot