TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Миша Карпов — AI, продукты и рост ⛳

30 Jul, 10:36

Открыть в Telegram Поделиться Пожаловаться

🧪📉 eval вместо PRD

классный подход от Daniel McKinnon (ex-PM Llama-моделей в Meta) — "не присылайте мне PRD или описание проблемы: а пришлите eval, это экономит команде кучу работы на парсинг ваших хотелок"

и вот тут у многих начинается ступор

потому что классический способ собрать eval — посмотреть на логи, найти фейлы, разложить по категориям — а на день 0 новой AI-фичи логов нет вообще (данных ноль, юзеров ноль, есть только ваша доменная экспертиза)

он использует следующий подход — "cold-start eval", собирается за один заход:

1) находишь "пол" — самый простой честный кейс, который фича обязана вывозить. прогоняешь на модели. иногда оказывается, что твой "лёгкий" кейс уже выше потолка модели — и ты узнаёшь это на первой неделе, а не после релиза
2) находишь "потолок" — кейс, который точно не решается
звучит странно (зачем тестировать то, что провалится), но фишка что если ты не можешь найти проваливающийся кейс — твой eval уже перенасыщен и особо полезного тебе и не покажет

всё остальное — бинарный поиск между полом и потолком, кейсов 100
да, тут мы используем AI, чтобы собрать тест для AI — но поэтому это занимает 90 минут, а не две недели

☠️ и про то, как читать число в eval
eval выдал 50% — это не приговор и не "шипим / не шипим"
это пойнт про "а на каких срезах мы хороши?" — ставишь guardrails, чтобы продукт отвечал только там, где он попадает в 80%+, а всё что ниже линии — уходит инженерам с конкретным таргетом, а не с нашим ощущением что "качество не очень"

вот это и есть работа продакта в AI: не мотивировать и не считать метрики (это уже делает модель), а выносить суждение о том, что считать правильным ответом

таких людей в мире пока мало 🤷‍♂️ — McKinnon оценивает, что PM-ов, которые реально строят фронтир-модели, меньше сотни (но думаю стоит смотреть на стандарты которые они задают)

📄 детали собрал в раздатку на 7 страниц — 5 готовых промптов на русском (сетап проекта, пол, потолок, генерация середины, судья), чеклист на 90 минут с таймбоксами и каталог из 15 типовых фейлов AI-фич — с колонкой "чем спровоцировать", чтобы было из чего лепить кейсы средней сложности — забирайте в ботике с полезными материалами — вот тут 🛠

1.4k 0 48 1 11
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot