🧪📉 eval вместо PRD
классный подход от Daniel McKinnon (ex-PM Llama-моделей в Meta) — "не присылайте мне PRD или описание проблемы: а пришлите eval, это экономит команде кучу работы на парсинг ваших хотелок"
и вот тут у многих начинается ступор
потому что классический способ собрать eval — посмотреть на логи, найти фейлы, разложить по категориям — а на день 0 новой AI-фичи логов нет вообще (данных ноль, юзеров ноль, есть только ваша доменная экспертиза)
он использует следующий подход — "cold-start eval", собирается за один заход:
1) находишь "пол" — самый простой честный кейс, который фича обязана вывозить. прогоняешь на модели. иногда оказывается, что твой "лёгкий" кейс уже выше потолка модели — и ты узнаёшь это на первой неделе, а не после релиза
2) находишь "потолок" — кейс, который точно не решается
звучит странно (зачем тестировать то, что провалится), но фишка что если ты не можешь найти проваливающийся кейс — твой eval уже перенасыщен и особо полезного тебе и не покажет
всё остальное — бинарный поиск между полом и потолком, кейсов 100
да, тут мы используем AI, чтобы собрать тест для AI — но поэтому это занимает 90 минут, а не две недели
☠️ и про то, как читать число в eval
eval выдал 50% — это не приговор и не "шипим / не шипим"
это пойнт про "а на каких срезах мы хороши?" — ставишь guardrails, чтобы продукт отвечал только там, где он попадает в 80%+, а всё что ниже линии — уходит инженерам с конкретным таргетом, а не с нашим ощущением что "качество не очень"
вот это и есть работа продакта в AI: не мотивировать и не считать метрики (это уже делает модель), а выносить суждение о том, что считать правильным ответом
таких людей в мире пока мало 🤷♂️ — McKinnon оценивает, что PM-ов, которые реально строят фронтир-модели, меньше сотни (но думаю стоит смотреть на стандарты которые они задают)
📄 детали собрал в раздатку на 7 страниц — 5 готовых промптов на русском (сетап проекта, пол, потолок, генерация середины, судья), чеклист на 90 минут с таймбоксами и каталог из 15 типовых фейлов AI-фич — с колонкой "чем спровоцировать", чтобы было из чего лепить кейсы средней сложности — забирайте в ботике с полезными материалами — вот тут 🛠
классный подход от Daniel McKinnon (ex-PM Llama-моделей в Meta) — "не присылайте мне PRD или описание проблемы: а пришлите eval, это экономит команде кучу работы на парсинг ваших хотелок"
и вот тут у многих начинается ступор
потому что классический способ собрать eval — посмотреть на логи, найти фейлы, разложить по категориям — а на день 0 новой AI-фичи логов нет вообще (данных ноль, юзеров ноль, есть только ваша доменная экспертиза)
он использует следующий подход — "cold-start eval", собирается за один заход:
1) находишь "пол" — самый простой честный кейс, который фича обязана вывозить. прогоняешь на модели. иногда оказывается, что твой "лёгкий" кейс уже выше потолка модели — и ты узнаёшь это на первой неделе, а не после релиза
2) находишь "потолок" — кейс, который точно не решается
звучит странно (зачем тестировать то, что провалится), но фишка что если ты не можешь найти проваливающийся кейс — твой eval уже перенасыщен и особо полезного тебе и не покажет
всё остальное — бинарный поиск между полом и потолком, кейсов 100
да, тут мы используем AI, чтобы собрать тест для AI — но поэтому это занимает 90 минут, а не две недели
☠️ и про то, как читать число в eval
eval выдал 50% — это не приговор и не "шипим / не шипим"
это пойнт про "а на каких срезах мы хороши?" — ставишь guardrails, чтобы продукт отвечал только там, где он попадает в 80%+, а всё что ниже линии — уходит инженерам с конкретным таргетом, а не с нашим ощущением что "качество не очень"
вот это и есть работа продакта в AI: не мотивировать и не считать метрики (это уже делает модель), а выносить суждение о том, что считать правильным ответом
таких людей в мире пока мало 🤷♂️ — McKinnon оценивает, что PM-ов, которые реально строят фронтир-модели, меньше сотни (но думаю стоит смотреть на стандарты которые они задают)
📄 детали собрал в раздатку на 7 страниц — 5 готовых промптов на русском (сетап проекта, пол, потолок, генерация середины, судья), чеклист на 90 минут с таймбоксами и каталог из 15 типовых фейлов AI-фич — с колонкой "чем спровоцировать", чтобы было из чего лепить кейсы средней сложности — забирайте в ботике с полезными материалами — вот тут 🛠