Когда вы спрашиваете агента «ты уверен?», вы его не проверяете. Вы получаете второй ответ той же модели, и звучит он так же уверенно, как первый.
Есть, впрочем, место, где этот приём работает. Мэдди Риз год назад не писала кода вообще: отец показал ей Lovable, с этого началось.
Сейчас у неё на столе термопринтер на Raspberry Pi — любой человек в мире заходит на её страницу, пишет сообщение, и оно печатается на чековой ленте. Ещё есть пейджер с событиями твиттер-аккаунта и личный API с её заказом кофе.
Про код она говорит прямо: до конца не понимает. Сравнивает с испанским, который, вырастая в Сан-Диего, понимаешь на слух, но сам не говоришь.
Проверять ей поэтому нечем, кроме вопросов к самому агенту. Ты уверен, что это правильно. Перепроверь. Убедись, что это согласуется с тем, что мы делаем.
Отдельным шагом она выясняет, кто вообще ошибся — она сама или он.
И на железе это сработало: перед покупкой она перепроверяет рекомендацию по два-три раза, и агент несколько раз ошибался — обычно советовал не те провода. Её слова:
Сработало не потому, что она нашла правильную формулировку. Сработало потому, что ответ было с чем сверить: с описанием товара, с разъёмом на плате, с ценой. Провода видно глазами.
В коде сверять не с чем. Там тот же вопрос возвращает не проверку, а вторую генерацию.
Что сделать сегодня. Возьмите место, где вы спрашиваете агента «точно?», и назовите внешний источник, которым проверяется ответ: тест, типы, лог, счёт, живой человек. Не называется ни один — у вас не проверка, а ритуал.
Честности ради, масштаб у Мэдди игрушечный: принтер, пейджер, личный API, ничего похожего на прод. Пейджер во время записи так и не сработал — она предупреждала, что связь у него рваная.
https://www.youtube.com/watch?v=KCGKb3huDsY
Чем вы проверяете ответ агента, кроме самого агента?
Есть, впрочем, место, где этот приём работает. Мэдди Риз год назад не писала кода вообще: отец показал ей Lovable, с этого началось.
Сейчас у неё на столе термопринтер на Raspberry Pi — любой человек в мире заходит на её страницу, пишет сообщение, и оно печатается на чековой ленте. Ещё есть пейджер с событиями твиттер-аккаунта и личный API с её заказом кофе.
Про код она говорит прямо: до конца не понимает. Сравнивает с испанским, который, вырастая в Сан-Диего, понимаешь на слух, но сам не говоришь.
Проверять ей поэтому нечем, кроме вопросов к самому агенту. Ты уверен, что это правильно. Перепроверь. Убедись, что это согласуется с тем, что мы делаем.
Отдельным шагом она выясняет, кто вообще ошибся — она сама или он.
И на железе это сработало: перед покупкой она перепроверяет рекомендацию по два-три раза, и агент несколько раз ошибался — обычно советовал не те провода. Её слова:
Несколько раз, но я всегда это ловила.
Сработало не потому, что она нашла правильную формулировку. Сработало потому, что ответ было с чем сверить: с описанием товара, с разъёмом на плате, с ценой. Провода видно глазами.
В коде сверять не с чем. Там тот же вопрос возвращает не проверку, а вторую генерацию.
Что сделать сегодня. Возьмите место, где вы спрашиваете агента «точно?», и назовите внешний источник, которым проверяется ответ: тест, типы, лог, счёт, живой человек. Не называется ни один — у вас не проверка, а ритуал.
Честности ради, масштаб у Мэдди игрушечный: принтер, пейджер, личный API, ничего похожего на прод. Пейджер во время записи так и не сработал — она предупреждала, что связь у него рваная.
https://www.youtube.com/watch?v=KCGKb3huDsY
Чем вы проверяете ответ агента, кроме самого агента?