Зачем настраивать обратную связь агенту, если фронтиры скоро всё сделают сами?
Спойлер: не сделают 🤡
После Dotnext в отзывах и вопросах поймала одну занятную мысль. Звучит примерно так: «Свет, ну вот эта вся твоя возня с выстраиванием жестких контуров обратной связи, валидацией, линтерами и пайплайнами для агента это же просто костыли под слабые модели. Вон, выкатят условный GPT-106 или Opus 105.5, они сами всё поймут, сами поправят, и харнесс из коробки решит все проблемы. Зачем закапываться в построение методологии обратной связи и приемки кода?»
Слушаю это и прямо умиляюсь вере в кремниевый коммунизм.
Давайте снимем розовые очки. Эта иллюзия «скоро само рассосётся» разбивается ровно о два вопроса из взрослого мира.
⏺️ Вопрос первый. Почему вы решили, что этот банкет бесконечен?
В чьей-то прекрасной реальности фронтирные модели всегда будут стоить три копейки за миллион токенов и отвечать за считанные секунды.
А теперь включим голову и вспомним, как устроен рынок. Почему вам прямо сейчас дают топовые модели за смешные деньги с щедрыми лимитами? Да потому что на любой личной подписке с нас снимают телеметрию и размечают датасеты. Мы тут недорогие подопытные хомячки, которые в реальном времени показывают лабам, как именно люди пишут софт, где агенты спотыкаются, как выглядит процесс дебага ИИ и что может идти не так.
Как только стадия сбора данных и захвата рынка закончится, включится монетизация. И в моей версии реальности умненькие фронтиры, которые делают всё по одному промпту, внезапно станут стоить как чугунный мост. И работать придется на слабых локальных моделях. А им обратная связь еще нужнее чем фронтирам.
⏺️ Вопрос второй. Прекрасный чужой харнесс
«Ну ок, ИИ лабы встроят всю обратную связь в харнессы!»
Допустим. Встроят. А ценник какой будет?
Но даже черт с ними, с деньгами. Вы реально уверены, что универсальный коробочный харнесс от условного Anthropic идеально ляжет на ваш легаси-монолит, ваши самописные шины данных, ваши политики ИБ и специфические кейсы?
Спойлер: не факт. Универсальное решение всегда оптимизировано под сферический энтерпрайз в вакууме. Как только шаг влево будет «ой».
И вот тут у меня некое недоумение.
Мы годами с умным видом копаемся в кишках JIT-компилятора, оптимизируем аллокации памяти, спорим до хрипоты о тонкостях сборщика мусора и знаем, как устроен рантайм до байта. Мы же инженеры! Мы презираем магию!
И эти же самые суровые инженеры внезапно складывают лапки перед нейросеткой: «Ой, ну моделька поумнеет и сама разберется».
Серьёзно? Вы отдаете ядро процесса стохастическому попугаю и надеетесь, что дядя Дарио из Сан-Франциско напишет за вас идеальный harness под вашу архитектуру?
Понимание того, как давать агенту обратную связь, как ограничивать его галлюцинации тестами, статическим анализом и правильной подачей контекста это не «издержки слабых моделей». Это и есть новый инжиниринг.
Если вы не понимаете, как управлять агентом и на каких дешевых сигналах валидировать его результат, вас очень быстро заменят те, кто понимает.
Мозги включать всё ещё надо. Даже если кажется, что кнопка «Сделать шедевр» уже почти готова. 😉