Саппорт-агент на LLM, который не забудет сходить за заказом
Один разработчик собрал агента поддержки на LLM и выкатил разбор. Первая версия — обычный агентский цикл: пусть модель сама решает, когда дёргать тул. Итог предсказуем — в каждом третьем ходу она за заказом не шла, а просто выдумывала статус.
В харнессе всё наоборот: модель ничего не решает. За данными идёт код, а модель зовут всего дважды — понять, что за вопрос, и составить ответ.
Цифры показательные:
— агентский цикл собирается за вечер, но теряет тул в 1 ходу из 24
— конвейер для прода не теряет ни разу, зато роутер и сценарии пишутся руками
— тысяча диалогов на Qwen — полбакса, на Opus — тридцатка
Вывод простой: где нужна надёжность, детерминированный пайплайн бьёт «умную» автономию модели.
#LLM #Qwen #агенты
Один разработчик собрал агента поддержки на LLM и выкатил разбор. Первая версия — обычный агентский цикл: пусть модель сама решает, когда дёргать тул. Итог предсказуем — в каждом третьем ходу она за заказом не шла, а просто выдумывала статус.
В харнессе всё наоборот: модель ничего не решает. За данными идёт код, а модель зовут всего дважды — понять, что за вопрос, и составить ответ.
Цифры показательные:
— агентский цикл собирается за вечер, но теряет тул в 1 ходу из 24
— конвейер для прода не теряет ни разу, зато роутер и сценарии пишутся руками
— тысяча диалогов на Qwen — полбакса, на Opus — тридцатка
Вывод простой: где нужна надёжность, детерминированный пайплайн бьёт «умную» автономию модели.
#LLM #Qwen #агенты