Цифра ~50% почему-то часто не пугает людей, когда речь про AI-ассистентов. Каждый второй запрос в стену? Ну ок, бывает, докрутим. Это странно, ибо если переложить те же 50% на более классический продукт, который мы все умеем оценивать, отношение будет другим.
К примеру, интернет-магазин, который не создаёт каждый второй заказ, никто «докручивать» не будет — его чинят в ночь, в дождь, вопреки, потому что всем очевидно, что он сломан. Но представим магазин хитрее: заказ создаётся, а дальше то не доставят, то привезут не то или не туда, то спишут другую сумму. При этом снаружи всё может выглядеть как успех с непоколебимым покерфейсом: корзина, чекаут, «спасибо за покупку».
Ассистенты чаще ломаются именно так. Там, где классический софт падает с ошибкой, LLMки отвечают: «подписку отменил», а по факту ничего не отменил, «операция корректна», а она снесла прод-базу. Ровно тот самый идеальный покерфейс, и у пользователя обычно не хватает компетенций отличить правильный ответ от уверенного вранья.
Отсюда и разница в обратной связи. Косячащий магазин закидают жалобами и единицами в отзывах за день: чтобы понять, что привезли не то, экспертиза не нужна. А к ассистенту человек приходит ровно потому, что сам не знает ответа. Отличить хороший результат от плохого ему часто нечем, так что уверенный бред спокойно собирает свои пятёрки, либо собирает негатив с большой задержкой, либо вовсе выглядит как падающий ретеншн.
Откуда тогда спокойствие команд? Моя гипотеза: дело в лёгкости лицезрения. Метрики магазина дешёвые: доля созданных заказов, SLA доставки, возвраты. Собираются за день и орут с дашборда красными огнями. Если даже никто дашборд не построил, то быстро прибежит СЕО и заставит сделать сэппуку. Метрика качества ассистента дорогая, это тот самый бенчмарк и эвалы и нудные месяцы работы. А пока эвалов нет — нет и дашборда, на котором могло бы загореться красное.
А когда мы измеряем что-то, то часто это улучшаем. Если не измеряется, то «вроде работает» будет достаточно. Дешёвая метрика тычет тебя носом в провал, а дорогая разрешает жить в неведении и называть это оптимизмом.
Так что если у команды ассистента нет бенчмарка и эвалов, это не значит, что у неё нет 50% фейлов. Это значит, что она узнает о них последней.
К примеру, интернет-магазин, который не создаёт каждый второй заказ, никто «докручивать» не будет — его чинят в ночь, в дождь, вопреки, потому что всем очевидно, что он сломан. Но представим магазин хитрее: заказ создаётся, а дальше то не доставят, то привезут не то или не туда, то спишут другую сумму. При этом снаружи всё может выглядеть как успех с непоколебимым покерфейсом: корзина, чекаут, «спасибо за покупку».
Ассистенты чаще ломаются именно так. Там, где классический софт падает с ошибкой, LLMки отвечают: «подписку отменил», а по факту ничего не отменил, «операция корректна», а она снесла прод-базу. Ровно тот самый идеальный покерфейс, и у пользователя обычно не хватает компетенций отличить правильный ответ от уверенного вранья.
Отсюда и разница в обратной связи. Косячащий магазин закидают жалобами и единицами в отзывах за день: чтобы понять, что привезли не то, экспертиза не нужна. А к ассистенту человек приходит ровно потому, что сам не знает ответа. Отличить хороший результат от плохого ему часто нечем, так что уверенный бред спокойно собирает свои пятёрки, либо собирает негатив с большой задержкой, либо вовсе выглядит как падающий ретеншн.
Откуда тогда спокойствие команд? Моя гипотеза: дело в лёгкости лицезрения. Метрики магазина дешёвые: доля созданных заказов, SLA доставки, возвраты. Собираются за день и орут с дашборда красными огнями. Если даже никто дашборд не построил, то быстро прибежит СЕО и заставит сделать сэппуку. Метрика качества ассистента дорогая, это тот самый бенчмарк и эвалы и нудные месяцы работы. А пока эвалов нет — нет и дашборда, на котором могло бы загореться красное.
А когда мы измеряем что-то, то часто это улучшаем. Если не измеряется, то «вроде работает» будет достаточно. Дешёвая метрика тычет тебя носом в провал, а дорогая разрешает жить в неведении и называть это оптимизмом.
Так что если у команды ассистента нет бенчмарка и эвалов, это не значит, что у неё нет 50% фейлов. Это значит, что она узнает о них последней.