TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
from:adam

30 Jul, 12:45

Открыть в Telegram Поделиться Пожаловаться

Цифра ~50% почему-то часто не пугает людей, когда речь про AI-ассистентов. Каждый второй запрос в стену? Ну ок, бывает, докрутим. Это странно, ибо если переложить те же 50% на более классический продукт, который мы все умеем оценивать, отношение будет другим.

К примеру, интернет-магазин, который не создаёт каждый второй заказ, никто «докручивать» не будет — его чинят в ночь, в дождь, вопреки, потому что всем очевидно, что он сломан. Но представим магазин хитрее: заказ создаётся, а дальше то не доставят, то привезут не то или не туда, то спишут другую сумму. При этом снаружи всё может выглядеть как успех с непоколебимым покерфейсом: корзина, чекаут, «спасибо за покупку».

Ассистенты чаще ломаются именно так. Там, где классический софт падает с ошибкой, LLMки отвечают: «подписку отменил», а по факту ничего не отменил, «операция корректна», а она снесла прод-базу. Ровно тот самый идеальный покерфейс, и у пользователя обычно не хватает компетенций отличить правильный ответ от уверенного вранья.

Отсюда и разница в обратной связи. Косячащий магазин закидают жалобами и единицами в отзывах за день: чтобы понять, что привезли не то, экспертиза не нужна. А к ассистенту человек приходит ровно потому, что сам не знает ответа. Отличить хороший результат от плохого ему часто нечем, так что уверенный бред спокойно собирает свои пятёрки, либо собирает негатив с большой задержкой, либо вовсе выглядит как падающий ретеншн.

Откуда тогда спокойствие команд? Моя гипотеза: дело в лёгкости лицезрения. Метрики магазина дешёвые: доля созданных заказов, SLA доставки, возвраты. Собираются за день и орут с дашборда красными огнями. Если даже никто дашборд не построил, то быстро прибежит СЕО и заставит сделать сэппуку. Метрика качества ассистента дорогая, это тот самый бенчмарк и эвалы и нудные месяцы работы. А пока эвалов нет — нет и дашборда, на котором могло бы загореться красное.

А когда мы измеряем что-то, то часто это улучшаем. Если не измеряется, то «вроде работает» будет достаточно. Дешёвая метрика тычет тебя носом в провал, а дорогая разрешает жить в неведении и называть это оптимизмом.

Так что если у команды ассистента нет бенчмарка и эвалов, это не значит, что у неё нет 50% фейлов. Это значит, что она узнает о них последней.

3.5k 0 20 5 45
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot