Самый дешевый AI-агент может оказаться самым дорогим
Короче, мы нашли еще один прекрасный способ неправильно измерять эффективность AI: смотреть на стоимость токенов😉
Токены дешевеют?
Отлично, значит и AI становится дешевле!
Ну да. Ну да. Пошли мы нафиг со своей простой математикой.
McKinsey выпустили материал об экономике AI-агентов, и там, как обычно это бывает, супер очевидная мысль, когда ее кто-то озвучил, но нифига не очевидная до этого:
Токены - это не ценность. Токены - это счет, который вам выставляют.
Он (счет) показывает, сколько вы потратили, но вообще не отвечает на вопрос:
А зачем вы это потратили? И самое важно, сделали ли вы это эффективно
Проблема в том, что агент - это уже не один запрос к LLM, потому что агент:
— читает контекст;
— вызывает инструменты;
— пробует разные варианты;
— проверяет результат;
— исправляет результат;
— еще раз проверяет результат;
— иногда решает начать все сначала.
В итоге агентская задача может потреблять примерно в 1000 раз больше токенов, чем обычный чат или единичная задача на рассуждение.
Причем около 60% стоимости может уходить не на создание первого ответа, а на его проверку, исправление и повторную проверку.
Ииии вот тут начинается самое интересное.
Один и тот же агент на одной и той же задаче может пройти совершенно разный путь.
Сегодня сделал пять вызовов инструментов.
Завтра — двадцать.
Поэтому стоимость агента - это не фиксированная цена, а распределение веротяностей. Потому что все в LLM - это распределение вероятностей.
А оценивать его нужно не по стоимости миллиона токенов, а по:
стоимости успешно выполненной задачи.
Агент приносит пользу, когда вероятность его успеха выше, чем:
время проверки результата / время самостоятельного выполнения задачи.
Например:
Человеку нужно два часа, чтобы сделать задачу.
Проверить результат агента можно за шесть минут.
Тогда агенту достаточно успешно выполнять всего 5% задач, чтобы его использование уже имело экономический смысл.
Но только если ошибка ничего не ломает.
Если агент отправил неправильный документ, то вы его удалили.
Если агент пообещал клиенту вернуть деньги за невозвратный билет, теперь у вас есть не только ошибка, но и стоимость ее исправления.
McKinsey называет это agency tax:
стоимость проверки + стоимость переделки + последствия ошибки.
Как итог, недостаточно считать:
— токены;
— запросы;
— стоимость модели;
— количество запущенных агентов.
Нужно считать:
— какой бизнес-результат получил агент;
— сколько стоило успешное выполнение задачи;
— сколько времени человек потратил на проверку;
— сколько стоило исправление ошибок;
— насколько агент улучшил реальную бизнес-метрику.
Иначе через год у вас будет 1000 AI-агентов, огромный счет от провайдера и очень сложный ответ на простой вопрос финансового директора:
«А кто из них вообще приносит пользу?»
И вот новая ценность платформ для инженеров в том, чтобы оптимизировать экономику результата.
Короче, мы нашли еще один прекрасный способ неправильно измерять эффективность AI: смотреть на стоимость токенов😉
Токены дешевеют?
Отлично, значит и AI становится дешевле!
Ну да. Ну да. Пошли мы нафиг со своей простой математикой.
McKinsey выпустили материал об экономике AI-агентов, и там, как обычно это бывает, супер очевидная мысль, когда ее кто-то озвучил, но нифига не очевидная до этого:
Токены - это не ценность. Токены - это счет, который вам выставляют.
Он (счет) показывает, сколько вы потратили, но вообще не отвечает на вопрос:
А зачем вы это потратили? И самое важно, сделали ли вы это эффективно
Проблема в том, что агент - это уже не один запрос к LLM, потому что агент:
— читает контекст;
— вызывает инструменты;
— пробует разные варианты;
— проверяет результат;
— исправляет результат;
— еще раз проверяет результат;
— иногда решает начать все сначала.
В итоге агентская задача может потреблять примерно в 1000 раз больше токенов, чем обычный чат или единичная задача на рассуждение.
Причем около 60% стоимости может уходить не на создание первого ответа, а на его проверку, исправление и повторную проверку.
Ииии вот тут начинается самое интересное.
Один и тот же агент на одной и той же задаче может пройти совершенно разный путь.
Сегодня сделал пять вызовов инструментов.
Завтра — двадцать.
Поэтому стоимость агента - это не фиксированная цена, а распределение веротяностей. Потому что все в LLM - это распределение вероятностей.
А оценивать его нужно не по стоимости миллиона токенов, а по:
стоимости успешно выполненной задачи.
Агент приносит пользу, когда вероятность его успеха выше, чем:
время проверки результата / время самостоятельного выполнения задачи.
Например:
Человеку нужно два часа, чтобы сделать задачу.
Проверить результат агента можно за шесть минут.
Тогда агенту достаточно успешно выполнять всего 5% задач, чтобы его использование уже имело экономический смысл.
Но только если ошибка ничего не ломает.
Если агент отправил неправильный документ, то вы его удалили.
Если агент пообещал клиенту вернуть деньги за невозвратный билет, теперь у вас есть не только ошибка, но и стоимость ее исправления.
McKinsey называет это agency tax:
стоимость проверки + стоимость переделки + последствия ошибки.
Как итог, недостаточно считать:
— токены;
— запросы;
— стоимость модели;
— количество запущенных агентов.
Нужно считать:
— какой бизнес-результат получил агент;
— сколько стоило успешное выполнение задачи;
— сколько времени человек потратил на проверку;
— сколько стоило исправление ошибок;
— насколько агент улучшил реальную бизнес-метрику.
Иначе через год у вас будет 1000 AI-агентов, огромный счет от провайдера и очень сложный ответ на простой вопрос финансового директора:
«А кто из них вообще приносит пользу?»
И вот новая ценность платформ для инженеров в том, чтобы оптимизировать экономику результата.