Посмотрел, куда на самом деле едут деньги в ИИ. Если одной фразой: с «построить» на «эксплуатировать».
2026 — год, когда инференс обогнал обучениеПо прогнозу Gartner, из 42 млрд долларов рынка облачной ИИ-инфраструктуры 23,3 уйдут на инференс и 19 на обучение. Это 55% против 45% и первый год, когда эксплуатация дороже стройки. На 2027 Gartner закладывает уже 59%.
Важная оговорка, иначе цифры не сойдутся. В прессе ходят три разные доли инференса, потому что считают разное: Gartner берёт облачную инфраструктуру и получает 55%, Deloitte — весь ИИ-компьют и около двух третей, а по жизненному циклу одной продакшн-системы выходит 80–90%. Чем ближе к эксплуатации, тем выше доля.
Но ведь обучение несравнимо тяжелееВерно, и это главный вопрос к цифрам выше. Одно обучение модели уровня GPT-4 — это примерно в десять триллионов раз больше вычислений, чем один запрос к ней.
Только это величины разной природы. Обучение — событие: потратил и забыл. Инференс — скорость: расход в секунду, умноженный на всех пользователей и на все годы, что продукт живёт. Сравнивать их напрямую — как сравнивать стоимость постройки дома с квартплатой. Вопрос не в том, что дороже сегодня, а в том, через сколько лет квартплата обгонит стройку.
Для моделей ответ считается одной строчкой: перелом наступает, когда модель сгенерировала втрое больше текста, чем было в её обучающей выборке.
Llama 3 училась на 15 триллионах токенов — это больше ста миллионов книг. Значит, перелом на сорока пяти триллионах сгенерированных. Звучит как бесконечность. А Google обрабатывает около 3 квадриллионов токенов в месяц и проезжает эти сорок пять триллионов примерно за полдня.
Разрыв в десять триллионов раз закрывается за недели. Дальше инференс просто капает — годами.
А где в этом дообучениеЕго нигде не считают отдельной строкой — и это само по себе ответ. Претренят с нуля единицы, у остальных дообучение входит в обучение и на фоне эксплуатации почти не видно. За первые два года жизни продукта инференс обычно обходится в три–десять раз дороже обучения и дообучения вместе взятых.
Отдельный прогон дообучения — да, там 60–70% расходов на обучающей стороне. Но это пока модель готовят, а не работают с ней.
Объём растёт быстрее прогнозовСейчас в мире обрабатывается порядка 11 квадриллионов токенов в месяц — вдвое больше, чем Goldman Sachs прогнозировал в мае этого же года. У бизнеса, по данным Ramp, потребление выросло на 1001% с января 2025 по апрель 2026.
Парадокс, который ломает бюджетыСредняя цена миллиона токенов упала за год с 18,40 до 6,07 доллара — минус две трети. А траты за тот же период выросли на 497%.
Удешевление не экономит деньги. Оно открывает сценарии, которые при старой цене не сходились, и объём съедает всю экономию. Планировать бюджет по логике «подешевеет — будем платить меньше» больше нельзя.
Теперь неприятноеПилоты почти у всех: агентов пробуют от 78 до 97% крупных компаний. Хотя бы одна ИИ-нагрузка в проде — у 78% Global 2000, два года назад было 41%.
Но до продакшена доезжает примерно каждый восьмой пилот агента. Остальные 88% не доживают.
Я писал, что при внедрении агентов недооценивают eval. Вот во что это обходится в процентах.
Сверху — ставка на то, что разрыв закроетсяКапитальные затраты американских гиперскейлеров в 2026 году, по оценке Moody's, превысят 700 млрд долларов — в шесть раз больше, чем в 2022. В третьем квартале капекс впервые перевалит за операционный денежный поток. Доля долга в финансировании выросла с 9% до 32% за полтора года.
Эта конструкция окупается только в одном случае: если адопшн догонит инфраструктуру.
Куда смотретьНе на бенчмарки моделей — они давно перестали что-либо решать на практике. На три числа:
Стоимость инференса на одну полезную задачу — сходится ли экономика у вас.
Доля пилотов, доехавших до прода — умеете ли вы вообще внедрять.
Срок амортизации железа — сколько у индустрии времени до момента, когда за стройку придётся платить.
Первые два вы можете посчитать сами уже на этой неделе.
Источники:
Goldman Sachs ·
Ramp ·
Moody's через DCD#разбор #рынок