2026_07_09_калькулятор_LLM_инференса_filippov_GenAI.xlsx
Сколько на самом деле стоит 1M токенов на своём железе
Сделал калькулятор того, как стоимость своего GPU переходит в себестоимость токенов.
Оказалось, что достаточно нетривиальная задача, тк челленджит все знания об LLM: как работают слои, чем MoE отличается от dense, как устроен KV cache. В общем обновил по пути все свои знания GenAI. Понятно, что куча допущений внутри, а параметры собирал Fable, надо тестировать на реальных серверах, но это может быть отправной точкой.
Что по выводам?
• Строить или покупать — это вопрос утилизации, не технологии. Сможет ли сервис создать высоукую утилизацию сервера и есть ключевой вопрос.
• MoE — скидка на скорость, но не на память. Кол-во активных параметров 3 млрд из 35: карта пишет быстро, но веса лежат целиком. Отсюда контринтуитивный результат: большие MoE модели на дешёвых картах — экономически лучшая пара, пока хватает VRAM.
• ROI-ловушка. 390% годовых и выше работает при УЖЕ НАЙДЕННОМ спросе; поиск клиентов, SLA, биллинг в модели не учтены. Поэтому супер важно обеспечить потребление, а не накупить дорогих игрушек.
Скачивайте, подставляйте свои данные и посмотрите себестоимость. Найдете ошибки - дайте знать)
Илья Филиппов
Сделал калькулятор того, как стоимость своего GPU переходит в себестоимость токенов.
Оказалось, что достаточно нетривиальная задача, тк челленджит все знания об LLM: как работают слои, чем MoE отличается от dense, как устроен KV cache. В общем обновил по пути все свои знания GenAI. Понятно, что куча допущений внутри, а параметры собирал Fable, надо тестировать на реальных серверах, но это может быть отправной точкой.
Что по выводам?
• Строить или покупать — это вопрос утилизации, не технологии. Сможет ли сервис создать высоукую утилизацию сервера и есть ключевой вопрос.
• MoE — скидка на скорость, но не на память. Кол-во активных параметров 3 млрд из 35: карта пишет быстро, но веса лежат целиком. Отсюда контринтуитивный результат: большие MoE модели на дешёвых картах — экономически лучшая пара, пока хватает VRAM.
• ROI-ловушка. 390% годовых и выше работает при УЖЕ НАЙДЕННОМ спросе; поиск клиентов, SLA, биллинг в модели не учтены. Поэтому супер важно обеспечить потребление, а не накупить дорогих игрушек.
Скачивайте, подставляйте свои данные и посмотрите себестоимость. Найдете ошибки - дайте знать)
Илья Филиппов