Входной билет для развёртывания открытых LLM России вырос в 2,8 раза за год
Оценку представили аналитики MWS Cloud, рассчитав стоимость минимального набора серверов, GPU и коммутаторов для запуска моделей и обработки одного тяжёлого запроса.
Всё дело в актуальных моделях: они выросли в размерах и требуют принципиально другого класса ускорителей.
📈 Если летом 2025 года базовый комплект оборудования обходился в среднем в 13,7 млн руб., то к лету 2026 года ценник подскочил до 38,8 млн руб.
⏹️ Год назад ориентирами для запуска выступали Kimi K2, GLM-4.5V, Qwen3 на 235 млрд параметров и отечественная Cotype Pro 2. В 2026 году стандарт задают Qwen3.5 на 397 млрд параметров, линейка DeepSeek-V4 (Pro и Flash), GLM-5.2, Gemma 4 и Cotype Pro 3. Моделям банально нужно больше видеопамяти.
⏹️ Современные LLM требуют удерживать в оперативной памяти огромные хвосты промптов и документов. Даже для инференса одного запроса нужен плотно связанный кластер.
⏹️ В итоговую смету закладывают и скоростные коммутаторы. Чем шире распределена модель по картам, тем жёстче требования к задержкам между ними.
⚡️ Расчёт MWS учитывает строго минимальную конфигурацию под запуск и обработку одного запроса максимальной длины. В эту сумму не входят расходы на резервирование, сетевую фабрику сверх базового коммутатора, киловатты мощности и прецизионное охлаждение высокоплотных стоек.
⭐️ Чтобы развернуть актуальный опенсорсный стек, компании теперь нужен бюджет полноценного инфраструктурного проекта. Машем ручкой инфоцыганам, которые учат запускать LLM на Mac mini с такой же эффективностью, как в облаках.
🕹️ Серверная в Telegram | в MAX
Оценку представили аналитики MWS Cloud, рассчитав стоимость минимального набора серверов, GPU и коммутаторов для запуска моделей и обработки одного тяжёлого запроса.
Всё дело в актуальных моделях: они выросли в размерах и требуют принципиально другого класса ускорителей.
📈 Если летом 2025 года базовый комплект оборудования обходился в среднем в 13,7 млн руб., то к лету 2026 года ценник подскочил до 38,8 млн руб.
⏹️ Год назад ориентирами для запуска выступали Kimi K2, GLM-4.5V, Qwen3 на 235 млрд параметров и отечественная Cotype Pro 2. В 2026 году стандарт задают Qwen3.5 на 397 млрд параметров, линейка DeepSeek-V4 (Pro и Flash), GLM-5.2, Gemma 4 и Cotype Pro 3. Моделям банально нужно больше видеопамяти.
⏹️ Современные LLM требуют удерживать в оперативной памяти огромные хвосты промптов и документов. Даже для инференса одного запроса нужен плотно связанный кластер.
⏹️ В итоговую смету закладывают и скоростные коммутаторы. Чем шире распределена модель по картам, тем жёстче требования к задержкам между ними.
⚡️ Расчёт MWS учитывает строго минимальную конфигурацию под запуск и обработку одного запроса максимальной длины. В эту сумму не входят расходы на резервирование, сетевую фабрику сверх базового коммутатора, киловатты мощности и прецизионное охлаждение высокоплотных стоек.
⭐️ Чтобы развернуть актуальный опенсорсный стек, компании теперь нужен бюджет полноценного инфраструктурного проекта. Машем ручкой инфоцыганам, которые учат запускать LLM на Mac mini с такой же эффективностью, как в облаках.
🕹️ Серверная в Telegram | в MAX