B300 или H200?Мы с командой сделали детальный сравнительный анализ. Делюсь, вдруг вы прямо сейчас выбираете железо под свою ИИ-платформу.Начну с того, с чего начинается почти каждый такой разговор: нам нужен сервер, чтобы крутить модель уровня Claude Opus.
И тут приходится притормозить. Модели этого класса на своём железе не запускаются вообще: веса не продаются, доступ только по API. Купить «сервер под Opus» физически нельзя.
Вопрос при этом живой, просто звучать должен иначе. Какое железо нужно, чтобы у себя в контуре поднять крупнейшие открытые модели, которые в 2026 году подошли к этому классу вплотную. GLM 5.2, Qwen. А три дня назад в этот список добавился ещё один игрок, Moonshot AI выложила на Hugging Face полные веса
Kimi K3: 2,8 трлн параметров, крупнейшая открытая модель на сегодня.
По бенчмаркам компании она идёт вровень с флагманами. Открытая модель, которую можно поставить себе в контур, теперь спорит с проприетарным фронтиром. Ещё год назад это звучало бы как сказка.
Полная версия Kimi K3 весит около 1,4 ТБ, и для инференса в базовой точности.
Вот здесь варианты и расходятся:
1️⃣ Сервер на 8 картах B300 несёт около 2,3 ТБ памяти. Модель на 1,4 ТБ влезает целиком, остаётся воздух под миллионный контекст и десятки агентов.
2️⃣ Сервер на 8 картах H200 несёт 1,1 ТБ. В базовой точности не влезает, нужны два сервера. И вот на этом месте я обычно прошу остановиться и подумать ещё раз. Связать два H200 в один инференс это не «докупим второй и соединим кабелем». Это нетривиальная инженерная задача: межузловая сеть, тензорный параллелизм через границу сервера, настройка стека, долгая отладка. Люди, которые умеют такое собирать и держать, стоят дорого, и на рынке их мало. Квантованные 594 ГБ, к слову, помещаются в один H200 свободно, и для многих задач этого достаточно. Но если нужна базовая точность, честно считайте не только железо, но и команду.
3️⃣ Если вы берёте три сервера B300, вы не режете модель на части. В каждом сервере она стоит целиком, а серверы собираются в один кластер и просто делят нагрузку между собой. Разница принципиальная: в случае H200 вы решаете задачу «как разложить одну модель на два узла», а в случае B300 задачу «как распределить очередь запросов». Вторая на порядок проще и в сборке, и в эксплуатации.
4️⃣ Деньги. H200 дешевле на входе, но в пересчёте на гигабайт памяти дороже при нашей нагрузке получится около 40%.
5️⃣ Про охлаждение уточнение, потому что многие до сих пор отказываются от B300 именно из-за него. Жидкость не обязательна. У
Supermicro есть способ воздушного охлаждения.
Так что аргумент «у нас дата-центр не готов к жидкости, значит только H200» сегодня работает не всегда. Уточняйте под свою стойку и своё энергопотребление, прежде чем вычёркивать вариант.
6️⃣ Где H200 честно выигрывает, так это в зрелости. Hopper на рынке несколько лет, стек проверен в проде, сюрпризов минимум. B300 новее, драйверы и библиотеки инференса требуют аккуратной сборки и приёмочного прогона до продуктива.
Итог без инженерных деталей:
✔️ H200 берут, когда модели помещаются в сжатом виде, важна низкая цена входа и максимальная предсказуемость.
✔️ B300 берут, когда нужны крупнейшие модели в базовой точности, скорость агентов и понятный путь роста от одного сервера к кластеру.
Мысль, которую легко потерять за спорами о спецификациях: экономия на входе почти всегда бьёт ровно по тем возможностям, ради которых платформу и строили.
И самое дешёвое вложение в это решение: до подписания закупки прогнать пилот на целевой модели и реальной нагрузке. Скачайте те же квантованные модели, арендуйте карты на день, посмотрите своими глазами. Это стоит несопоставимо меньше, чем неверно выбранный сервер за миллион.
Канал в
MAX.
Всем здоровья, мира и добра! 🕊
#ИИинфраструктура