TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
AVP AI

21 Sep, 10:23

Открыть в Telegram Поделиться Пожаловаться

01:58
Видео недоступно для предпросмотра
Смотреть в Telegram
Сколько стоит развернуть LLM в своём контуре? ⌨️

Когда показываем платформу нефтегазовым компаниям, почти всегда первым делом спрашивают одно и то же. Как поставить всё это у себя, какое железо понадобится и во сколько обойдётся. Данные наружу никто выпускать не хочет, поэтому рано или поздно разговор упирается в сервер.

Самый простой вариант на сегодня – это NVIDIA DGX Spark. Небольшая коробка 15 на 15 см, 128 ГБ общей памяти, обычная розетка и цена $4699 в США. Две такие машины можно соединить напрямую кабелем, без отдельного коммутатора, и получить 256 ГБ памяти под одну модель. Если машин три и больше, уже понадобится коммутатор.

На одном Spark небольшая модель тянет 64 запроса одновременно и печатает суммарно около 483 токенов в секунду. Тяжёлая модель на 284 млрд параметров в одиночный Spark тоже влезает, но если считать по одному запросу, выдаёт всего 21 токен в секунду. Пара Spark разгоняет её до 59 токенов в секунду.


Но тут есть два момента, о которых стоит помнить 🔽

1️⃣Скорость
В свежем тесте ту же Qwen3 Coder 30B сравнили на Spark и на паре RTX 5090. Spark справился с задачей за шесть минут, а две 5090 примерно за минуту. Всё упирается в пропускную способность памяти. 273 ГБ/с против почти двух терабайт у 5090.

2️⃣Качество
Открытая Qwen3 Coder 30B набирает около 48% на SWE bench Verified. Для сравнения, Claude Sonnet 4.6 показывает 79,6%, а Opus 4.6 около 81%. Разница почти в два раза, и добавлением железа её не исправить.


➡️ За $5–10 тыс. уже можно собрать вполне рабочий стенд, чтобы обкатать агентную систему на своих данных и понять, что вообще имеет смысл переносить внутрь компании. А вот под серьёзную промышленную нагрузку понадобится полноценная серверная инфраструктура.

И ещё важно: если нужна максимальная точность и качество, закрытые модели пока остаются заметно впереди.

Видео: techwithray

🌐 Website | 🎰LinkedIn

140 0 3 11
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot