На каком железе лучше развернуть локальную модельку
Помните полугодовой давности хайп на Mac Mini, которые скупали под OpenClaw и прочих агентов, чтобы крутились локально 24 на 7.
Сейчас такое железо актуально для локальных моделек: за запросы платить не надо, данные никуда не уезжают.
И решил задаться вопросом: сколько стоило бы посадить на своё железо не одного агента, а всю офисную рутину? Вот, что удалось накопать.
Зачем это вообще вам. Тут две разные истории.
Первая - фрилансеры и соло. Вопрос чисто в деньгах: маленькая моделька работает бесплатно и круглосуточно. Первая линия клиентской поддержки, обработка большого массива данных, разметка тысячи карточек. Облако за такие объёмы выставит счёт, свое железо - нет))
Вторая - бизнес и чувствительные данные. Бухгалтерия, договоры, юридические документы, внутренние регламенты. Всё остаётся внутри вашего контура и не уезжает в ChatGPT или Claude. Плюс модель можно зафайнтюнить на своих документах, чтобы она знала ваши правила и говорила вашим языком.
Общее для обоих: вас не выключит блокировка, бан аккаунта или непринятая карта.
Как это работает
Покупаете компьютер, ставите бесплатную модель, она живёт чисто на вашем устройстве. Интернет ей не нужен, платите один раз за железо. Скорость упирается не в процессор, а в скорость памяти: модель перечитывается целиком на каждое слово.
Но сначала чуть реальности
В конце июля Moonshot выложили веса Kimi K3. 2,8 триллиона параметров, контекст на миллион токенов, первое место среди открытых моделей. Качай кто хочет.
Только полные веса занимают 1,56 ТБ. Самая ужатая однобитная версия - 594 ГБ, ей нужно 610 ГБ памяти. Mac Studio даже на 512 ГБ её не открывает. Нужен кластер из восьми H100.
Так что локально вы запускаете не топовую модель, а ту, которая влезла. Это нормально, если знать её потолок.
Цены проверял Клод😅 Модели - при сжатии Q4.
RTX 3090, 24 ГБ. Новая от 135 000 ₽, б/у около 70 000. Тянет Qwen3.6 27B (16 ГБ), Gemma 4 26B (15 ГБ), gpt-oss-20b. Хватает на разбор договора, сводку часового звонка, ответы поддержки по вашей базе, черновики коммерческих. Две б/ушные карты - 140 000 ₽, 48 ГБ и модель на 70B. Самый дешёвый серьёзный вход, если есть кто-то с руками.
RTX 5090, 32 ГБ. 380 000-620 000 ₽. Лучшая скорость за деньги, но нужен человек, который дружит с Linux.
Mac Mini M4 Pro, 64 ГБ - около 240 000 ₽. 70B влезает впритык, часть памяти система забирает под себя.
Mac Studio M4 Max, 128 ГБ - 366 890 ₽. Самая быстрая память в потребительском сегменте, 546 ГБ/с. Бесшумный, включил и поехал, ни драйверов, ни Linux. Тянет Qwen3 Coder Next 80B (46 ГБ) с контекстом 256 тысяч токенов: агенты, код, пачка документов за раз.
Прикинуть любую модель можно самому: при Q4 нужно 0,5-0,6 ГБ памяти на миллиард параметров и 20-30% на контекст.
Все вышеперечисленные модели не для жесткого кодинга, а для простых задач и больших объемов, тогда это будет окупаться. Если задачи нужны сложные - то стоимость оборудования растет по экспоненте
Нюанс, который стоит знать до запуска
Модель запускает отдельная программа, и разница между ними огромная.
- vLLM написан для дата-центров, где в модель стучатся сотни людей. Чтобы разгоняться, ему нужен запас свободной памяти на видеокарте. Модель заняла почти всю карту - запаса нет, и vLLM молча уходит в самый медленный режим. Вы об этом даже не узнаете.
- llama.cpp сделан под одну-две обычные карты и такого запаса не просит.
Одно железо, одна модель, разные программы: 19 слов в секунду против 120.
Что делать после покупки
1. Посчитайте объём: сколько операций в месяц и каких. Иначе промахнётесь.
2. Поставьте LM Studio. Это тот же llama.cpp, только с кнопками и без терминала. На Mac там включается MLX, режим под Apple.
3. Скачайте модель из каталога внутри приложения. Начните с маленькой.
4. Прогоните свои задачи, а не бенчмарки. Двадцать реальных писем, сравните с облаком.
5. Включите локальный сервер, это галочка в настройках. После неё бот, n8n или CRM подключаются к своей модели заменой одной строки.
6. Сложное оставьте облаку.
Открытые модели идут вплотную за Sonnet, но на длинных задачах сыпятся: зацикливаются, придумывают, теряют нить. Пропорция - 80% рутины у себя, 20% сложного наружу.
Кто уже сидит на своём железе? Какую модель гоняете? Накидайте в комментарии ⚡️