🔥 30B-модель ужали до 2 бит и заставили 10 минут подряд работать как агент на 22 ГБ VRAM
Unsloth прогнала NVIDIA Nemotron 3.5 Lightning 30B-A3B в 2-bit GGUF на одной машине с 22 ГБ видеопамяти.
За один непрерывный запуск агент успел сослаться более чем на 80 сайтов, выполнить код, использовать инструменты и найти 10 реальных локаций.
И всё это без серверной фермы.
Nemotron здесь особенно удобен из-за MoE-архитектуры: из 30B параметров на токен активно только около 3B. А агрессивное 2-bit квантование позволяет уместить модель в VRAM, которая ещё недавно казалась слишком маленькой для такого класса LLM.
Запускать и дообучать её можно через Unsloth Desktop.
GGUF:
https://huggingface.co/unsloth/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF
Гайд:
https://unsloth.ai/docs/models/nemotron-3.5
Локальные агенты постепенно перестают означать «маленькая модель с кучей компромиссов».
Теперь вопрос всё чаще в том, насколько далеко можно ужать frontier-like модель, сохранив нормальный tool use.
#AI #NVIDIA #Nemotron #LocalAI #Unsloth
Unsloth прогнала NVIDIA Nemotron 3.5 Lightning 30B-A3B в 2-bit GGUF на одной машине с 22 ГБ видеопамяти.
За один непрерывный запуск агент успел сослаться более чем на 80 сайтов, выполнить код, использовать инструменты и найти 10 реальных локаций.
И всё это без серверной фермы.
Nemotron здесь особенно удобен из-за MoE-архитектуры: из 30B параметров на токен активно только около 3B. А агрессивное 2-bit квантование позволяет уместить модель в VRAM, которая ещё недавно казалась слишком маленькой для такого класса LLM.
Запускать и дообучать её можно через Unsloth Desktop.
GGUF:
https://huggingface.co/unsloth/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF
Гайд:
https://unsloth.ai/docs/models/nemotron-3.5
Локальные агенты постепенно перестают означать «маленькая модель с кучей компромиссов».
Теперь вопрос всё чаще в том, насколько далеко можно ужать frontier-like модель, сохранив нормальный tool use.
#AI #NVIDIA #Nemotron #LocalAI #Unsloth