О локальном инференсе LLM
Регулярно встречаю блогпосты и призывы инференсить LLM на локальном железе.
Но это всегда имеет ограничения. Одни предлагают квантизировать модели в 1b, другие хитро стримить, третьи советуют брать модели поменьше.
Но квантизация заметно ухудшает качество. Мелкие модели тоже похуже
А "хитрый стриминг"...
Вот увидел я пост на медиуме: "Unbelievable! Run Kimi K3–2.8 Trillion Parameters — on a Single 4GB GPU". Думаю - не верю.
Открываю... "This is not fast. Roughly five minutes per token." - не юзабельно
#llm #ai
Регулярно встречаю блогпосты и призывы инференсить LLM на локальном железе.
Но это всегда имеет ограничения. Одни предлагают квантизировать модели в 1b, другие хитро стримить, третьи советуют брать модели поменьше.
Но квантизация заметно ухудшает качество. Мелкие модели тоже похуже
А "хитрый стриминг"...
Вот увидел я пост на медиуме: "Unbelievable! Run Kimi K3–2.8 Trillion Parameters — on a Single 4GB GPU". Думаю - не верю.
Открываю... "This is not fast. Roughly five minutes per token." - не юзабельно
#llm #ai