Репост из: Русский ИТ бизнес
Видео недоступно для предпросмотра
Смотреть в Telegram
Qwen3.8-27B теперь работает со скоростью 70 токенов/с прямо на ноутбуке.
Вышел DFlash 2 — новое поколение спекулятивного декодирования на основе блочной диффузии.
DFlash 2 разгоняет Qwen3.8-27B до 70 токенов/с на MacBook Pro с M5 Max. Ускорение авторегрессионного декодирования достигает 4,6 раза, а итоговый вывод остаётся полностью идентичным исходной модели — буквально ни одного отличающегося токена. Уже доступны новые черновые модели для Qwen3.8-27B с нативной поддержкой SGLang, vLLM, llama.cpp и oMLX.
Суть подхода: https://inco.ai/blog/dflash2/
А я напомню, что уже есть модель без цензуры :)
tg / max
Вышел DFlash 2 — новое поколение спекулятивного декодирования на основе блочной диффузии.
DFlash 2 разгоняет Qwen3.8-27B до 70 токенов/с на MacBook Pro с M5 Max. Ускорение авторегрессионного декодирования достигает 4,6 раза, а итоговый вывод остаётся полностью идентичным исходной модели — буквально ни одного отличающегося токена. Уже доступны новые черновые модели для Qwen3.8-27B с нативной поддержкой SGLang, vLLM, llama.cpp и oMLX.
Суть подхода: https://inco.ai/blog/dflash2/
А я напомню, что уже есть модель без цензуры :)
tg / max