Репост из: Psy Eyes
Видео недоступно для предпросмотра
Смотреть в Telegram
Использование Speculative Decoding на примере Qwen3 32B в связке с маленькой Qwen 0.6B для предсказания очевидных токенов.
Было 10.80 ток/сек и 3:45 мин на
рассуждения с неверным ответом в конце.
Стало 11.88 ток/сек, время 2:25 мин, и ответ правильный (двоюродная племянница). Прогнал два раза.
Потребление VRAM увеличилось на 1,4 ГБ (c 18,8 до 20,2 ГБ).
Было 10.80 ток/сек и 3:45 мин на
рассуждения с неверным ответом в конце.
Стало 11.88 ток/сек, время 2:25 мин, и ответ правильный (двоюродная племянница). Прогнал два раза.
Потребление VRAM увеличилось на 1,4 ГБ (c 18,8 до 20,2 ГБ).