epsilon correct dan repost
MTP спекулятивный декодинг в Gemma 4: ускоряемся в два раза без потери качества 🥳
В нашу дорогую гемму наконец завезли спекулятивный декодинг, когда более маленькая модель предсказывает токены, которые могут верифицироваться большой моделью параллельно, существенно ускоряя инференс для локальных юзкейзов.
Попробовать можно через HuggingFace transformers, остальные движки тоже скоро будут поддерживать.
блогпост, технический блог
В нашу дорогую гемму наконец завезли спекулятивный декодинг, когда более маленькая модель предсказывает токены, которые могут верифицироваться большой моделью параллельно, существенно ускоряя инференс для локальных юзкейзов.
Попробовать можно через HuggingFace transformers, остальные движки тоже скоро будут поддерживать.
блогпост, технический блог