Репост из: FSCP
Google выпустил Multi-Token Prediction drafters для семейства открытых моделей Gemma 4, позволяющие ускорить инференс до трёх раз без потери качества. Технология построена на спекулятивном декодировании: лёгкая модель-черновик предсказывает несколько токенов вперёд, а основная Gemma 4 проверяет всю последовательность за один проход и добавляет ещё один токен сверху. Drafters распространяются под лицензией Apache 2.0 и доступны на Hugging Face и Kaggle с поддержкой transformers, MLX, vLLM, SGLang и Ollama.
Ускорение идёт не от самой идеи спекулятивного декодирования, а от двух менее очевидных решений. Drafter переиспользует активации и KV-кэш основной модели, то есть не пересчитывает контекст заново — это срезает основную накладную стоимость черновой модели. Для edge-вариантов E2B и E4B Google добавила кластеризацию в эмбеддере, чтобы обойти узкое место на финальном вычислении логитов. При этом 26B MoE-модель на Apple Silicon при batch size 1 почти не выигрывает из-за маршрутизации экспертов, и ускорение около 2,2x появляется только при батчах 4–8 — то есть на одиночных запросах локального чат-бота прирост на маках будет заметно скромнее заявленного трёхкратного.
https://blog.google/innovation-and-ai/technology/developers-tools/multi-token-prediction-gemma-4/
_______
Источник | #blognot
@F_S_C_P
-------
Поддержи канал подпиской
-------
Ускорение идёт не от самой идеи спекулятивного декодирования, а от двух менее очевидных решений. Drafter переиспользует активации и KV-кэш основной модели, то есть не пересчитывает контекст заново — это срезает основную накладную стоимость черновой модели. Для edge-вариантов E2B и E4B Google добавила кластеризацию в эмбеддере, чтобы обойти узкое место на финальном вычислении логитов. При этом 26B MoE-модель на Apple Silicon при batch size 1 почти не выигрывает из-за маршрутизации экспертов, и ускорение около 2,2x появляется только при батчах 4–8 — то есть на одиночных запросах локального чат-бота прирост на маках будет заметно скромнее заявленного трёхкратного.
https://blog.google/innovation-and-ai/technology/developers-tools/multi-token-prediction-gemma-4/
_______
Источник | #blognot
@F_S_C_P
-------
Поддержи канал подпиской
-------