TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
AI-DEV IDEA💡

7 May, 04:06

Открыть в Telegram Поделиться Пожаловаться

Репост из: FSCP
Google выпустил Multi-Token Prediction drafters для семейства открытых моделей Gemma 4, позволяющие ускорить инференс до трёх раз без потери качества. Технология построена на спекулятивном декодировании: лёгкая модель-черновик предсказывает несколько токенов вперёд, а основная Gemma 4 проверяет всю последовательность за один проход и добавляет ещё один токен сверху. Drafters распространяются под лицензией Apache 2.0 и доступны на Hugging Face и Kaggle с поддержкой transformers, MLX, vLLM, SGLang и Ollama.

Ускорение идёт не от самой идеи спекулятивного декодирования, а от двух менее очевидных решений. Drafter переиспользует активации и KV-кэш основной модели, то есть не пересчитывает контекст заново — это срезает основную накладную стоимость черновой модели. Для edge-вариантов E2B и E4B Google добавила кластеризацию в эмбеддере, чтобы обойти узкое место на финальном вычислении логитов. При этом 26B MoE-модель на Apple Silicon при batch size 1 почти не выигрывает из-за маршрутизации экспертов, и ускорение около 2,2x появляется только при батчах 4–8 — то есть на одиночных запросах локального чат-бота прирост на маках будет заметно скромнее заявленного трёхкратного.

https://blog.google/innovation-and-ai/technology/developers-tools/multi-token-prediction-gemma-4/

_______
Источник | #blognot
@F_S_C_P

-------
Поддержи канал подпиской
-------
Accelerating Gemma 4: faster inference with multi-token prediction drafters
An overview of how Multi-Token Prediction (MTP) drafters are making Gemma 4 models up to 3x faster at inference.

9 0 0
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot