TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Dealer.AI

11 Sep 2025, 22:58

Открыть в Telegram Поделиться Пожаловаться

Ты следующий GPT-5 🇨🇩
Новая модель Qwen3-Next...

Забавно, что в блоге утек обзор, но ссылку почистили и поэтому довольствуемся hf релизом. Однако, спасибо коллегам, они засейвили страничку и приложу ее ниже.

Итак, погнали. Задача, которую решают авторы, заключается в кардинальном повышении эффективности LLM, как на этапе обучения, так и на этапе inference, особенно в условиях сверхдлинного контекста (до 256K+ токенов) и большого общего числа параметров.

Конкретные цели:

– Преодолеть квадратичную сложность стандартного внимания (Attention), которое становится "бутылочным горлышком" для длинных контекстов. Для этого и юзают хаки из Mamba2 архитектуры.

– Сочетать преимущества разных архитектур (линейное внимание для скорости, стандартное внимание для точности) в одной гибридной модели. Туда же в Mamba.

– Добиться максимального уровня сжатия активируемых параметров в архитектуре Mixture of Experts (MoE), чтобы при общем размере в 80B параметров активировалось всего ~3B (т.е. 3.7%), что резко снижает вычислительные затраты.

– Создать модель, которая по производительности будет сопоставима с их же гораздо более крупными и дорогими флагманами (Qwen3-235B) и лучшими закрытыми моделями (Gemini 2.5 Flash, GPT-4o), но при этом будет невероятно эффективной.

Идея алгоритма и ключевые архитектурные "инновации":

Суть алгоритма заключается в принципиально новой гибридной архитектуре под названием Qwen3-Next. Её ключевые компоненты:

1. Гибридный механизм внимания (Gated DeltaNet + Gated Attention): 75% слоев используют Gated DeltaNet – вариант линейного внимания, который имеет почти линейную, а не квадратичную сложность. Это обеспечивает высокую скорость работы с длинными контекстами. Остальнве 25% слоев используют Gated Attention – модифицированное внимание с выходными гейтами для стабильности и улучшенными головами (256 dim). Это отвечает за высокое качество и способность к "вспоминанию" информации.
2. Частичное Rotary Encoding: Позиционное кодирование применяется только к первым 25% измерений, что улучшает экстраполяцию на более длинные последовательности.
3. Сверхразреженная архитектура MoE:
– Всего экспертов: 512.
– Активируется за шаг 10 экспертов + 1 shared эксперт.

Соотношение параметров: 80B общих параметров, но активируется только ~3B (3.7%) на один токен. Это в 10 раз меньше, чем у плотной модели Qwen3-32B.

Оптимизации для стабильности обучения:

1. Zero-Centered RMSNorm: Замена LayerNorm для предотвращения "взрыва" весов. А с другой стороны за счёт квадратичности имеем быстрее сходимость.

2. Нормализация параметров маршрутизатора экспертов обеспечивает равномерное использование их на ранних этапах обучения.

3. Многотокенное предсказание (Multi-Token Prediction, MTP). Модель предсказывает несколько последующих токенов одновременно. Это не только ускоряет инференс через механизм Speculative Decoding (где эти предсказания используются как "черновик"), но и, по заявлению авторов, улучшает общее качество модели.

В общем-то и всё. Наконец-то пошел тренд на использование опыта mamba архитектур. Причем у меня в канале уже был обзор гибрида трансформеров и mamba, читаем подробнее тут.

Интересное решение, заявляют хорошие метрики, будем посмотреть.

5.1k 12 68 12 46
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot