TGStat
TGStat
Type to search
Advanced channel search
  • flag English
    Site language
    flag Russian flag English flag Uzbek
  • Sign In
  • Catalog
    Channels and groups catalog Regional compilations Thematic compilations Платные каналы Search for channels
    Add a channel/group
  • Ratings
    Rating of channels Rating of groups Posts rating
    Ratings of brands and people
  • Analytics
  • Search by posts
  • Telegram monitoring
  • Promotion
    Advertising through Yandex Business Advertising in channels through TGStat Agency Advertising on TGStat.ru website
Machinelearning

11 Sep, 09:27

Open in Telegram Share Report

⚡️ DeepSeek открыла веса V4.1-Flash

DeepSeek выложила свежайшую DeepSeek-V4.1-Flash, мультимодальную MoE-модель на 552 млрд параметров, с контекстом до миллиона токенов и методом Causal Encoder-Decoder под капотом, который вдвое удешевляет разбор входа.

Задача, под которую её делали, скучная, но дорогая. Долго работающий агент постоянно перечитывает свой контекст, и всё прочитанное приходится держать в KV-кэше.

На длинных дистанциях он раздувается, забивает видеопамять и упирается в пропускную способность шин.


В V4.1-Flash кэш сжат до 890 байт на токен, это вчетверо меньше, чем у V4-Flash, и в 437 раз, чем у первой версии DeepSeek.

Каждому слою внимания заранее назначен один из трёх режимов:

🟢в полном слой считает свои ключи и значения сам;
🟢в режиме переиндексации берёт их у предыдущего слоя, но заново выбирает, на что смотреть;
🟢в режиме повторного использования не считает ничего - берёт и чужой кэш, и чужой выбор.

Так хранить приходится в разы меньше. Сверху главный кэш держится в четырёхбитном формате FP4, и устойчивость к такой точности натренирована, а не добавлена после обучения.

🟡Causal Encoder-Decoder

Метод вдохновлен майкрософтовской работой You Only Cache Once про переиспользование KV-кэша слоями. DeepSeek внесла в него структурные улучшения, чтобы поднять ёмкость кэша и глубину вычислений при его порождении.

40 слоёв разделены пополам: 20 на энкодер, 20 - декодер. К и V для декодера не считаются в каждом его слое, а проецируются из последнего скрытого состояния энкодера.

Поэтому при разборе входа работает только первая половина сети - 8 млрд активных параметров на токен против 16 при генерации ответа.

Для агентов, у которых вход в разы длиннее вывода, это именно то, что нужно.


🟡Бенчмарки

На DeepSWE v1.1 модель берёт 74,2% против 74,0 у Claude Opus 5 и 73,0 у GPT-5.6 Sol.

На Terminal-Bench 2.1 - 90,6% (выше всех).

На AutomationBench - 54,8% против 50,3 у Opus 5.

А вот в Terminal-Bench 4.0, где нужны экспертные знания в науке, модель даёт 31,2% против 51,8 у Opus 5, то есть разрыв с топами на самых сложных задачах никуда не делся.


Модель поддерживает настраиваемый уровень рассуждений от 1 до 100, в API это три пресета: low, high, max - они соответствуют значениям 50, 75 и 100.

Шаблона чата в Jinja нет - вместо него советуют реализацию промптов на Python и отдельный набор Rust-библиотек.

Сообщество на Hugging Face уже сделало квантованные версии практически под всё.


📌Лицензирование: MIT License


🟡Блогпост
🟡Веса
🟡Техотчет


@ai_machinelearning_big_data

#AI #ML #MMLM #MoE #Deepseek

24.9k 12 209 5 173
Catalog
Channels and groups catalog Channels compilations Search for channels Add a channel/group
Ratings
Rating of Telegram channels Rating of Telegram groups Posts rating Ratings of brands and people
API
API statistics Search API of posts API Callback
Our channels
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Read
Академия TGStat Telegram Research 2019 Telegram Research 2021 Telegram Research 2023
Contacts
Справочный центр Support Email Jobs
Miscellaneous
Terms and conditions Privacy policy Public offer
Our bots
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot