Вокруг выпуска DeepSeek v4.1 Flash сегодня развиваются два сюжета:
1. Дерзкий ход компании - с 14 сентября, пока "полная" модель Deepseek v4.1 Pro не готова, все запросы пользователей к Pro будут тихонечко отправляться на v4.1 Flash (и по цене Flash). На HackerNews ожидаемо жарко: кто-то кричит "нельзя подменять модель под капотом, вы че?", кто-то резонно отвечает "модели и так недетерминированы, вы никогда точно не знали, что получаете".
2. Инженерный ход. У модели новая архитектура Causal Encoder-Decoder. При размере модели в 552B параметров, обработка входного запроса реально включает только 8B, для генерации ответа - уже 16B. Экономия в памяти на токен в 437 раз по сравнению с первой версии DeepSeek (если помните, она всех порядком удивила).
Если вы уже перешли при работе с AI на длинный контекст, цепочки разных вызовов, есть база знаний - то это идеалити. В память влезает на порядки больше диалогов одновременно, за меньшие деньги.
Цены: $0.003 (!) за 1M токенов на cache hit, $0.15 - на miss, $0.6 - за output. Нот бэд, как говорится.
Что вы сами думаете про скрытое переключение модели - ок это или нет? И думаете ли про v4.1 flash для своей базы знаний и personal OS?
@ppprompt
1. Дерзкий ход компании - с 14 сентября, пока "полная" модель Deepseek v4.1 Pro не готова, все запросы пользователей к Pro будут тихонечко отправляться на v4.1 Flash (и по цене Flash). На HackerNews ожидаемо жарко: кто-то кричит "нельзя подменять модель под капотом, вы че?", кто-то резонно отвечает "модели и так недетерминированы, вы никогда точно не знали, что получаете".
2. Инженерный ход. У модели новая архитектура Causal Encoder-Decoder. При размере модели в 552B параметров, обработка входного запроса реально включает только 8B, для генерации ответа - уже 16B. Экономия в памяти на токен в 437 раз по сравнению с первой версии DeepSeek (если помните, она всех порядком удивила).
Если вы уже перешли при работе с AI на длинный контекст, цепочки разных вызовов, есть база знаний - то это идеалити. В память влезает на порядки больше диалогов одновременно, за меньшие деньги.
Цены: $0.003 (!) за 1M токенов на cache hit, $0.15 - на miss, $0.6 - за output. Нот бэд, как говорится.
Что вы сами думаете про скрытое переключение модели - ок это или нет? И думаете ли про v4.1 flash для своей базы знаний и personal OS?
@ppprompt