DeepSeek выпустила экспериментальную мультимодальную версию V4 Flash
DeepSeek-V4-Flash-Vision-Exp уже появилась в API. По работе с текстом она сохраняет возможности обычной V4 Flash, включая рассуждения, агентов и работу с инструментами, но теперь умеет понимать изображения.
На тестах мультимодальных агентов новая версия заметно обгоняет обычную V4 Flash и по данным DeepSeek, приближается к уровню Claude Opus 4.8. То есть модель может не только читать текст, но и смотреть на интерфейсы, изображения и другие визуальные данные, а затем выполнять действия через подключенные инструменты.
Изображения можно передавать ссылкой, напрямую в запросе или через новый Files API. Один загруженный файл разрешено использовать повторно без повторной отправки, сам Files API бесплатный.
Для изображений действует обычная цена V4 Flash. Каждая картинка при расчете стоимости занимает до 384 токенов.
DeepSeek-V4-Flash-Vision-Exp уже появилась в API. По работе с текстом она сохраняет возможности обычной V4 Flash, включая рассуждения, агентов и работу с инструментами, но теперь умеет понимать изображения.
На тестах мультимодальных агентов новая версия заметно обгоняет обычную V4 Flash и по данным DeepSeek, приближается к уровню Claude Opus 4.8. То есть модель может не только читать текст, но и смотреть на интерфейсы, изображения и другие визуальные данные, а затем выполнять действия через подключенные инструменты.
Изображения можно передавать ссылкой, напрямую в запросе или через новый Files API. Один загруженный файл разрешено использовать повторно без повторной отправки, сам Files API бесплатный.
Для изображений действует обычная цена V4 Flash. Каждая картинка при расчете стоимости занимает до 384 токенов.