TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Все о блокчейн/мозге/space/WEB 3.0 в России и мире

20 Oct 2025, 17:04

Открыть в Telegram Поделиться Пожаловаться

#DeepSeek выпустили новую модель

DeepSeek-OCR — это ИИ-модель, которая извлекает текст из документов, изображений и PDF-файлов. Главное отличие от привычных OCR-систем: модель не просто "читает" текст, а понимает структуру документа и может работать с разными форматами вывода.

Интересный концепт в статье — имитация человеческой памяти. Модель может сжимать старые части документа сильнее, чем новые, подобно тому, как мы помним недавние события детально, а далёкие — размыто.

Ключевые возможности:

1.
Модель предлагает 6 режимов работы — от экономичного Tiny (64 визуальных токена) до мощного Gundam-M (1853 токена).

2. Обучена на 30 млн страниц документов на 100+ языках. Основной фокус — китайский и английский (25млн страниц), но работает и с другими языками.

Модель состоит из DeepEncoder и DeepSeek-3B-MoE декодер.

Инфраструктура:

- Python 3.12.9, CUDA 11.8, PyTorch 2.6.0
- Поддержка vLLM для высокопроизводительной обработки (~2500 токенов/сек на A100-40G для PDF)
- Доступна через Hugging Face Transformers.

Практические сценарии использования:

1. Обработка архивов

2. Автоматизация документооборота

3. Мультиязычная поддержка

4. Научные исследования — распознавание формул, таблиц, диаграмм из публикаций
All about AI, Web 3.0, BCI
DeepSeek released an OCR model Their motivation is really interesting: they want to use visual modality as an efficient compression medium for textual information, and use this to solve long-context challenges in LLMs. Of course, they are using it to get more training data for their models as wel...

3.4k 3 117 22
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot