DeepSeek-OCR
Распознавалка текстов (и не только) от DeepSeek
Состоит из двух частей – DeepEncoder и DeepSeek-3B-MoE Decoder. DeepEncoder оптически сжимает изображения, превращая его в набор vision токенов.
Под капотом тут SAM + CLIP. SAM извлекает главную структуру и символы: буквы, главы, подписи, картинки, формулы. А CLIP добавляет глобальное понимание контекста
Работает в том числе с формулами, сложными структурами, чертежами, картинками и прочим.
Превосходит MinerU2.0, используя в 9 раз меньше ресурсов
HF
Гитхаб
#OCR #VLM #pdf2text
Распознавалка текстов (и не только) от DeepSeek
Состоит из двух частей – DeepEncoder и DeepSeek-3B-MoE Decoder. DeepEncoder оптически сжимает изображения, превращая его в набор vision токенов.
Под капотом тут SAM + CLIP. SAM извлекает главную структуру и символы: буквы, главы, подписи, картинки, формулы. А CLIP добавляет глобальное понимание контекста
Работает в том числе с формулами, сложными структурами, чертежами, картинками и прочим.
Превосходит MinerU2.0, используя в 9 раз меньше ресурсов
HF
Гитхаб
#OCR #VLM #pdf2text