🔥 Все говорят про LLM и diffusion, а вот про OCR как будто забыли…
dots-ocr — свежая open-source модель (1.7B), которая вырывается в лидеры для распознавания документов:
✔️ 100+ языков (мультиязычный парсинг)
✔️ Работает и с PDF, и с изображениями
✔️ Понимает таблицы, формулы, структурированный текст
✔️ SOTA качество при полностью открытом коде
Теперь можно строить свои парсеры документов и аналитические пайплайны без дорогих проприетарных сервисов.
👍 Это прям ключ для дата-сайентистов, NLP/LLM инженеров и всех, кто работает с данными «в дикой природе».
📱 Репозиторий
🐸 Библиотека дата-сайентиста
#буст
dots-ocr — свежая open-source модель (1.7B), которая вырывается в лидеры для распознавания документов:
✔️ 100+ языков (мультиязычный парсинг)
✔️ Работает и с PDF, и с изображениями
✔️ Понимает таблицы, формулы, структурированный текст
✔️ SOTA качество при полностью открытом коде
Теперь можно строить свои парсеры документов и аналитические пайплайны без дорогих проприетарных сервисов.
👍 Это прям ключ для дата-сайентистов, NLP/LLM инженеров и всех, кто работает с данными «в дикой природе».
📱 Репозиторий
🐸 Библиотека дата-сайентиста
#буст