В Китае выложили в опенсорс компактную OCR-модель, которая за один проход обрабатывает PDF-документы объёмом до 100 страниц.
Модель называется Unlimited-OCR. В ней всего 3 млрд параметров, и она спокойно работает локально.
Что еще:
- Однопроходный парсинг длинных документов: контекстное окно 32K
- Мультиязычность: работает сразу «из коробки»
- 93% точности: в стандартном бенчмарке распознавания (+6 пунктов к базовому уровню)
- Стабильность на объёмах: уровень ошибок менее 0,11 даже после 40-й страницы
- Для сравнения: классические облачные сервисы (AWS Textract, Google Vision, Azure Doc Intelligence) берут от $1,50 до $15 за каждые 1 000 страниц.
- Эта модель запускается прямо на вашем ПК. Бесплатно. Навсегда.
https://huggingface.co/baidu/Unlimited-OCR
Модель называется Unlimited-OCR. В ней всего 3 млрд параметров, и она спокойно работает локально.
Что еще:
- Однопроходный парсинг длинных документов: контекстное окно 32K
- Мультиязычность: работает сразу «из коробки»
- 93% точности: в стандартном бенчмарке распознавания (+6 пунктов к базовому уровню)
- Стабильность на объёмах: уровень ошибок менее 0,11 даже после 40-й страницы
- Для сравнения: классические облачные сервисы (AWS Textract, Google Vision, Azure Doc Intelligence) берут от $1,50 до $15 за каждые 1 000 страниц.
- Эта модель запускается прямо на вашем ПК. Бесплатно. Навсегда.
https://huggingface.co/baidu/Unlimited-OCR