🔍 PaddleOCR-VL-1.5 внезапно ворвался в топ open-source OCR - и при этом модель всего на 0.9B параметров.
Фактически это сейчас один из самых сильных открытых инструментов для распознавания текста и понимания документов - при очень скромном размере по меркам современных AI-моделей.
Ирония в тайминге:
• Сначала вышел Kimi 2.5 (https://t.me/ai_machinelearning_big_data/9439)
• Потом DeepSeekOCR-2 (https://t.me/ai_machinelearning_big_data/9435)
• И буквально следом - PaddleOCR-VL-1.5
Неделя просто взрывная для направления AI, которое занимается документами: сканы, PDF, таблицы, формы, смешанный текст и структура.
Что особенно интересно - это не просто классический OCR "картинка → текст", а визуально-языковая модель. То есть она лучше понимает структуру документа: блоки, таблицы, взаимосвязи между элементами, а не только символы.
Для разработчиков это означает более точный парсинг документов, автоматизацию работы с формами, счетами, договорами, отчетами и любыми полу-структурированными файлами - и все это на базе полностью открытой модели.
Порог входа в продвинутую document AI снова стал ниже.
huggingface.co/PaddlePaddle/PaddleOCR-VL-1.5
@Python_Community_ru
Фактически это сейчас один из самых сильных открытых инструментов для распознавания текста и понимания документов - при очень скромном размере по меркам современных AI-моделей.
Ирония в тайминге:
• Сначала вышел Kimi 2.5 (https://t.me/ai_machinelearning_big_data/9439)
• Потом DeepSeekOCR-2 (https://t.me/ai_machinelearning_big_data/9435)
• И буквально следом - PaddleOCR-VL-1.5
Неделя просто взрывная для направления AI, которое занимается документами: сканы, PDF, таблицы, формы, смешанный текст и структура.
Что особенно интересно - это не просто классический OCR "картинка → текст", а визуально-языковая модель. То есть она лучше понимает структуру документа: блоки, таблицы, взаимосвязи между элементами, а не только символы.
Для разработчиков это означает более точный парсинг документов, автоматизацию работы с формами, счетами, договорами, отчетами и любыми полу-структурированными файлами - и все это на базе полностью открытой модели.
Порог входа в продвинутую document AI снова стал ниже.
huggingface.co/PaddlePaddle/PaddleOCR-VL-1.5
@Python_Community_ru