Распознавание текста
В судебной работе постоянно приходится работать с материалами дела. А их исходник после ознакомления в суде иногда оставляет желать лучшего.
Мы уже говорили о том, что для нормальной работы с документами нейросети нужен подходящий формат файлов. Если у вас есть только фото, тут два пути:
(1) Загрузить фото сразу в нейросеть и попросить ее проанализировать документ.
Тогда нейросеть использует свой встроенный OCR-модуль (инструмент для извлечения текста с фото). Качество последующей работы будет зависеть от того, насколько хорошо нейросеть распознала текст.
(2) Сначала отдельно распознать текст, а уже потом загрузить в нейросеть документ с распознанным содержанием.
Этот вариант позволяет не тратить токены дорогой нейросети, а сначала прогнать фото через более слабую модель или отдельный OCR-инструмент. Тут есть разные рабочие варианты.
@borouhin протестировал несколько инструментов на образцово-показательном фрагменте из материалов дела: плохое качество, курсив, выделение жирным, сложный юридический текст.
• Классика FineReader 15
Текст распался, появились странные символы, обрывки слов и фразы, которые сложно использовать без серьезной ручной правки. Ушла эпоха.
• Claude (Opus 4.6)
Он тоже оказался хуже: выдал грамматически корректный, но бессвязный текст. И на токенах тут можно разориться.
• GLM-OCR
Специализированная модель для распознавания документов. Справилась заметно лучше, но результат все равно получился с ошибками: «апелляционной инструкции», «суд первой инструкции», «общеразрядским основаниям».
Есть мнения, что она плохо работает с кириллицей.
Можно использовать через внешний сервис (т.е. на чужом сервере) или развернуть локально, т.е. на своем компьютере / сервере*.
• DeepSeek-OCR-2
На этом же фрагменте дал почти идеальный результат. Больше подходит для развертывания локально.
*Возможность развернуть распознавание локально лучше отвечает требованиям конфиденциальности и адвокатской тайны, потому что материалы не уходят на чужой сервер.
_________________________________
Сообщество юристов, которые покоряют нейросети
Канал | Курс
В судебной работе постоянно приходится работать с материалами дела. А их исходник после ознакомления в суде иногда оставляет желать лучшего.
Мы уже говорили о том, что для нормальной работы с документами нейросети нужен подходящий формат файлов. Если у вас есть только фото, тут два пути:
(1) Загрузить фото сразу в нейросеть и попросить ее проанализировать документ.
Тогда нейросеть использует свой встроенный OCR-модуль (инструмент для извлечения текста с фото). Качество последующей работы будет зависеть от того, насколько хорошо нейросеть распознала текст.
(2) Сначала отдельно распознать текст, а уже потом загрузить в нейросеть документ с распознанным содержанием.
Этот вариант позволяет не тратить токены дорогой нейросети, а сначала прогнать фото через более слабую модель или отдельный OCR-инструмент. Тут есть разные рабочие варианты.
@borouhin протестировал несколько инструментов на образцово-показательном фрагменте из материалов дела: плохое качество, курсив, выделение жирным, сложный юридический текст.
• Классика FineReader 15
Текст распался, появились странные символы, обрывки слов и фразы, которые сложно использовать без серьезной ручной правки. Ушла эпоха.
• Claude (Opus 4.6)
Он тоже оказался хуже: выдал грамматически корректный, но бессвязный текст. И на токенах тут можно разориться.
• GLM-OCR
Специализированная модель для распознавания документов. Справилась заметно лучше, но результат все равно получился с ошибками: «апелляционной инструкции», «суд первой инструкции», «общеразрядским основаниям».
Есть мнения, что она плохо работает с кириллицей.
Можно использовать через внешний сервис (т.е. на чужом сервере) или развернуть локально, т.е. на своем компьютере / сервере*.
• DeepSeek-OCR-2
На этом же фрагменте дал почти идеальный результат. Больше подходит для развертывания локально.
*Возможность развернуть распознавание локально лучше отвечает требованиям конфиденциальности и адвокатской тайны, потому что материалы не уходят на чужой сервер.
_________________________________
Сообщество юристов, которые покоряют нейросети
Канал | Курс