TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
ilovedocs | AI

17 Jun, 18:30

Открыть в Telegram Поделиться Пожаловаться

Распознавание текста

В судебной работе постоянно приходится работать с материалами дела. А их исходник после ознакомления в суде иногда оставляет желать лучшего.

Мы уже говорили о том, что для нормальной работы с документами нейросети нужен подходящий формат файлов. Если у вас есть только фото, тут два пути:

(1) Загрузить фото сразу в нейросеть и попросить ее проанализировать документ.

Тогда нейросеть использует свой встроенный OCR-модуль (инструмент для извлечения текста с фото). Качество последующей работы будет зависеть от того, насколько хорошо нейросеть распознала текст.

(2) Сначала отдельно распознать текст, а уже потом загрузить в нейросеть документ с распознанным содержанием.

Этот вариант позволяет не тратить токены дорогой нейросети, а сначала прогнать фото через более слабую модель или отдельный OCR-инструмент. Тут есть разные рабочие варианты.

@borouhin протестировал несколько инструментов на образцово-показательном фрагменте из материалов дела: плохое качество, курсив, выделение жирным, сложный юридический текст.

• Классика FineReader 15

Текст распался, появились странные символы, обрывки слов и фразы, которые сложно использовать без серьезной ручной правки. Ушла эпоха.

• Claude (Opus 4.6)

Он тоже оказался хуже: выдал грамматически корректный, но бессвязный текст. И на токенах тут можно разориться.

• GLM-OCR

Специализированная модель для распознавания документов. Справилась заметно лучше, но результат все равно получился с ошибками: «апелляционной инструкции», «суд первой инструкции», «общеразрядским основаниям».

Есть мнения, что она плохо работает с кириллицей.

Можно использовать через внешний сервис (т.е. на чужом сервере) или развернуть локально, т.е. на своем компьютере / сервере*.

• DeepSeek-OCR-2

На этом же фрагменте дал почти идеальный результат. Больше подходит для развертывания локально.

*Возможность развернуть распознавание локально лучше отвечает требованиям конфиденциальности и адвокатской тайны, потому что материалы не уходят на чужой сервер.

_________________________________

Сообщество юристов, которые покоряют нейросети
Канал | Курс

2.1k 3 52 6 30
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot