TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Центр технологий для общества Yandex Cloud

1 Sep, 14:31

Открыть в Telegram Поделиться Пожаловаться

🗞️ Если обычному человеку дать в руки советскую газету, он без проблем её прочитает, а вот VLM запутается и не сможет с точностью распознать, что написано на выцветших страницах

За решение этой проблемы взялись участники студкемпа Яндекс Образования вместе с экспертами Центра технологий для общества Yandex Cloud. Работали над реальными задачами Библиотеки имени Н. А. Некрасова* и проекта «Электронекрасовка».

↪️ «Электронекрасовка» — это электронная библиотека и культурно-просветительское медиа, основу которого составляет системная оцифровка библиотечных фондов.

По мере роста цифровой коллекции появлялись сложные задачи. Например, как собрать разрозненные текстовые блоки на газетной полосе в цельные статьи.

Правила вёрстки отличались не только в разных изданиях, но даже на соседних страницах одной газеты. Заголовок мог растянуться на несколько колонок, а текст — обрываться и переноситься на другую часть полосы.


💿 Поэтому распознать только буквы было недостаточно. Нейросети необходимо понять семантику страниц и определить точный порядок чтения блоков, чтобы восстановить смысл публикации.

Так появился PereStruct — модульный пайплайн для восстановления логической структуры старинных газет.

🟣 PereStruct объединяет детектор вёрстки на базе YOLO, Yandex Vision OCR для распознавания текста, модели коррекции ошибок Yandex AI Studio и отдельную модель семантической сборки, которая «склеивает» фрагменты в единое целое.

Подробнее о том, как устроен пайплайн PereStruct и другие технические детали проекта, читайте в статье на Хабре.


Это не первое наше сотрудничество с Библиотекой им. Н. А. Некрасова. Ранее Центр технологий для общества Yandex Cloud помог автоматизировать базовую оцифровку: благодаря облачным сервисам обработка сканов сократилась с 11 минут до 25 секунд. Рассказывали об этом здесь.

*С 2024 года технологическим партнёром библиотеки является Центр технологий для общества Yandex Cloud. Мы предоставляем вычислительные ресурсы и помогаем перенести отдельные этапы обработки сканов в облако.

⚪️ Подписывайтесь: @ycsocialtech

586 1 11 21
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot