TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Arnold Enginegger

16 Dec 2025, 18:48

Открыть в Telegram Поделиться Пожаловаться

Открыл для себя одно действительно полезное применение ИИ, хехе.

На компе скопилось много PDF-файлов с разного рода статьями, "полезными" даташитами и прочим мусором. Как водится, файлы я просто скачиваю под оригинальными именами, а имена эти обычно ничего не говорят о содержимом (например, что может быть внутри файла 07YLC.pdf?). К счастью, я давно пользуюсь Recoll, который успешно справляется с помойкой и позволяет достаточно эффективно находить то, что нужно. Но иногда хочется просто полистать каталог, и посмотреть что же у меня там есть непрочитанного.

И вот тут мне пригодился наконец мой ИИ-сервер с локальными модельками. Я написал маленький скрипт, который берёт первые 50 строк из PDF файла, скармливает их ИИ и просит подобрать человекочитаемое имя, отражающее содержание документа. Получилось довольно неплохо. Например, упомянутый файл 07YLC.pdf оно переименовывает в family_of_n_scroll_hyperchaotic_attractors_and_their_realization.pdf, что точно повторяет название статьи, которая находится в этом документе.

В качестве ИИ используется модель GPT-OSS-20B, запущенная через Ollama на двух видеокартах NVIDIA CMP 50HX (БУ-шные майнерские карты, купленные на Озоне). В среднем на одно переименование уходит 20 секунд - сюда входит: извлечение страницы из PDF, преобразование её в PNG, распознавание с помощью Tesseract и обработка на ИИ. Скрипт не делает проверку получившегося имени на валидность, по этому при использовании менее "умной" модели скорее всего придётся дописывать какие нибудь sanity checks.

Вы скажете, что натравливать многогигабайтную нейросеть на такую простую задачу - это оверкилл. Наверное, но не в моём случае. Мой ИИ-сервер стоит в неотапливаемом сарае, который я раньше оборгевал электробогревателем, а сейчас обогреваю ИИ-сервером. По этому тяжелые вычисления мне обходятся бесплатно 🤑

Скрипт выложил в radicle (rad:z3AKswvBeeUzxKbuBDFHdcJpr65P2) 😎

PS: README мне тоже написала нейросеть.
PPS: Нехороший Роскомнадзор заблочил IP, на котором хостится Radicle. По этому вторая ссылка на мой локальный Radicle Explorer.
Radicle Explorer
Explore the Radicle network

787 0 29 15 25
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot