🖥 Как превратить PDF в текст с помощью Python
Нужно быстро достать текст из PDF? Можно автоматизировать это 👇
import fitz
doc = fitz.open("document.pdf")
for page in doc:
print(page.get_text())
📦 Установка:
pip install pymupdf
💡 А если нужно сохранить весь текст в файл:
with open("result.txt", "w", encoding="utf-8") as file:
for page in doc:
file.write(page.get_text())
🔥 Получается простой конвертер PDF → TXT.
На этом можно построить:
— поиск по документам
— обработку большого количества PDF
— извлечение данных из отчётов
— подготовку текста для AI
⚠️ Если PDF состоит из сканов, обычное извлечение текста может не сработать - тогда понадобится OCR.
Нужно быстро достать текст из PDF? Можно автоматизировать это 👇
import fitz
doc = fitz.open("document.pdf")
for page in doc:
print(page.get_text())
📦 Установка:
pip install pymupdf
💡 А если нужно сохранить весь текст в файл:
with open("result.txt", "w", encoding="utf-8") as file:
for page in doc:
file.write(page.get_text())
🔥 Получается простой конвертер PDF → TXT.
На этом можно построить:
— поиск по документам
— обработку большого количества PDF
— извлечение данных из отчётов
— подготовку текста для AI
⚠️ Если PDF состоит из сканов, обычное извлечение текста может не сработать - тогда понадобится OCR.