🖥 Как найти дубликаты в папке с помощью Python
Например, в папке лежат сотни файлов, и нужно понять, какие из них полностью одинаковые.
Можно сравнивать их по хэшу 👇
from pathlib import Path
import hashlib
def get_hash(path):
return hashlib.md5(path.read_bytes()).hexdigest()
files = {}
for file in Path("files").iterdir():
if file.is_file():
file_hash = get_hash(file)
files.setdefault(file_hash, []).append(file)
for group in files.values():
if len(group) > 1:
print("Дубликаты:")
for file in group:
print(" ", file)
💡 Идея простая:
📄 файл → 🔢 хэш → 🔍 сравниваем хэши
Если хэши совпали, файлы с высокой вероятностью одинаковые.
🔥 Такой скрипт можно использовать для:
— очистки папок
— поиска повторяющихся фото
— анализа больших архивов
— автоматизации работы с файлами
Например, в папке лежат сотни файлов, и нужно понять, какие из них полностью одинаковые.
Можно сравнивать их по хэшу 👇
from pathlib import Path
import hashlib
def get_hash(path):
return hashlib.md5(path.read_bytes()).hexdigest()
files = {}
for file in Path("files").iterdir():
if file.is_file():
file_hash = get_hash(file)
files.setdefault(file_hash, []).append(file)
for group in files.values():
if len(group) > 1:
print("Дубликаты:")
for file in group:
print(" ", file)
💡 Идея простая:
📄 файл → 🔢 хэш → 🔍 сравниваем хэши
Если хэши совпали, файлы с высокой вероятностью одинаковые.
🔥 Такой скрипт можно использовать для:
— очистки папок
— поиска повторяющихся фото
— анализа больших архивов
— автоматизации работы с файлами