TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

9 Jul 2025, 10:04

Открыть в Telegram Поделиться Пожаловаться

🎁 Как версионировать датасеты и ML-модели (и не сойти с ума)

Одна из самых частых причин почему вчера работало, а сегодня нет — отсутствие версионирования данных и моделей.

Без него сложно:
🙅‍♂️ повторить эксперименты,
🙅‍♂️ понять, почему метрики ухудшились,
🙅‍♂️ отладить баги в проде.

Вот как это решается 👇

1⃣ Используйте DVC или LakeFS для версионирования данных

DVC (Data Version Control) — git-подобный инструмент для отслеживания датасетов. Работает поверх Git и хранит данные в облаке (S3, GCS и т.п.).

dvc init
dvc add data/train.csv
git add data/train.csv.dvc .gitignore
git commit -m "Добавил версию обучающего датасета"

LakeFS — альтернатива на уровне хранилища (s3), позволяет делать data branches, merges и rollback данных.

2⃣ Храните модели с MLflow, Weights & Biases или DVC

MLflow позволяет логировать, сохранять и восстанавливать модели по version/tag/commit:
import mlflow
with mlflow.start_run():
mlflow.log_param("max_depth", 5)
mlflow.log_metric("accuracy", 0.92)
mlflow.sklearn.log_model(model, "model")

DVC тоже можно использовать:
dvc add models/random_forest.pkl
git commit -m "Модель v1.0"

3⃣ Сохраняйте метаданные эксперимента

Храните конфиги, хэши данных, модель, метрики, код и дату запуска. Можно использовать:
— MLflow Tracking
— Sacred + Omniboard
— W\&B Experiments

4⃣ Встраивайте версионирование в CI/CD

Добавьте в pipeline:
— автоматическое логирование модели,
— проверку отклонений метрик,
— тегирование релизов модели,
— деплой только при прохождении проверок.

-5⃣ Подписывайте версии моделей семантически (semver)

model_v1.2.0.pkl говорит больше, чем model_final_v4.pkl

Библиотека дата-сайентиста #буст

1.6k 3 43 9
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot