📂 Идеальная структура Data Analysis проекта
Из чего состоит правильный проект:
— config/: Централизованное хранение путей и параметров в config.yaml.
— data/: Разделение данных на сырые (`raw`), промежуточные (`interim`) и готовые к анализу (`processed`).
— notebooks/: Только для экспериментов, EDA и черновых находок.
— src/: Здесь живет «чистый» и переиспользуемый код для очистки данных, генерации признаков и моделей.
— tests/: Юнит-тесты, которые гарантируют, что логика обработки данных не сломалась после правок.
Золотые правила работы:
1. Как только код в Jupyter стал стабильным и переиспользуемым — выносите его в модули в папку src/.
2. Читайте из raw, очищайте в src/ и сохраняйте результат в processed. Никогда не перезаписывайте сырые данные!
3. Описывайте методику и логику анализа в папке docs/, а не только в комментариях к коду.
👇 Забирайте шаблон себе в закладки.
📍 Навигация: Вакансии • Задачи • Собесы
Библиотека дата-сайентиста
#буст
Из чего состоит правильный проект:
— config/: Централизованное хранение путей и параметров в config.yaml.
— data/: Разделение данных на сырые (`raw`), промежуточные (`interim`) и готовые к анализу (`processed`).
— notebooks/: Только для экспериментов, EDA и черновых находок.
— src/: Здесь живет «чистый» и переиспользуемый код для очистки данных, генерации признаков и моделей.
— tests/: Юнит-тесты, которые гарантируют, что логика обработки данных не сломалась после правок.
Золотые правила работы:
1. Как только код в Jupyter стал стабильным и переиспользуемым — выносите его в модули в папку src/.
2. Читайте из raw, очищайте в src/ и сохраняйте результат в processed. Никогда не перезаписывайте сырые данные!
3. Описывайте методику и логику анализа в папке docs/, а не только в комментариях к коду.
👇 Забирайте шаблон себе в закладки.
📍 Навигация: Вакансии • Задачи • Собесы
Библиотека дата-сайентиста
#буст