Инструмент недели. Kedro
Давно не было инструментов недели! Приступим! 👇
Кажется, один из самых недооценённых GitHub-репозиториев для ML-инженеров 😭— это kedro. Более подробно можно почитать тут. Впервые мне он встретился на хабре аж лет 6 назад, но репа обновляется и сейчас, является актуальной.
По своей сути, это фреймворк модульного кода в DS, который переносит лучшие практики классической разработки ПО (модульность, разделение ответственности) в ML-проекты.
Ключевые возможности:
*️⃣ Готовая структура проекта через шаблоны.
*️⃣ Построение и модульная организация конвейеров (пайплайнов).
*️⃣Разделение частей конвейера для гибкости и переиспользования.
*️⃣Внешнее управление настройками данных и параметрами через YAML-файлы.
*️⃣Анализ результатов узлов прямо из юпитер ноутбука.
*️⃣ Визуализация структуры конвейера.
*️⃣Автоматическая генерация документации проекта.
Kedro превращает ML-проект в граф зависимостей между шагами (загрузка 🔜 очистка 🔜 фичи 🔜 обучение 🔜 инференс).
👉 Если поменять фичи, пересчитается только нужная часть, не всё подряд. Больше никаких путей к данным в коде. Один раз описываешь в Data Catalog формат, расположение, способ загрузки. В коде пишешь просто train_data, а не путь на 3 строки.
👉 Чтобы перейти с CSV на S3, меняешь конфиг, не трогая код.
👉 Новый человек в команде за 30–60 минут понимает, где что происходит (а не за 3 дня копания в ноутбуках и пингования ответственных, созвонами, головной болью)
👉 Подходит не только для классического ML. Любые ETL+ML задачи, RAG, порядок во всем.
Пробуй! Как минимум можно вдохновиться и форкнуть под свои задачи/стиль/привычки.
Все.
😙
Давно не было инструментов недели! Приступим! 👇
Кажется, один из самых недооценённых GitHub-репозиториев для ML-инженеров 😭— это kedro. Более подробно можно почитать тут. Впервые мне он встретился на хабре аж лет 6 назад, но репа обновляется и сейчас, является актуальной.
По своей сути, это фреймворк модульного кода в DS, который переносит лучшие практики классической разработки ПО (модульность, разделение ответственности) в ML-проекты.
Ключевые возможности:
*️⃣ Готовая структура проекта через шаблоны.
*️⃣ Построение и модульная организация конвейеров (пайплайнов).
*️⃣Разделение частей конвейера для гибкости и переиспользования.
*️⃣Внешнее управление настройками данных и параметрами через YAML-файлы.
*️⃣Анализ результатов узлов прямо из юпитер ноутбука.
*️⃣ Визуализация структуры конвейера.
*️⃣Автоматическая генерация документации проекта.
Kedro превращает ML-проект в граф зависимостей между шагами (загрузка 🔜 очистка 🔜 фичи 🔜 обучение 🔜 инференс).
👉 Если поменять фичи, пересчитается только нужная часть, не всё подряд. Больше никаких путей к данным в коде. Один раз описываешь в Data Catalog формат, расположение, способ загрузки. В коде пишешь просто train_data, а не путь на 3 строки.
👉 Чтобы перейти с CSV на S3, меняешь конфиг, не трогая код.
👉 Новый человек в команде за 30–60 минут понимает, где что происходит (а не за 3 дня копания в ноутбуках и пингования ответственных, созвонами, головной болью)
👉 Подходит не только для классического ML. Любые ETL+ML задачи, RAG, порядок во всем.
Пробуй! Как минимум можно вдохновиться и форкнуть под свои задачи/стиль/привычки.
Все.
😙