🖥 S3 можно использовать как общий слой хранения для ML и Big Data
В ML и Big Data одни и те же данные часто нужны сразу нескольким системам: Spark обрабатывает выборки, Trino записывает результаты, а несколько GPU-воркеров используют один датасет для обучения.
➡️ S3 позволяет вынести данные в общий слой хранения. Объекты доступны по HTTP, поэтому разные вычислительные системы и обучающие воркеры могут работать с ними параллельно — без обязательного копирования датасетов на каждую машину.
Но просто сложить все в один бакет недостаточно. Для ML-проекта данные лучше сразу разделить по назначению:
🔹 датасеты — исходные и обработанные выборки в Object Storage
🔹 версии датасетов — DVC связывает состояние данных с конкретным коммитом кода, а сами файлы хранит в S3
🔹 фичи — например, в Parquet; отдельный feature store вроде Feast нужен, когда одни признаки используют несколько моделей и требуется онлайн-инференс
🔹 веса и артефакты экспериментов — MLflow хранит параметры и метрики, а тяжелые файлы можно складывать в S3.
📁 Есть еще один нюанс: в S3 нет настоящих папок. Поэтому структуру префиксов стоит продумать заранее.
📎Мы в МАХ
В ML и Big Data одни и те же данные часто нужны сразу нескольким системам: Spark обрабатывает выборки, Trino записывает результаты, а несколько GPU-воркеров используют один датасет для обучения.
➡️ S3 позволяет вынести данные в общий слой хранения. Объекты доступны по HTTP, поэтому разные вычислительные системы и обучающие воркеры могут работать с ними параллельно — без обязательного копирования датасетов на каждую машину.
Но просто сложить все в один бакет недостаточно. Для ML-проекта данные лучше сразу разделить по назначению:
🔹 датасеты — исходные и обработанные выборки в Object Storage
🔹 версии датасетов — DVC связывает состояние данных с конкретным коммитом кода, а сами файлы хранит в S3
🔹 фичи — например, в Parquet; отдельный feature store вроде Feast нужен, когда одни признаки используют несколько моделей и требуется онлайн-инференс
🔹 веса и артефакты экспериментов — MLflow хранит параметры и метрики, а тяжелые файлы можно складывать в S3.
📁 Есть еще один нюанс: в S3 нет настоящих папок. Поэтому структуру префиксов стоит продумать заранее.
📎Мы в МАХ