A Modern Python Stack for Data Projects
Автор собрал шаблон репозитория для data-проектов на Python и решил объяснить, почему именно такой набор инструментов.
Базовый цикл, который теперь используется почти везде, простой:
окружение и зависимости через uv, автоматическое качество кода через ruff, типы через ty, исследование данных в Marimo и локальная аналитика в Polars, когда важна производительность.
Этого достаточно, чтобы стартовать проект без костылей.
Исторически Python рос быстрее, чем его инструменты. Он стал стандартом в науке и индустрии, но менеджмент зависимостей, виртуальные окружения и версии Python годами оставались источником фрустрации.
Переломный момент - инструменты от Astral.
Это команда, которая методично пересобирает Python-тулчейн с упором на скорость и UX. uv, ruff и ty закрывают большую часть того, что раньше требовало десятка разрозненных утилит.
uv - ключевой элемент.
Это быстрый менеджер зависимостей и проектов на Rust, который по факту заменяет pip, virtualenv, pip-tools и часто Poetry.
Он автоматически управляет .venv, работает и с requirements.txt, и с pyproject.toml, пишет lockfile для воспроизводимости и делает это на порядки быстрее pip. Плюс встроенное управление версиями Python: можно зафиксировать нужную версию, и uv сам её скачает.
ruff делает то же самое с качеством кода.
Это линтер и форматтер в одном лице, который покрывает flake8, isort и black, но работает в разы быстрее.
ty - логичное продолжение.
Это современный type checker, который ставит скорость и мгновенную обратную связь во главу угла. Он ещё молодой, но уже сейчас даёт более понятные ошибки и лучше вписывается в редактор.
Помимо Astral, есть и другие важные игроки.
Marimo - первый ноутбук, который позволяет отказаться от Jupyter. Он реактивный и детерминированный: порядок выполнения определяется зависимостями, а не кликами мыши. Никакого скрытого состояния. При этом ноутбук - это обычный Python-файл, который нормально живёт в Git, запускается как скрипт и может использоваться как модуль. Для исследований и прототипов это огромный шаг вперёд.
Для локальной работы с данными - Polars.
Это DataFrame-библиотека с Rust-движком и ленивой моделью выполнения. Ты описываешь, что хочешь получить, а Polars оптимизирует план сам: pushdown, параллелизм, стриминг, работа с Parquet и Arrow без лишних копий. Производительность высокая по умолчанию, без перехода к распределённым системам. Плюс отличная интеграция с DuckDB, если хочется смешать DataFrame-подход и SQL.
В довесок - стандартный, но проверенный набор: Docker для воспроизводимости, MkDocs для документации и Commitizen для нормальной истории коммитов и автоматических релизов.
♾️Post♾️
♾️Github repo♾️
@five_minutes_of_data
Автор собрал шаблон репозитория для data-проектов на Python и решил объяснить, почему именно такой набор инструментов.
Базовый цикл, который теперь используется почти везде, простой:
окружение и зависимости через uv, автоматическое качество кода через ruff, типы через ty, исследование данных в Marimo и локальная аналитика в Polars, когда важна производительность.
Этого достаточно, чтобы стартовать проект без костылей.
Исторически Python рос быстрее, чем его инструменты. Он стал стандартом в науке и индустрии, но менеджмент зависимостей, виртуальные окружения и версии Python годами оставались источником фрустрации.
Переломный момент - инструменты от Astral.
Это команда, которая методично пересобирает Python-тулчейн с упором на скорость и UX. uv, ruff и ty закрывают большую часть того, что раньше требовало десятка разрозненных утилит.
uv - ключевой элемент.
Это быстрый менеджер зависимостей и проектов на Rust, который по факту заменяет pip, virtualenv, pip-tools и часто Poetry.
Он автоматически управляет .venv, работает и с requirements.txt, и с pyproject.toml, пишет lockfile для воспроизводимости и делает это на порядки быстрее pip. Плюс встроенное управление версиями Python: можно зафиксировать нужную версию, и uv сам её скачает.
ruff делает то же самое с качеством кода.
Это линтер и форматтер в одном лице, который покрывает flake8, isort и black, но работает в разы быстрее.
ty - логичное продолжение.
Это современный type checker, который ставит скорость и мгновенную обратную связь во главу угла. Он ещё молодой, но уже сейчас даёт более понятные ошибки и лучше вписывается в редактор.
Помимо Astral, есть и другие важные игроки.
Marimo - первый ноутбук, который позволяет отказаться от Jupyter. Он реактивный и детерминированный: порядок выполнения определяется зависимостями, а не кликами мыши. Никакого скрытого состояния. При этом ноутбук - это обычный Python-файл, который нормально живёт в Git, запускается как скрипт и может использоваться как модуль. Для исследований и прототипов это огромный шаг вперёд.
Для локальной работы с данными - Polars.
Это DataFrame-библиотека с Rust-движком и ленивой моделью выполнения. Ты описываешь, что хочешь получить, а Polars оптимизирует план сам: pushdown, параллелизм, стриминг, работа с Parquet и Arrow без лишних копий. Производительность высокая по умолчанию, без перехода к распределённым системам. Плюс отличная интеграция с DuckDB, если хочется смешать DataFrame-подход и SQL.
В довесок - стандартный, но проверенный набор: Docker для воспроизводимости, MkDocs для документации и Commitizen для нормальной истории коммитов и автоматических релизов.
♾️Post♾️
♾️Github repo♾️
@five_minutes_of_data