Новый кейс от команды СберЗдоровья: как мы построили собственную платформу Data Vault на dbt-core
В новой статье на Хабре команда делится опытом решения сложной задачи интеграции десятков источников и существующей аналитической логики в единую DWH-архитектуру через Data Vault.
Когда классический переход на DV «на ходу» оказался ресурсоёмким, команда выбрала свой путь с самописным приложением, Datahub и dbt + Automate-DV на базе Trino/S3/Iceberg.
В статье рассказывают:
• почему отказались от прямого перехода на Data Vault и выбрали гибридный approach;
• как через CDC (Debezium + Kafka-Connect) получают near-real-time данные с минимальной нагрузкой на источники;
• как dbt + шаблоны Automate-DV автоматизируют построение raw DV слоёв (stage, hubs, links, satellites и др.);
• и как Transform App с UI-канвасом заменяет ручное моделирование сотен таблиц, ускоряя работу от часов до минут.
Полезная статья для всех, кто строит масштабируемые DWH на основе Data Vault с dbt-фокусом.
@five_minutes_of_data
В новой статье на Хабре команда делится опытом решения сложной задачи интеграции десятков источников и существующей аналитической логики в единую DWH-архитектуру через Data Vault.
Когда классический переход на DV «на ходу» оказался ресурсоёмким, команда выбрала свой путь с самописным приложением, Datahub и dbt + Automate-DV на базе Trino/S3/Iceberg.
В статье рассказывают:
• почему отказались от прямого перехода на Data Vault и выбрали гибридный approach;
• как через CDC (Debezium + Kafka-Connect) получают near-real-time данные с минимальной нагрузкой на источники;
• как dbt + шаблоны Automate-DV автоматизируют построение raw DV слоёв (stage, hubs, links, satellites и др.);
• и как Transform App с UI-канвасом заменяет ручное моделирование сотен таблиц, ускоряя работу от часов до минут.
Полезная статья для всех, кто строит масштабируемые DWH на основе Data Vault с dbt-фокусом.
@five_minutes_of_data