🗂 Навигатор по техническим постам
Собрала все статьи канала в одном месте — сохраняйте, чтобы не потерять 👇
🧭 Старт в профессии
Как я стал дата-инженером
Как я получил оффер на Джуна в ML
⚙️ Основы Data Engineering
Что такое ETL и ELT?
OLTP и OLAP
Что такое оркестратор данных
Взрыв дублей при JOIN
Разный grain таблиц и как его фиксить
〰️ Базы данных и хранилища
Oracle
HDFS
Объектное хранилище (object storage/ S3)
Redis
Parquet и ORC
🏔 Data Lake / Lakehouse
Lake house
Data Vault и Anchor Modelling
Apache Iceberg: зачем он нужен и почему вокруг него шум. Надежность и ACID в Data Lake.
Сравнение Delta Lake и Apache Iceberg.
🏠 ClickHouse
Click House
Click House (гранулы, ORDER BY и индексы)
Почему UPDATE в ClickHouse — это плохая идея
Dictionaries в ClickHouse: как ускорить аналитику
⚙️ Обработка больших данных
Map Reduce
Как кластеры делят ядра и гигабайты: управление ресурсами при обработке больших данных
Почему Spark вытеснил MapReduce
Spark за 2 минуты
Data Skew в Spark: что делать, eкогда один воркер перегружен. Разбор Spark UI, AQE и Salting.
🔄 Оркестрация и пайплайны
Airflow
3 практических кейса на дебаг Airflow.
💬 Стриминг и брокеры сообщений
Что такое брокеры сообщений
Kafka
Kafka vs Rabbit MQ
Apache Flink
Как устроен стриминг данных, и зачем он нужен
Debezium
Как работают CDC пайплайн
🧩 Query-движки
Trino
🏗 Архитектура и качество данных
Как собрать систему, которая не падает
Data Quality и контракты данных
Собрала все статьи канала в одном месте — сохраняйте, чтобы не потерять 👇
🧭 Старт в профессии
Как я стал дата-инженером
Как я получил оффер на Джуна в ML
⚙️ Основы Data Engineering
Что такое ETL и ELT?
OLTP и OLAP
Что такое оркестратор данных
Взрыв дублей при JOIN
Разный grain таблиц и как его фиксить
〰️ Базы данных и хранилища
Oracle
HDFS
Объектное хранилище (object storage/ S3)
Redis
Parquet и ORC
🏔 Data Lake / Lakehouse
Lake house
Data Vault и Anchor Modelling
Apache Iceberg: зачем он нужен и почему вокруг него шум. Надежность и ACID в Data Lake.
Сравнение Delta Lake и Apache Iceberg.
🏠 ClickHouse
Click House
Click House (гранулы, ORDER BY и индексы)
Почему UPDATE в ClickHouse — это плохая идея
Dictionaries в ClickHouse: как ускорить аналитику
⚙️ Обработка больших данных
Map Reduce
Как кластеры делят ядра и гигабайты: управление ресурсами при обработке больших данных
Почему Spark вытеснил MapReduce
Spark за 2 минуты
Data Skew в Spark: что делать, eкогда один воркер перегружен. Разбор Spark UI, AQE и Salting.
🔄 Оркестрация и пайплайны
Airflow
3 практических кейса на дебаг Airflow.
💬 Стриминг и брокеры сообщений
Что такое брокеры сообщений
Kafka
Kafka vs Rabbit MQ
Apache Flink
Как устроен стриминг данных, и зачем он нужен
Debezium
Как работают CDC пайплайн
🧩 Query-движки
Trino
🏗 Архитектура и качество данных
Как собрать систему, которая не падает
Data Quality и контракты данных