Обзор большого собеседования с IT_OneУ моего менти было интересное собеседование😢 Длительность 3 часа💀
"По
опыту косвенные вопросы, по типу на вопросах иногда просили уточнить как это было устроено у вас на работе"
Кандидат ответил на все вопросы и очень хорошо. Пришел отказ без нормальной обратной связи.
В общем, та еще клоунада.
IT_One в своем
репертуаре ))
Но мы получили хороший список вопросов для самопроверки. Всем будет полезно.
Основные вопросы:1) Чем отличаются DWH и Data Lake?
2) Какие существуют форматы хранения данных?
3) Какие преимущества у колоночных форматов, например Parquet?
4) Что такое OLTP и OLAP?
5) Какие задачи решают OLTP и OLAP системы?
6) Что такое snapshot в контексте DWH?
7) Что такое staging слой в DWH?
8)Какова роль core слоя в DWH?
9)Что такое marts в DWH?
10)Объясните понятие surrogate key.
11)Чем отличается surrogate key от natural key?
12)Что такое Kimball методология?
13)Что такое Inmon методология?
14)В чем разница между star и snowflake схемами?
15)Как выбрать последние 1000 записей по времени с помощью SQL?
16)Что такое running balance и как его реализовать?
17)Чем оконные функции отличаются от агрегатных?
18)Как реализовать фильтрацию по конкретной дате в SQL?
19)Какие типы JOIN существуют?
20)Как оптимизировать JOIN в больших таблицах?
21)Что такое партиционирование в базах данных?
22)Чем полезна архитектура MPP?
23)Как справляться с проблемой data skew?
24)Какие методы обработки невалидных данных вы знаете?
25)Что такое quarantine для данных?
26)Как организовать мониторинг качества данных?
27)Чем отличается commit от push в git?
28)Что такое ветвление (branching) в git?
29)Как устроен CI/CD pipeline?
30)Как хранить secrets в CI/CD системах?
31)Что такое Spark?
32)Как устроена архитектура Spark?
33)Что такое RDD и DataFrame в Spark?
34)Как писать Spark-приложения на PySpark?
35)Как реализовать сложную агрегацию в Spark?
36)Что такое HDFS и как с ним работать?
37)Как автоматизировать запуск Spark job через Airflow?
38)Как работает Kafka?
39)Что такое Kafka Connect?
40)Как реализовать потоковую обработку на базе Kafka и ClickHouse?
41)Как устроен Data Pipeline с Kafka → Kafka Connect → Materialized Views → ClickHouse?
42)Что такое dbt и для чего он нужен?
43)Как dbt помогает с lineage данных?
44)Какие преимущества у инкрементальной загрузки данных?
45)Как проектировать ключи дистрибуции в Greenplum?
46)Какие средства мониторинга и алертинга вы использовали?
47)Что такое Iceberg и Trino?
48)Как настроить multi-cluster обработку в Spark?
49)Какие есть best practices для ETL пайплайнов?
50)Как проводить code review для ETL и аналитического кода?
Задачу тоже прикрепляю 🫡
Как вам собесик😁? Ответили б на все вопросы?
it пингвин | data engineer 🐧
#собеседование #менти