Обзор собеседования с Лемана Про
Формат работы: Гибрид
Зп: от 250к просил
Период собеседования: Июль 2026
Итог собеседования: Игнор
————
Общий опыт работы
С какими базами данных вы работали и до какого уровня погружались в SQL и БД?
Миграция Oracle → Greenplum
Опишите подробнее процесс миграции на Greenplum. Какие особенности необходимо было учитывать?
Какая конфигурация использовалась в Oracle — распределённая или обычная СУБД?
Приходилось ли оптимизировать операции join при переходе с обычной таблицы на распределённую?
Применялась ли индексация в Greenplum в вашей практике?
Задача на проектирование (геоданные)
Дана таблица с географическими координатами полигонов. Каким образом можно ускорить поиск по координатам без использования полигонального индекса?
Как можно применить дистрибуцию или партиционирование для оптимизации запросов по числовым координатным полям?
Какой принцип должен лежать в основе распределения данных для эффективного использования всего кластера?
Языки программирования
Расскажите об опыте работы с языками программирования, в частности с Python.
Насколько глубоко изучен API Apache Airflow? Какие классы операторов и задач применялись?
Использовались ли внутренние механизмы Airflow — переменные, XCom?
Применялись ли генераторы задач или динамические DAG?
Проектирование pipeline
Как бы вы спроектировали pipeline для загрузки таблиц из Oracle в Greenplum?
Каким образом следует организовать запуск: единый DAG или отдельные DAG для каждой таблицы?
Какие преимущества и недостатки имеет каждый из подходов — универсальный DAG с множеством задач против отдельных DAG на каждую таблицу?
Контроль качества данных
Каким образом обеспечивается контроль качества загруженных данных?
Опишите верхнеуровневую структуру отчёта по контролю качества данных (data quality).
Опыт с Hadoop-стеком
Расскажите подробнее об опыте работы с экосистемой Hadoop.
В каком окружении использовался PySpark?
С какими форматами файлов приходилось работать (Parquet, CSV, ORC)?
Хранились ли данные в объектном хранилище?
Имеется ли опыт работы с технологиями каталогизации и версионирования данных, например Apache Iceberg?
DevOps и инфраструктура
Имеется ли опыт применения практик DevOps и SRE?
Есть ли опыт работы с Docker и Kubernetes?
Использовались ли инструменты мониторинга и логирования, такие как Grafana или Loki?
Управление кодом БД и архитектура хранилища
Как организован процесс работы с кодом, относящимся к базе данных, включая развёртывание процедур, функций и таблиц?
Какой процесс применяется для деплоя изменений в продуктивную среду?
Опишите архитектуру хранилища данных: какие слои используются и как формируются витрины данных?
————
Вот это уже потненький собес. Не то что в Сбере)
it пингвин | data engineer 🐧
#собеседование #менти
Формат работы: Гибрид
Зп: от 250к просил
Период собеседования: Июль 2026
Итог собеседования: Игнор
————
Общий опыт работы
С какими базами данных вы работали и до какого уровня погружались в SQL и БД?
Миграция Oracle → Greenplum
Опишите подробнее процесс миграции на Greenplum. Какие особенности необходимо было учитывать?
Какая конфигурация использовалась в Oracle — распределённая или обычная СУБД?
Приходилось ли оптимизировать операции join при переходе с обычной таблицы на распределённую?
Применялась ли индексация в Greenplum в вашей практике?
Задача на проектирование (геоданные)
Дана таблица с географическими координатами полигонов. Каким образом можно ускорить поиск по координатам без использования полигонального индекса?
Как можно применить дистрибуцию или партиционирование для оптимизации запросов по числовым координатным полям?
Какой принцип должен лежать в основе распределения данных для эффективного использования всего кластера?
Языки программирования
Расскажите об опыте работы с языками программирования, в частности с Python.
Насколько глубоко изучен API Apache Airflow? Какие классы операторов и задач применялись?
Использовались ли внутренние механизмы Airflow — переменные, XCom?
Применялись ли генераторы задач или динамические DAG?
Проектирование pipeline
Как бы вы спроектировали pipeline для загрузки таблиц из Oracle в Greenplum?
Каким образом следует организовать запуск: единый DAG или отдельные DAG для каждой таблицы?
Какие преимущества и недостатки имеет каждый из подходов — универсальный DAG с множеством задач против отдельных DAG на каждую таблицу?
Контроль качества данных
Каким образом обеспечивается контроль качества загруженных данных?
Опишите верхнеуровневую структуру отчёта по контролю качества данных (data quality).
Опыт с Hadoop-стеком
Расскажите подробнее об опыте работы с экосистемой Hadoop.
В каком окружении использовался PySpark?
С какими форматами файлов приходилось работать (Parquet, CSV, ORC)?
Хранились ли данные в объектном хранилище?
Имеется ли опыт работы с технологиями каталогизации и версионирования данных, например Apache Iceberg?
DevOps и инфраструктура
Имеется ли опыт применения практик DevOps и SRE?
Есть ли опыт работы с Docker и Kubernetes?
Использовались ли инструменты мониторинга и логирования, такие как Grafana или Loki?
Управление кодом БД и архитектура хранилища
Как организован процесс работы с кодом, относящимся к базе данных, включая развёртывание процедур, функций и таблиц?
Какой процесс применяется для деплоя изменений в продуктивную среду?
Опишите архитектуру хранилища данных: какие слои используются и как формируются витрины данных?
————
Вот это уже потненький собес. Не то что в Сбере)
it пингвин | data engineer 🐧
#собеседование #менти