TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Айти-Пингвин | Дата инженер

24 Jul, 11:01

Открыть в Telegram Поделиться Пожаловаться

Обзор собеседования с Лемана Про

Формат работы: Гибрид
Зп: от 250к просил
Период собеседования: Июль 2026
Итог собеседования: Игнор

————

Общий опыт работы

С какими базами данных вы работали и до какого уровня погружались в SQL и БД?

Миграция Oracle → Greenplum

Опишите подробнее процесс миграции на Greenplum. Какие особенности необходимо было учитывать?

Какая конфигурация использовалась в Oracle — распределённая или обычная СУБД?

Приходилось ли оптимизировать операции join при переходе с обычной таблицы на распределённую?

Применялась ли индексация в Greenplum в вашей практике?

Задача на проектирование (геоданные)
Дана таблица с географическими координатами полигонов. Каким образом можно ускорить поиск по координатам без использования полигонального индекса?

Как можно применить дистрибуцию или партиционирование для оптимизации запросов по числовым координатным полям?

Какой принцип должен лежать в основе распределения данных для эффективного использования всего кластера?

Языки программирования
Расскажите об опыте работы с языками программирования, в частности с Python.

Насколько глубоко изучен API Apache Airflow? Какие классы операторов и задач применялись?

Использовались ли внутренние механизмы Airflow — переменные, XCom?

Применялись ли генераторы задач или динамические DAG?

Проектирование pipeline

Как бы вы спроектировали pipeline для загрузки таблиц из Oracle в Greenplum?

Каким образом следует организовать запуск: единый DAG или отдельные DAG для каждой таблицы?

Какие преимущества и недостатки имеет каждый из подходов — универсальный DAG с множеством задач против отдельных DAG на каждую таблицу?

Контроль качества данных

Каким образом обеспечивается контроль качества загруженных данных?

Опишите верхнеуровневую структуру отчёта по контролю качества данных (data quality).

Опыт с Hadoop-стеком

Расскажите подробнее об опыте работы с экосистемой Hadoop.

В каком окружении использовался PySpark?

С какими форматами файлов приходилось работать (Parquet, CSV, ORC)?

Хранились ли данные в объектном хранилище?

Имеется ли опыт работы с технологиями каталогизации и версионирования данных, например Apache Iceberg?

DevOps и инфраструктура
Имеется ли опыт применения практик DevOps и SRE?

Есть ли опыт работы с Docker и Kubernetes?

Использовались ли инструменты мониторинга и логирования, такие как Grafana или Loki?

Управление кодом БД и архитектура хранилища

Как организован процесс работы с кодом, относящимся к базе данных, включая развёртывание процедур, функций и таблиц?

Какой процесс применяется для деплоя изменений в продуктивную среду?

Опишите архитектуру хранилища данных: какие слои используются и как формируются витрины данных?

————

Вот это уже потненький собес. Не то что в Сбере)

it пингвин | data engineer 🐧

#собеседование #менти

1.5k 0 40 26 26
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot