Репост из: Айти-Пингвин | Дата инженер
Обзор собеседования со СБЕР v2
ВОПРОСЫ:
Расскажи про интересную рабочую задачу, связанную с данными, которой ты гордишься, и про свою роль в ней.
Какой итоговый объем витрин был, в строках или гигабайтах?
ЗАДАЧА 1:
Дана таблица такого формата
code status
1 активный
2 закрыт
3 аннулирован
3 аннулирован
Как написать запрос, который покажет, есть ли в таблице дублирующиеся записи?
Как написать запросы, чтобы удалить дубли и оставить только уникальные записи?
Какие есть разные способы дедупликации одной и той же таблицы?
Возможна ли ситуация, когда после удаления дублей в отчете они появляются снова? И как решать такую проблему, если ты не знаешь источник, откуда в эту таблицу летят дубли, а также не может повлиять на скрипт загрузки?
Какой constraint можно поставить на таблицу, чтобы не допускать дублей?
Что будет с потоком загрузки, если он попытается вставить записи, нарушающие unique constraint?
Как организовать загрузку через staging, чтобы сначала очистить данные, а потом вставить только уникальные записи в целевую таблицу?
Какую периодичность запуска выбрать для процесса очистки дублей, если неизвестно, как часто приходят вставки?
Как бы ты оптимально решал проблему дублей в таблице, если нельзя быстро найти источник проблемы?
ЗАДАЧА 2:
Есть 9 одинаковых на вид монет. Одна из них фальшивая, и она легче остальных. Есть только чашечные весы без гирь. Нужно найти фальшивую монету ровно за 2 взвешивания.
——————-
Чет со Сбером изичные собесы🦦
it пингвин | data engineer 🐧
#собеседование #менти
ВОПРОСЫ:
Расскажи про интересную рабочую задачу, связанную с данными, которой ты гордишься, и про свою роль в ней.
Какой итоговый объем витрин был, в строках или гигабайтах?
ЗАДАЧА 1:
Дана таблица такого формата
code status
1 активный
2 закрыт
3 аннулирован
3 аннулирован
Как написать запрос, который покажет, есть ли в таблице дублирующиеся записи?
Как написать запросы, чтобы удалить дубли и оставить только уникальные записи?
Какие есть разные способы дедупликации одной и той же таблицы?
Возможна ли ситуация, когда после удаления дублей в отчете они появляются снова? И как решать такую проблему, если ты не знаешь источник, откуда в эту таблицу летят дубли, а также не может повлиять на скрипт загрузки?
Какой constraint можно поставить на таблицу, чтобы не допускать дублей?
Что будет с потоком загрузки, если он попытается вставить записи, нарушающие unique constraint?
Как организовать загрузку через staging, чтобы сначала очистить данные, а потом вставить только уникальные записи в целевую таблицу?
Какую периодичность запуска выбрать для процесса очистки дублей, если неизвестно, как часто приходят вставки?
Как бы ты оптимально решал проблему дублей в таблице, если нельзя быстро найти источник проблемы?
ЗАДАЧА 2:
Есть 9 одинаковых на вид монет. Одна из них фальшивая, и она легче остальных. Есть только чашечные весы без гирь. Нужно найти фальшивую монету ровно за 2 взвешивания.
——————-
Чет со Сбером изичные собесы🦦
it пингвин | data engineer 🐧
#собеседование #менти