Трушная аналитика | Вадим


Гео и язык канала: Россия, Русский
Категория: Карьера


Senior System Analyst про мир IT-аналитики и BigData.
Для тех, кто хочет углубиться в мир данных и аналитики крупных корпораций на опыте Финтеха и Яндекса.
Менторство: @stuk_kuts
ОС от учеников: @it_growing_feedback
Залетай, чтобы прокачать свои навыки.

Связанные каналы

Гео и язык канала
Россия, Русский
Категория
Карьера
Статистика
Фильтр публикаций


Топ компаний с IT-подразделениями по сокращениям 📉

Еще на 20% планирует сократить штат «Сбер» - новости про «Сбер» уже давно не вызывают удивления, а недавно компания сама подтвердила это и сказала, что держит курс на автоматизацию 😅

Новый
игрок на рынке «автоматизации» (увольнений) - WB , или RWB (после объединения с Russ), грустно наблюдать такое падение авторитета и уровня компании, раньше ведь считалась одной из лучших компаний в РФ

Иностранные банки в РФ, хоть после введения санкций не все банки с иностранными владельцами ушли из РФ, но все очень хотели), Райффайзенбанк и Юникредит одни из самых больших на нашем рынке - массово сворачивают свой бизнес 🌎

Буду рад если поделитесь в каком состоянии находится ваша компания где вы работаете, может кто-то изменит свое решение по офферу 📄


Моя статистика по офферам 💸

Постоянно стараюсь проходить хотя бы 1 собес в одну-две недели, пособирал информацию:

- Сильно выросли вилки на Middle’ов, если раньше можно было расчитывать на 180-200k gross и это было «ок», то сейчас можно спокойно получить 250k gross - это уже норма и средний оффер;

- В Data-области (DE, DWH, ETL/ELT) средняя сумма оффера для Senior-позиций просела. Некоторые на Senior позицию предлагают около 380k gross (что сильно меньше офферов до этого)

- Конкуренция сильно подросла. Если раньше после прохождения я понимал, что 10/10 прошел собес и можно спокойно ждать оффер, то сейчас - с тобой конкурируют еще 20 таких же ребят, которых либо сократили, либо «вкатуны»


😁 Сравнение З/П 2023 vs 2026

Мы видим, что в 25 году был "небольшой" рост зарплат, но к концу Q1 26 они вернулись на уровень 23 (!) года - а вот инфляцию отменить забыли.

Я уже молчу что уровень знаний требуемый работодателем вырос X2, а конкуренция на рынке X4 😐

Источник: https://sense-it.ru/mediacenter/analitika-zarplat-v-it-2023-2026


Новая задачка с собесов ⌨️

Есть две таблицы
ーー
table1 table2
1 1
1 1
2 3
3 3
4 null
null null

Задачи:
1) Написать результирующий запрос при каждом из видов join'ов
2*) Найти те записи, которые есть в table1, но для них нет аналога в table2. То есть в данном случае получить 2, 4. Для NULL справа есть аналог, поэтому его не включать

P.S. 2ая кажется простой, но есть интересный кейс с обработкой null'а


Классная статья про использование .cache()

Вы знали , что cache() на самом деле нас обманывает? Большинство вызовов функции cache() в PySpark лишь оболочка, и зачастую Spark заново пересчитывает эти данные.

Что еще более интересно, с помощью .persist() можно с этим бороться, как именно? Почитать тут.


Немного духоты про ИИ, кому интересно 🤖⬇️

Вчера немного протестировал новые модели на простых задачах. Существенной разницы между Kimi K2.6, DeepSeek Flash High и DeepSeek Flash Max не заметил. А вот при reasoning=medium качество уже ощутимо проседает.

Ночью попросил GPT-5.6 Sol придумать несколько более сложных бенчмарков. Сравнивали DeepSeek V4 Flash 0731, Kimi K2.6 и MiniMax M2.7 (coder-large).

Получились такие результаты:

1. Сложный one-shot аудит. Kimi дала наиболее цельный и качественно написанный аналитический ответ. DeepSeek немного уступила в рассуждении, но ответила заметно компактнее.

2. Агентная работа с репозиторием. DeepSeek Flash High показала лучший результат: точнее следовала плану, эффективнее использовала тесты и допустила меньше скрытых ошибок.

3. Долгий end-to-end вайбкодинг. Лучший результат дала DeepSeek Flash Max. Она лучше удерживала одновременно backend, frontend, SQLite, бизнес-логику и UX.

В целом DeepSeek Flash подтверждает сильные coding- и agentic-навыки. Для большинства задач оптимальным режимом выглядит reasoning=high. Max полезен прежде всего для длинных сквозных задач, но на более коротких может добавлять лишнюю сложность и даже ухудшать результат.

Kimi при этом остаётся сильнее как аналитик и независимый reviewer. Субъективно она также пишет более приятный и цельный текст — это подтвердилось в первом бенчмарке.

Практическая связка может выглядеть так:

Kimi формулирует задачу и риски → DeepSeek High планирует и реализует → для долгой разработки можно использовать Max → финальное ревью снова проводить в High.


Новый функционал HeadHunter 🤔

Теперь любой (повторюсь, ЛЮБОЙ) HR может пожаловаться на ваше резюме в сервисе. Если вкратце, - теперь на странице резюме кандидата, найденного в базе, появилась кнопка «Пожаловаться на резюме» 🤡

Нравится цитата - "После отправки жалоба поступит модераторам для проверки", мне вот интересно, а как модераторы смогут определить нарисованный опыт у кандидата или нет? 😁

Ссылка на статью - https://hh.ru/blog/zhaloba-na-rezyume


А может вы просто Грейд занижаете?.. 🥲


Статистика по США и Канаде 🇺🇸🇨🇦

Наткнулся на две статьи про США и Канаду для людей работающих в Data. Можно понять как люди там поживают, какая средняя З/П, что просят по стеку -

https://blog.surfalytics.com/p/canada-wealth-paths-for-data-professionals

https://blog.surfalytics.com/p/usa-wealth-paths-for-data-professionals

Статьи писал Дима Аношин, классный DE, человек с опытом 15+ в аналитике и инжиниринге данных и релокант в США


Бадди, который знает меньше, чем я 😐

Недавно в компании была переорганизация, две команды слили в одну => приходится делить знания друг с другом. Мне дал бадди по онбордингу на новую платформу, но, человек буквально не мог ответить на банальные вопросы про архитектуру платформы 😪

Важное уточнение, это человек с Senior-грейдом, с зарплатой минимум 500к net. Выводы делайте сами.


Data Vault 1.0 VS Data Vault 2.0 🔫🔫

В чем различие и зачем это спрашивают? Около 2-ух лет назад этот вопрос перестали спрашивать на собесах, но недавно он снова начал всплывать на собеседованиях у моих менти.

Во-первых, Data Vault 2.0 использует хеш-ключи для создания идентификаторов для хабов, ссылок и сателлитов, что увеличивает производительность, масштабируемость и отслеживаемость данных — это и есть основное различие между Data Vault 1.0 и Data Vault 2.0. По сути это главное различие (!)

Во-вторых, в Data Vault 2.0 вводится концепция бизнес-ключей (BK)

В-третьих, Data Vault 2.0 применяет стандарты по именованию, моделированию, загрузке и документированию хранилища данных


Вот такого уровня задачки могут спрашивать на собесах ❗️

Если до сих пор сомневаетесь в своих знаниях, не уверены в том, что можете претендовать на хорошую зарплату, советую перечитать условие задачки. Иногда всё гораздо проще 🙂


Наткнулся на классный сервис где ребята делятся офферами 🍴

В среднем офферы по рынку и так большинство знает, но здесь можно в real-time посмотреть сколько в среднем ребята просят на рынке 🤔💵

Можете поделиться и сами - https://gdezarplata.duckdns.org/


Готовлю курс по PySpark

История, которая коснется скорее всего каждого, кто захочет в Big Dat’у.

Курс будет полномасштабным и охватывать базовые теоретические понятия + Д/З и практику.

По вместимости можно будет уложиться в 4 дня, ну и получить куча полезной инфы 👍


У компаний массово отбирают аккредитацию 📉

Только за этот год аккредитацию потеряли около 1.000 компаний, и это (как по мне) только начало.

Минцифры массово забирают статус аккредитованной компании, и, кстати, это касается не только миниконтор, а бигтеха и финтеха в частности 🏦

P.S. Однако, общее количество растет, и это хорошо заметно по скринам (1 - 10.02, 2 - 20.04)


Раздача бургеров стажерам в Яндексе 🍔🥲

А что делать если на ревью «+-» и зарплату повышают на 5% в год? Давиться бургерами…

924 0 10 2 15

Gen Z’s hiring hell is real 🏃‍♂️

Статья на Fortune о том, что поколение Z никто не хочет нанимать.

Каждый третий работодатель уже заменяет часть стартовых (entry-level) позиций искусственным интеллектом. Такой вывод основан на исследовании GMAC, в котором приняли участие более 600 рекрутеров по всему миру, причем более половины работают с компаниями Fortune 100 и Fortune 500.


Настроение после 3 встреч подряд утром be like ⬆️


Приятная коммуникация > Хорошей зарплаты 🤔

Недавно задумался, а какой долей % от своей ЗП я готов пожертвовать, чтобы у меня в команде был friendly + vibe настрой...

Вообще - вопрос риторический. Кому-то комфортно ради хорошей строчки резюме и позитивного настроя сидеть на зарплате джуна при задачах уровня Senior, кому-то нет.

Предполагаю, ответ кроется в личных амбициях и готовности жертвовать "настроением" ☹️


Репост из: Айти-Пингвин | Дата инженер
Обзор собеседования со СБЕР v2

ВОПРОСЫ:

Расскажи про интересную рабочую задачу, связанную с данными, которой ты гордишься, и про свою роль в ней.

Какой итоговый объем витрин был, в строках или гигабайтах?

ЗАДАЧА 1:

Дана таблица такого формата
code status
1 активный
2 закрыт
3 аннулирован
3 аннулирован

Как написать запрос, который покажет, есть ли в таблице дублирующиеся записи?

Как написать запросы, чтобы удалить дубли и оставить только уникальные записи?

Какие есть разные способы дедупликации одной и той же таблицы?

Возможна ли ситуация, когда после удаления дублей в отчете они появляются снова? И как решать такую проблему, если ты не знаешь источник, откуда в эту таблицу летят дубли, а также не может повлиять на скрипт загрузки?

Какой constraint можно поставить на таблицу, чтобы не допускать дублей?

Что будет с потоком загрузки, если он попытается вставить записи, нарушающие unique constraint?

Как организовать загрузку через staging, чтобы сначала очистить данные, а потом вставить только уникальные записи в целевую таблицу?

Какую периодичность запуска выбрать для процесса очистки дублей, если неизвестно, как часто приходят вставки?

Как бы ты оптимально решал проблему дублей в таблице, если нельзя быстро найти источник проблемы?


ЗАДАЧА 2:
Есть 9 одинаковых на вид монет. Одна из них фальшивая, и она легче остальных. Есть только чашечные весы без гирь. Нужно найти фальшивую монету ровно за 2 взвешивания.

——————-

Чет со Сбером изичные собесы🦦

it пингвин | data engineer 🐧

#собеседование #менти

Показано 20 последних публикаций.