Инжиниринг Данных


Гео и язык канала: Россия, Русский
Категория: Технологии


Делюсь новостями из мира аналитики и карьерными советами.
15 лет в Аналитике и Инжиниринге Данных, 10 лет в MAANG
🛠️ dataengineer.ru | 🏄‍♂️ Surfalytics.com
№5017813306
Реклама:
https://almond-rule-130.notion.site/1199f595f76a8030ba1be1e607c9a8ce

Зарегистрирован в РКН
Связанные каналы  |  Похожие каналы

Гео и язык канала
Россия, Русский
Категория
Технологии
Статистика
Фильтр публикаций


Если кто есть в Salt Lake City, на родине мормонов, дайте знать, отправляюсь на конференцию.


Оказывается Claude remote часто заблокирован, поэтому если в рабочий день вам нужно быть на природе, Happy Engineering вам в помощь - удаленный терминал в Claude code.


Fuckup Night от создателей Trisigma, Ares и karpov.courses

Согласитесь, ивенты, где все делятся только своими успехами, уже поднадоели. Хочется реальных историй, где что-то пошло не по плану, но в итоге ошибка стала ценным опытом.

Поэтому команда Trisigma собирает Fuckup Night 26 августа — без записи и красивых цифр. Истории расскажут:
🔸 Виталий Черемисинов (Trisigma)
🔸 Роман Нестер (Ares, Arteus LLM и Segmento)
🔸 Валерий Бабушкин (British Petroleum)
🔸 Беслан Курашов (plevako.ai и karpov.courses)

Встречу проведут онлайн, поэтому подключиться можно из любой точки и всем, кто принимает решения на основе данных.

⚡️ Важно! Записи не будет, поэтому приходите на эфир. Главное — не забудьте зарегистрироваться.


Ну и чтобы понять как выглядит средний PR от Product Manager кто еще не знал ни dbt, ни snowflake несколько месяцев назад.

Это еще цветочки))

3.8k 0 12 18 39

Каждый раз когде мне прилетает PR, а прилетает много и часто - у меня в голове играет эта песня - “постой, паровоз....кондуктор нажми на тормоза

Надо бы им перевести🤬


Классно, что есть бесплатные ресурсы, где можно посмотреть как использовать AI в работе. Даже если это не best practices, все равно можно узнать что-то новое, увидеть новые инструменты.

Уверен в AI Dev Tools Zoomcamp: AI-Native Software Engineering можно подчерпнуть знания. Я сам не проходил, но знаю Zoomcamps подход - уверен, что есть полезная информация., тем более бесплатно.


Поделюсь наблюдениями за enterprise-компаниями.

1.Большие и скучные enterprise (Finance, Insurance, Government, Health и т.д.) сидят на Microsoft.

2. У них большие команды, которые умеют эффективно посещать митинги, тренинги и кивать головой, когда старший по званию выступает.

3. На данном этапе эволюции AI у них есть бесплатный Copilot в Microsoft Teams. Правда, он бесполезный для работы. Все другие инструменты заблокированы — на всякий случай, ведь служба безопасности делает свою работу (ради работы).

4. Инфраструктуру поддерживает отдельная команда в IT, которая никому и ни за что не даст доступ. При этом от вас кое-что хотят. У вас будет 3 среды — DEV/TEST/PROD, и каждая среда будет иметь свой целевой бранч: dev/test/main. Также будет процесс релиза — неважно, нужно это или нет.

5. Никто не может сделать ничего. Любое изменение требует множества митингов, а любой косяк будет обсуждаться неделями как критичный и опасный для всей компании. Возможно, поэтому никто не хочет ничего делать, чтобы не накосячить.

И это не единичный случай — это большинство компаний, где мне приходилось работать как контрактору. Тут ещё может наложиться душный микроменеджер-руководитель, который является экспертом по созданию и мониторингу задачек и подзадачек на доске. Ваша эффективность = количеству закрытых (и созданных) задачек.

Во всей этой истории я нашёл единственный workaround — Azure DevOps. Это отдельный сервис, в котором есть Git Repos, Pipelines, Wiki, Board/Tickets. Microsoft позаботился о том, чтобы вы могли подключаться к нему через PAT-токен и SSH-ключ (в репозитории). Таким образом, вы можете смотреть на код, создавать тикеты, писать документацию с помощью своего Claude Code.

Но в целом для любителей классики без AI-агентов это прямо идеальная среда. Соответственно, если вас попросят уйти, то уж извините — ваши навыки Excel и Power BI могут понадобиться разве что такой же enterprise-организации.

3.6k 0 42 18 61

В пятницу отправимся в небольшой поход с палатками. Если вы в Ванкувере, можете присоединиться.

Из Deep Cove до Granite Falls (до конца Indian Arm).

Пример маршрута с фотками.

Возможно уже лосось приплыл и плещется рядом с Indian River, вот и проверим. Можно использовать кану, каяк, падл борд.


Поделюсь своими ощущениями по использованию AI агентов. Этап эйфории прошёл.

Немножко поподробней про этот этап. У вас есть Claude Code и больше ни у кого его нет. У вас уже настроены MCP ко всем дата-сервисам и базам, и Claude делает за вас 100% работы. Любую задачу вы решаете мгновенно. Коллеги не понимают, что такое Claude Code, и все делают по старинке руками. На их фоне вы просто монстр производительности, даже можете менять и траблшутить Source Code.

Дальше компании начинают инвестировать в подписки Claude Code, и уже волей-неволей у всех появляется Claude. Ты им показываешь, как с ним работать и как всё работает. 2–3 месяца — и коллеги уже могут сами использовать MCP и делать PR через агентов.

Первый звоночек — обычно что-то вроде: «Ты слишком быстро всё сделал, и агент написал лабуду». То есть надо уже больше смотреть за агентом, всё перечитывать и перепроверять. Особенно сложно это делать, когда открыты несколько активных серий в разных репозиториях с серьёзными изменениями.

Также изначально Claude создавал код поверх кода, написанного руками. Этот код очень понятен, ведь ты его сам писал. Но спустя полгода код весь написан уже агентом, и мы уже на 100% зависимы от агента, ведь без него уже очень сложно разобраться, как там всё устроено и как это дело быстро подправить.

И теперь мы приходим к тому, что все одинаково умеют использовать агентов, друг другу проверяют PR, пишут огромные простыни текста — что починить, что исправить. То есть человек как proxy между общением агентов. 😄

Вся скорость и производительность выветриваются, и по факту вам надо больше и тяжелее работать. Если раньше вы работали на 120%, а команда лишь на 20%, то теперь это уже 115% на 120%, то есть в лучшем случае вы немного лучше, но какой ценой?!

Таким образом, мы пришли к тому, о чём говорили всегда: работы стало больше, задачи стали сложнее, а требования по скорости и качеству — выше. Я вижу на примерах, как растут аппетиты у VP-уровня, особенно когда они сами могут общаться с данными и находить инсайты. Они хотят больше и быстрее. У бизнеса теперь много идей, которые надо внедрить.

Да, даже элементарно — частота стендапов возросла до ежедневной, и уже не скажешь «я там ковыряю код», ведь за тебя агент может всё перековырять — сиди и читай, читатель-инженер.

Что будет дальше? А дальше требования будут расти. Даже от новичков будут требовать больше. Вам ведь думать не надо — за вас агент думает, поэтому просто сидите и общайтесь с ним, разбирайтесь. Задач будет больше, требований больше, свободного времени меньше. Людей однозначно нужно больше. Агенты ещё те шалунишки — нужен глаз да глаз за ними, а то положат продакшн. Это ещё не так критично в области data, а вот в customer-facing apps — там ещё сложнее.

Я спросил агента про известные концепции:

Jevons Paradox (Парадокс Джевонса)
Чем эффективнее технология, тем больше её потребляют. Производительность выросла → бизнес поднял планку → работы стало больше, а не меньше. Классика, описанная ещё в 19 веке применительно к паровым машинам.

Automation Bias
Склонность доверять автоматизированным системам больше, чем следует. Отсюда и «агент написал лабуду, но никто не заметил» — люди перестают критически проверять вывод системы.

Skill Atrophy / Deskilling
Деградация навыков из-за делегирования задач инструментам. Ты описал это точно: «код весь написан агентом, и без него уже сложно разобраться». Это активно обсуждается сейчас применительно к junior-разработчикам, которые никогда не научатся думать самостоятельно.

Productivity Paradox (Парадокс производительности)
Технологии растут, а реальная производительность и удовлетворённость сотрудников — не обязательно. Впервые описан в контексте IT-революции 80-90х годов (Solow Paradox).

Alert Fatigue / Review Fatigue
Когда объём вещей, требующих внимания, превышает когнитивные возможности человека. У тебя это — несколько открытых PR в разных репозиториях одновременно.

Shifting Bottleneck
Узкое место не исчезает, оно перемещается. Раньше бутылочное горлышко — написание кода. Теперь — ревью, понимание, верификация того, что написал агент.

4.6k 2 220 39 141

В новой статье Headed for the Exit: the Great Engineering Leader Career Break, автор делится наблюдениям про высокие инженерные должности.

CTO, VP of Engineering, Head of Engineering — люди, которые ещё вчера были на вершине карьеры — сейчас пачками уходят с позиций. Без нового места. Просто уходят.
The Pragmatic Engineer опросил почти 20 таких руководителей. Вот что они говорят:
Почему уходят:
1️⃣ Работа стала невыносимой — фаундеры с «AI-психозом» сами пишут код и сливают 60к строк в продакшн, ожидая магии. А разбираться с последствиями — CTO
2️⃣ Equity сгорает — сложные структуры инвесторских предпочтений делают даже 2% акций бесполезными. Зачем терпеть, если выхлопа не будет?
3️⃣ Без AI-опыта ты уже устарел — рынок хочет тех, кто уже трансформировал компанию под AI. Сидишь в «медленной» компании — отстаёшь
4️⃣ Команды сжались — один fullstack-инженер с AI делает работу пяти. VPE просто не нужен при команде из 4 человек
5️⃣ Fractional CTO выгоднее — зачем один работодатель, если можно работать с пятью параллельно?
6️⃣ AI-стартапы платят рядовым инженерам больше, чем обычные стартапы платят своим CTO. Математика не в пользу руководства
7️⃣ Выгорание — давление со всех сторон, нереалистичные ожидания, и ощущение что ты Дон Кихот


Роль инжиниринг менеджера в 2020 и в 2026 сейчас очень разные, и многие не хотят работать в таких условиях. Я полагаю сейчас вырастает новый тип руководителей, которым легче вариться в таких условиях.

Особенно хорошо написано про деньги - AI направления = больше денег у IC, чем у C уровня не AI. А еще лучше несколько fraction ролей (part time).

А как у вас ощущения?

4k 0 46 18 19

Недавно был интересный случай. Моя компания Rock Your Data попала в небольшой тендер на разработку хранилища данных.

Моим оппонентом была небольшая консалтинговая компания, которая решила предложить стартапу внедрить Microsoft Fabric + Power BI. Это была их фатальная ошибка.

А я предложил Snowflake + dbt (внутри Snowflake), Metabase BI (6$ за место в месяц) и оставить оркестрацию внутри Snowflake.

А самое главное — сказал, что сразу буду использовать Claude Code и сделаю для них фреймворк, где разработка будет на Claude, а их единственный аналитик-джун станет дата-инженером.

На картинке — изначальный план агентства.

Агентство, конечно, лукавило, когда говорило, что сделает им всё за небольшие деньги на Microsoft Fabric.

Решения Microsoft — для Enterprise-компаний, когда у вас есть несколько команд по 10 человек и вы можете позволить себе ничего не делать месяцами (создавать видимость работы).

4k 0 25 22 51

Оказывается GitHub переживает тяжелые времена. Я сам замечаю как мои простые jobs на расписание работают через раз.

Получается для critical pipelines GitHub все хуже.

А как у вас?

5.1k 0 12 22 19

🚀🚀🚀
📅 Сегодня в 19:00 по МСК будет вебинар про то, как агентный AI начинает менять привычный подход к BI и меняет бизнес-аналитику.

🎙 Спикеры: ребята из AI4BI.

Вебинар будет здесь (в канале) в онлайне

🔍 Описание:
Поговорим о том, как меняется сама работа с аналитикой: от ручных SQL-запросов и привычных дашбордов - к агентам, которые могут самостоятельно работать с данными, находить аномалии и помогать получать ответы быстрее.

Что разберем:

🔸 почему self-service BI не решил многие проблемы аналитики и куда сейчас движется Agentic BI

🔸 Open Source vs Enterprise: Vanna, DB-GPT, Superset - в сравнении с DataLens и Power BI

🔸 как может выглядеть агентный слой поверх Apache Superset + Trino + ClickHouse в закрытом контуре

🔸 реальный кейс внедрения в ритейле на 1500+ пользователей - логистика, склады, транспорт

🔸 экономика внедрения и окупаемость такого подхода на реальном кейсе

Думаю, особенно интересно будет тем, кто работает с BI, аналитическими платформами и AI-агентами или просто хочет понять, куда сейчас движется аналитика.

◼︎ Сегодня, 19:00 по Москве

Ссылки на ресурсы ребят:

🔗 Сайт → https://ai4bi.raftds.ru/
🔗 Канал → https://t.me/ai_archnadzor

🚀🚀🚀

#datalearn #Вебинар


Наверно посмотрели на SpaceX, OpenAI, Anthropic и решили, что надо побольше капитализацию.

А еще databricks купил Electric - агенты рулят!


Говорят навык кодить руками уже умирает. Писать код самому это уже недостаток. Понимать код, архитектуру и знать фундаментальные вещи это другое, которое необходимо. И теперь как-то надо это понимать и знать без hands-on опыта.

Молодежь, держись ☕️


Lakehouse для аналитиков и инженеров данных

Приглашаем изучить популярный подход построения хранилищ данных Data Lakehouse c разделенным Compute и Storage на основе Iceberg и Trino. 

В программе курса:
• Современная архитектура аналитических систем от DWH и Data Lake до Lakehouse с разделением Compute и Storage на базе Apache Iceberg и Trino
• Iceberg: управление файлами, снимками, каталогами, схемами изменений и очисткой. 
• Практическое использование Iceberg Catalog, работа с кластером Trino (на Kubernetes), подключение данных на S3 и выполнение SQL/ Python-запросов.
• Работа с Iceberg+Trinо на больших масштабах: сложные запросы к датасету TPC-DS (2.8 млрд строк), интеграция с DBT, Apache Airflow, оценка производительность систем. 
• Построение пайплайнов, инструменты  для корректной поддержки, обновления и масштабирования Lakehouse-инфраструктуры на уровне предприятия. 

Кто мы: R&D-центр Devhands, наш канал.

Автор курса — Алексей Белозерский, CDO в inSales (Сбер 2B), ex: VK Tech, М.Видео, Эльдорадо

🗓 Старт курса: 27 августа

Изучить программу и записаться можно здесь.

Ждём вас!

Реклама. ИП Рыбак А.А. ИНН 771407709607 Erid: 2VtzquZf5с8


В Lakehouse можно сколько угодно ускорять compute, но если S3 не успевает отдавать данные, вся платформа упрётся в storage.

18 августа на Data Meetup VK Tech будет хороший практический кейс Авито именно про это.

Их аналитическая платформа работает на Trino и Vertica поверх Hive-каталогов, данные хранятся в S3 на HDD. Один S3 кластер упёрся в предел масштабирования и 20 ГБайт/с на чтение.

Тогда команда взяла три кластера S3, стала распределять объекты каждой таблицы по хешу пути и использовала уже существующие HAProxy-сайдкары на compute-нодах как stateless-шардирующий прокси. В результате пиковую скорость чтения увеличили с 20 до 60 ГБайт/с без отдельного proxy layer.

Дмитрий Листвин из Авито расскажет, как они писали расширение HAProxy на Lua, реализовали ListObjects и DeleteObjects, какие проблемы получили при решардинге и как теперь эксплуатируют это решение.

Ещё будет доклад Павла Кутакова из VK Tech про архитектуру VK Data Platform гиперконвергентной дата-платформы на Kubernetes: управление СУБД и сервисами, отказоустойчивость, сеть, безопасность и наблюдаемость.

После докладов инженеры RWB и VK Tech разберут кейс подготовки сегментов для таргетинга на Trino и DataFusion. Затем обсудят Kubernetes, self-service-аналитику, подготовку платформ под AI-агентов и то, как AI меняет разработку дата-платформ.

После технической части — приятные напитки, пицца и можно будет обсудить всё это уже без слайдов.

18 августа, сбор в 17:30
Москва, БЦ «Скайлайт»
Онлайн тоже будет.

Регистрация 👉
https://vk.cc/d0fvdV?erid=2VtzqxS4LDR


Рост зарплат DE в Канаде, да и в мире. Раньше в Канаде средняя вилка была 140-160к, а теперь уже почти все вакансии до 200к (в год gross). И это за старшего инженера.

В США будет конечно выше и уже в usd.

Как дела с зарплатами в РФ и Европе?


Давно не слышал про хороший open source BI Metabase.

https://www.metabase.com/blog/security-update


Сегодня заценил новый skill от Claude. Как обычно Airflow Dag упал с ошибкой. Обычно я копирую ошибку в Claude Code и прошу его починить.

Но сегодня товарищ попробовал попросить Claude bot, и он сразу нашел проблему, владельца dag, source code изменения и тп. И сразу сделал PR.

Раньше мы такое делали как мини проект - запускали lambda, чтобы она все это делала и писала ответ и создавала PR. А теперь все из коробки.

7.5k 0 71 11 43
Показано 20 последних публикаций.