Это разве аналитика?


Гео и язык канала: Россия, Русский
Категория: Технологии


Привет, я Андрей @ab0xa, bi / de / java dev
Анализ данных и визуализация, интересные ссылки, вакансии, уроки, юмор) и личный опыт
Стек технологий Python, Java, SQL, Tableau, Knime, Yandex.Облако, Yandex DataLens

Связанные каналы  |  Похожие каналы

Гео и язык канала
Россия, Русский
Категория
Технологии
Статистика
Фильтр публикаций


Репост из: Инжиниринг Данных
Поделюсь своими ощущениями по использованию AI агентов. Этап эйфории прошёл.

Немножко поподробней про этот этап. У вас есть Claude Code и больше ни у кого его нет. У вас уже настроены MCP ко всем дата-сервисам и базам, и Claude делает за вас 100% работы. Любую задачу вы решаете мгновенно. Коллеги не понимают, что такое Claude Code, и все делают по старинке руками. На их фоне вы просто монстр производительности, даже можете менять и траблшутить Source Code.

Дальше компании начинают инвестировать в подписки Claude Code, и уже волей-неволей у всех появляется Claude. Ты им показываешь, как с ним работать и как всё работает. 2–3 месяца — и коллеги уже могут сами использовать MCP и делать PR через агентов.

Первый звоночек — обычно что-то вроде: «Ты слишком быстро всё сделал, и агент написал лабуду». То есть надо уже больше смотреть за агентом, всё перечитывать и перепроверять. Особенно сложно это делать, когда открыты несколько активных серий в разных репозиториях с серьёзными изменениями.

Также изначально Claude создавал код поверх кода, написанного руками. Этот код очень понятен, ведь ты его сам писал. Но спустя полгода код весь написан уже агентом, и мы уже на 100% зависимы от агента, ведь без него уже очень сложно разобраться, как там всё устроено и как это дело быстро подправить.

И теперь мы приходим к тому, что все одинаково умеют использовать агентов, друг другу проверяют PR, пишут огромные простыни текста — что починить, что исправить. То есть человек как proxy между общением агентов. 😄

Вся скорость и производительность выветриваются, и по факту вам надо больше и тяжелее работать. Если раньше вы работали на 120%, а команда лишь на 20%, то теперь это уже 115% на 120%, то есть в лучшем случае вы немного лучше, но какой ценой?!

Таким образом, мы пришли к тому, о чём говорили всегда: работы стало больше, задачи стали сложнее, а требования по скорости и качеству — выше. Я вижу на примерах, как растут аппетиты у VP-уровня, особенно когда они сами могут общаться с данными и находить инсайты. Они хотят больше и быстрее. У бизнеса теперь много идей, которые надо внедрить.

Да, даже элементарно — частота стендапов возросла до ежедневной, и уже не скажешь «я там ковыряю код», ведь за тебя агент может всё перековырять — сиди и читай, читатель-инженер.

Что будет дальше? А дальше требования будут расти. Даже от новичков будут требовать больше. Вам ведь думать не надо — за вас агент думает, поэтому просто сидите и общайтесь с ним, разбирайтесь. Задач будет больше, требований больше, свободного времени меньше. Людей однозначно нужно больше. Агенты ещё те шалунишки — нужен глаз да глаз за ними, а то положат продакшн. Это ещё не так критично в области data, а вот в customer-facing apps — там ещё сложнее.

Я спросил агента про известные концепции:

Jevons Paradox (Парадокс Джевонса)
Чем эффективнее технология, тем больше её потребляют. Производительность выросла → бизнес поднял планку → работы стало больше, а не меньше. Классика, описанная ещё в 19 веке применительно к паровым машинам.

Automation Bias
Склонность доверять автоматизированным системам больше, чем следует. Отсюда и «агент написал лабуду, но никто не заметил» — люди перестают критически проверять вывод системы.

Skill Atrophy / Deskilling
Деградация навыков из-за делегирования задач инструментам. Ты описал это точно: «код весь написан агентом, и без него уже сложно разобраться». Это активно обсуждается сейчас применительно к junior-разработчикам, которые никогда не научатся думать самостоятельно.

Productivity Paradox (Парадокс производительности)
Технологии растут, а реальная производительность и удовлетворённость сотрудников — не обязательно. Впервые описан в контексте IT-революции 80-90х годов (Solow Paradox).

Alert Fatigue / Review Fatigue
Когда объём вещей, требующих внимания, превышает когнитивные возможности человека. У тебя это — несколько открытых PR в разных репозиториях одновременно.

Shifting Bottleneck
Узкое место не исчезает, оно перемещается. Раньше бутылочное горлышко — написание кода. Теперь — ревью, понимание, верификация того, что написал агент.


Подробности вечернего сбоя в рунете

https://www.securitylab.ru/news/576203.php


Репост из: Tips AI | IT & AI
meat-proxy — человек который отправляет ответ ИИ вместо своей точки зрения

не будьте meat-proxy 😏

@tips_ai


Репост из: Data Дзен с Олегом Дмитриевым
Хочу проверить, как вы думаете. Держите дело 🕯

Из пятницы в пятницу вы читали, как я собираю это по кускам. Пора показать целиком.

DATA NOIR 🔥
Ночь, лампа, стол, папка с делом.
Вы осматриваете место преступления, ищете подозреваемых по приметам, допрашиваете, ловите на лжи, тянете нити между уликами на доске.
С миром дела вы говорите SQL-запросами. Но учить SQL вас никто не заставляет. Запрос это просто ключ под конкретную дверь.
сначала решаете, какую дверь открыть, и уже под неё ищете ключ

Правильной кнопки тут нет 🔎
Это приключение, где каждое решение вы принимаете лично.
Никто не подсветит нужную улику. Подозреваемые врут. Самый очевидный подозреваемый чаще всего и есть ловушка.
В деле про украденную пластинку первым под руку лезет богатый коллекционер. Мотив на поверхности, деньги есть, репутация так себе.
Проверьте его. Посмотрите, что будет ))

Явно верного пути нет. Есть ваша версия и факты, которые её либо держат, либо рассыпают. Ошиблись с обвинением, минус $10 с жетона и обратно к фактам.

Что за этим стоит 🛠
Полтора года заметок, потом сборка. Свет от лампы, доска с нитями, схема таблиц, переписанный онбординг, про каждое из этого я тут уже писал, по второму кругу не пойду.
Просто держите в голове, что стоит за этой картинкой.

Как зайти 🤔
https://data-noir.com/

Важно: сейчас портал открывается только через VPN. Включайте.
Начните с дела №0, это пробный обход. Там вас проведут за руку. Дальше уже сами.

Просьба, и она серьёзная 🙏
Проект живёт, пока в него играют.
Тот же онбординг я переделал только потому, что один человек сел за стол и честно сказал, где ему плохо. Сам я эти места уже не вижу, привык.
Так идея одного человека и превращается в коллективное решение. Но для этого нужны игроки.
Поделитесь проектом со всеми, с кем можно. Рабочий чат, личка, коллега, который любит задачки для мозга. Сейчас это та помощь, которая нужна больше всего.

А что не зашло, напишите в комментариях
👇
@data_dzen 🙂


😂😂😂😂😂


Репост из: Архитектор Данных
Цифры от которых бывает печально

смотрю на отчеты топ облачных компаний. За 2 квартал.

Azure - $100+ млрд/год. Рост +43% год-к-году.

AWS - $168 млрд/год ($42 млрд/квартал). Рост +27% год-к-году.

Для сравнения - топ облако в России - Яндекс Клауд показал $0.3 млрд в год. Примерно столько же, сколько Clickhouse Inc.

Российский рынок ИТ по оценке ТАдвайзера - 3,5 трлн рублей в год. Равно $45 млрд.

Капексы только двух компаний Azure + AWS за год - это больше чем потратили на российский ИТ за всю его историю.

Привет моему любимому типу заказчика российского облака: "Ну в Амазоне конечно же круче сделано, чем у вас!" Да чудо что мы смогли к AWS вообще хоть как-то приблизиться имея примерно 0,2% его ресурсов.


⚡️ Классика конфы SmartData: пайплайны, Kafka и качество данных

Пока все обсуждают LLM и агентов, кто-то должен собирать пайплайны, чинить брокеры и отвечать за то, чтобы данным можно было верить.

Мои друзья из JUG Ru Group осенью традиционно проводят конференцию SmartData. В этом сезоне она обновилась: в программе стало больше ML, LLMOps и ИИ. Но классический Data Engineering — то, за что многие ценят конференцию, — остается ее основой.

В карточках организаторы собрали для вас новые доклады про dbt, Kafka, структуры данных, Data Governance и Data Quality.

🗓23-24 сентября, Москва+онлайн

🔥Купить персональный билет со скидкой 15% по промокоду etoanalytica
можно — на сайте конференции.


Обычно аналитик приходит в готовый стек. А если стека нет?

В курсах и руководствах обычно предполагается, что дашборды уже есть, данные уже прилетают в хранилище, метрики уже согласованы. В реальности старший аналитик чаще получает противоположное: систему с историей, где логика размазана по коду, аналитического слоя нет вовсе, а продакт хочет цифру ко вторнику.

karpovꓸcourses собрали бесплатный интенсив «Как аналитику разобраться в сложном домене и влиять на бизнес-решения» — как раз про такую отправную точку. 
Разбор на кейсе Авиасейлс: технология комбинирования билетов, метрика на 10% ниже OKR (цели и ключевые результаты), понимания про причину — нет.

Разберем весь путь: как заходить в чужой домен, добывать данные, строить инструменты и в итоге двигать бизнес-показатель.

На интенсиве: 
- метод входа в незнакомую систему;
- декомпозиция сложной метрики; 
- перевод сырых данных в бизнес-инсайты; 
- инструменты, которые снимают поток ad hoc-запросов; — как связать аналитику с OKR.

Ведет Илья Шведов, старший аналитик Авиасейлс.

За регистрацию сразу приходит пак: путь аналитика от младшего специалиста к старшему, подборка по А/Б-тестам, материалы по статистике от Анатолия Карпова, «Нейросети для аналитика данных» и карта компетенций в DS (науке о данных).

Регистрируйтесь по ссылке — https://clc.to/erid_2W5zFH6RrTj 

Реклама. ООО «КАРПОВ КУРСЫ». ИНН 7811764627. erid: 2W5zFH6RrTj 


Lakehouse для аналитиков и инженеров данных

Приглашаем изучить популярный подход построения хранилищ данных Data Lakehouse c разделенным Compute и Storage на основе Iceberg и Trino. 

В программе курса:
• Современная архитектура аналитических систем от DWH и Data Lake до Lakehouse с разделением Compute и Storage на базе Apache Iceberg и Trino
• Iceberg: управление файлами, снимками, каталогами, схемами изменений и очисткой. 
• Практическое использование Iceberg Catalog, работа с кластером Trino (на Kubernetes), подключение данных на S3 и выполнение SQL/ Python-запросов.
• Работа с Iceberg+Trinо на больших масштабах: сложные запросы к датасету TPC-DS (2.8 млрд строк), интеграция с DBT, Apache Airflow, оценка производительность систем. 
• Построение пайплайнов, инструменты  для корректной поддержки, обновления и масштабирования Lakehouse-инфраструктуры на уровне предприятия. 

Кто мы: R&D-центр Devhands, наш канал.

Автор курса — Алексей Белозерский, CDO в inSales (Сбер 2B),
ex: VK Tech, М.Видео, Эльдорадо

🗓 Старт курса: 27 августа

Изучить программу и записаться можно здесь.

Ждём вас!

Реклама. ИП Рыбак А.А. ИНН 771407709607 Erid: 2VtzquZf5с8


Репост из: asisakov
Пять базированных вещей для тех, кто вкатывается в аналитику
Часть 2

Первая часть здесь, и там мы остановились на:

А что менеджеру-то отвечать, если он спросит про падение метрик?

4️⃣Умение объяснить результат

Возможно теперь это умение конкурировать с AI за экспертизу. Но еще это умение не городить сложные модели, которые никому не нужны. Давайте не будем строить космолеты с катбустом из 50 фич, когда достаточно просто таблички со скорами.

А давайте теперь представим, что бизнес просто сходил в ChatGPT и спросил что ему нужно напрямую. Ему отвечают быстро, красиво, правильно и уверенно. Почему бизнесу должно ждать именно нас?

А вот почему: потому что мы знаем контекст, данные, ограничения и подводные камни конкретно этого бизнеса и конкретно этих гипотез. Мы можем задать правильный вопрос до того, как начать строить модель. А ллмки пока работают с тем, что им дали. Наша же задача работать с тем, что происходит в реальности и возможно это не перенесешь в контекст модельки.

Умение слушать бизнес и переводить его вопросы в задачи AI не заменит еще достаточно долго

5️⃣Воспроизводимость

Мы обучили модель, получили 0.95 ROC-AUC. Через неделю пересчитали и стало 0.85. А в чем проблема? Ллмка говорит, что random_seed не был зафиксирован, а еще версия нампая обновилась.

А теперь добавим реальный рандом в пайплайн - промпты, апишки, генерацию рандома и фичей через модель. становится ли воспроизводимость сложнее? А что если модельку убрали на бэкенде провайдера, а потом через несколько недель вернули. А наш пайплайн уже все - дает другой результат. Мне кажется, что те люди, которые умеют строить воспроизводимые пайплайны с эйяем внутри будут иметь спрос сильно больше, чем на вес золота

Скажу базу - AI мощный инструмент в руках того, кто понимает суть и глубину вопроса

С другой стороны уже нет столько времени изучать большие материалы в сильно динамичном мире. Забудьте про roadmap'ы с миллиардами курсов. Берите проблемы и вопросы, которые вас реально беспокоят и на них практикуйте SQL, статистику, питоны. Сделайте из этого реальный проект, пиште код, который будет работает одинаково. Ну и собирайте команду единомышленников, чтобы взаимодействовать друг с другом.

Согласны? Надеюсь никого не напугал?

Кстати, можем попробовать собрать мини-комьюнити с таким движняком - с вас эмодзи или стикеры в комментариях. А с меня время на подумать

#ml #career #novice #softskills #llm #agents


Репост из: asisakov
Пять базированных вещей для тех, кто вкатывается в аналитику
Часть 1

Недавно разбирал резюме кандидатов на вакансию и в который раз заметил одни и те же шаблоны. Открываешь резюме, и там написаны все ключевые слова, супер проекты, несколько лет опыта в виде прохождения курсов, ну и скорее всего перед собесами выучены одни и те же источники с ответами на 100 самых известных вопросов. А потом откликаются на непростые вакансии с узкой направленностью и на первых же вопросах идет столкновение с бурмалдой реальностью.

Я решил поделиться с вами пятью вадными пунктами, без которых просто не выжить в этих датасаенсах, когда начнешь работать. Кстати, в последнее время наблюдается новый уровень этого явления, когда вообще нет желания что-то ботать, ведь AI сделает все лучше:

Зачем мне SQL/статистика/питончик - у меня есть ChatGPT, он все напишет

1️⃣SQL

Я уже писал об этом, и реально рекомендую начинать именно с SQL. Больше половины рабочего времени уходит на подготовку, обработку данных и приведение их в нормальный вид. SELECT, WHERE, JOIN, GROUP BY, оконные функции - это обычный базовый минимум.

И пусть ChatGPT напишет вам запрос и возможно он заработает с первого раза. Только как вы поймете, что он написал его правильно, если сами не знаете SQL? Я по долгу своей работы неоднократно видел кейсы, когда скармливаешь LLM весь контекст задачи, раздаешь тулы, доступы, апишки, и возможно даже на выходе получаю красивый запрос. Но блин есть вероятность, что он либо не отработает, либо выдаст не тот результат. Допустим из-за неправильного джойна или не выбора не той колонки из 5-ти похожих.

Ну и прикиньте, если кто-то из нас спокойно понес бы этот результат бизнесу, потому что проверить не хватило экспертизы

2️⃣Статистика

Описательная статистика, выборки, доверительные интервалы является еще одной из баз аналитика. Скорее всего на реальном проекте придется спорить с бизнесом о том, значима ли разница в метриках, и стоить ли катить серый тест. Я уверен, что аргументов у вас будет больше с развитым знанием статистики.

Проблема сейчас кстати есть и с другой стороны - теперь бизнес приходит с распечаткой из Клода и говорит: "Смотри бро, модель говорит, что разница значима, катим тест". Ну и в таких случаях точно нужно уметь объяснить, почему ллмка здесь могла ошибиться из-за отсутствия правильного контекста, и конечно предложить нормальный статистический тест.

Пока AI не сможет собирать весь контекст, он не заменит языка выводов в том смысле, в котором знаем его мы

3️⃣Реальный проект

Напомню, что в последнее время требования растут. При входе в профессию уже не хватит просто знаний Python и SQL. Нужен реальный и работающий проект, сделанный полноценно от формулировки задачи до крутых метрик и выводов. И скорее всего уже не Kaggle (только если не планируется там лутать медали). Реальный имеется в виду такой, где мы сами собирали данные, чистили пропуски, работали с дубликатами, обучали модель и тестировали гипотезы.

Хорошая новость - AI реально может ускорить рутину и написать весь этот код с чисткой данных, бейздайнами и пайплайнами, уже и предложит идеи по фичам. Плохая новость - если ты бездумно использовать ллмки как костыль с первого дня, ты возможно мы не на 100% погрузимся вглубь того, что сейчас происходит внутри проекта.

Как можно управлять процессом, которого не понимаешь? Что делать, если все поломалось и данных нет? Какой вариант правильный из трех предложенных агентом?

А что менеджеру-то отвечать, если он спросит про падение метрик?

Продолжение завтра...
А пока накидайте ваших мыслей в комментарии, что же там может быть еще?

#ml #career #novice #softskills #llm #agents


Репост из: Starrocks and modern data stack
Какой-то микс нынче в дата мире происходит

Сократят ли кожаных в пользу AI? Я тут погуглил. Мне кажется, что эти 2 компании умеют пользоваться иишкой как никто другой. Ну и чего, сократили там кого-нибудь? :)

С другой стороны не пользоваться сейчас таким инструментом кажется довольно глупой идеей. Не знаю как у вас, у нас в командах данных текучки более 50 процентов. Я больше 10 лет пишу код, около 5 лет в текущей компании. Писать очередной оператор в эйрфлоу, объяснять зафиксированные метрики в дбт в очередной раз? Увольте пусть ии ответит за меня.

И вот эта история с данными, мне кажется, подводит отделы данных к решению такой задачки, как создание "единого хранилища контекста", а моем понимании ai платформы в компании. Что все понимают под этими словами (и понимают ли) - большой вопрос. Есть ли какие-то устоявшиеся шаблоны или хотя бы примеры - нет. Можно ли угадать, куда пойдет развитие иишки - нет.

Именно поэтому это довольно клевая задача :)

Похоже, что StarRocks будет все меньше (хотя мы его и опробовали как хранилище векторов, и у меня для него лежит написание нативного CDC на гошке в беклоге), а больше будет всего подряд про современную техничку в офисе данных во всех ее ипостасях. Потому что никто не рассказаывает про графы для dbt, платформы агентов, тлен векторизации и как подсадить хотя бы 100 человек на свои скилы (оказалось, что писать mcp на гошке - кайф) :)

PS кстати dbx - тормозная штука с глюками интерфейса. И да, это тот момент, когда даже гуй на жабе быстрее.


Репост из: Инжиниринг Данных
MotherDuck сделали классный сервис для своего демо, который анализирует данные с LLM


📊 Глубокое погружение в профессиональные инструменты на реальных проектах. Записывайтесь на курс «Системный аналитик. Экспертный уровень».

🎁 Учавствуйте в 3 бесплатных вебинарах — познакомьтесь с программой обучения и преподавателями. Задайте свои вопросы экспертам!

6 августа, 20:00 мск — «Пользовательские сценарии (Use Cases) на реальном примере»: от бизнес-требования до задачи разработчику. Анализ требований, создание Use Cases, связь с разработкой, Q&A.

13 августа, 20:00 мск — «Управление данными в MSA»: цена ошибок дублирования данных, оптимизация инфраструктуры и выбор БД (SQL vs NoSQL), единый глоссарий и контракты данных без бюрократии, требования к качеству данных для ИИ, чтобы модели не «галлюцинировали».

20 августа, 20:00 мск — «Аналитическая дженга»: как проектировать и управлять изменениями системы через BACCM, (4+1) и C4, чтобы архитектура не рассыпалась.

Записывайтесь  https://clck.ru/3UzbGN

Реклама. ООО «Отус онлайн-образование», ОГРН 1177746618576, www.otus.ru, erid 2VtzqxhzotN


Репост из: Архитектор Данных
Где-то рядом с культом железки у нас живет культ героя.

Давайте представим 2 команды.

Команда А. 1-2 года делала качественный продукт. Он просто выкатывается в любого заказчика, без проблем интегрируется со всем что надо и дальше работает без косяков.

Команда Хэ. Сделала нечто, оно развалилось у заказчика в первый же день. И следующую неделю все Хэ не спали, не ели, а правили баги и решали все на свете проблемы на этапе деливери.

Какая из команд будет на хорошем счету у директоров? Кого похвалят на корпоративе? Кому дадут ресурсов на следующем этапе?

Прости, товарищ Генри Форд, но эффективность у нас не в почете, у нас в почете героизм вопреки всему. Особенно вопреки собственному многолетнему раздолбайству.


Репост из: Reveal the Data


Видео недоступно для предпросмотра
Смотреть в Telegram
Ребят, тут Авито регистрацию на свой первый CTF открыл с призами до 300 000 рублей на команду 📍

AvitoTech устраивает CTF онлайн с денежным призовым фондом, мерчем и интересными тасками!
Регистрация команд уже открыта по ссылке, а ниже собрали инфу, что предстоит делать во время HoneyBadger CTF AvitoTech.

Возьмите на себя роль медоеда, проверьте защиту пчелиного улья и найдите все скрытые уязвимости в сотах.
Чего ждать от турнира: тасков на веб-уязвимости, инфраструктурных мисконфигов, анализа скомпилированного кода, расследования инцидентов, слабостей шифров, всего, что требует хакерской смекалки. И розыгрыша мерча, помимо основного призового фонда.

Важно: CTF не только для спецов по кибербезопасности — есть отдельная лига для всех, кто любит разбираться, как устроены IT-системы 🐝


Репост из: Находки в опенсорсе
Внутри питона есть ЕЩЕ виртуальные машины

Мы все знаем, что сам питон - одна большая стековая виртуальная машина, которая выполняет опкоды. Их мы можем посмотреть через dis:


>>> import dis
>>> dis.dis('x + y')
0 RESUME 0

1 LOAD_NAME 0 (x)
LOAD_NAME 1 (y)
BINARY_OP 0 (+)
RETURN_VALUE


Можем получить список всех опкодов, можем вызвать их оптимизации и посмотреть на результат с оптимизациями.

Но! Внутри CPython есть и другие виртуальные машины. Сегодня поговорим про ту, которой все мы всегда пользовались, но не знали, что она - виртуальная машина.

pickle

Да, не удивляйтесь. Встроенный протокол сериализации в питоне работает благодаря отдельной стековой виртуальной машине. Давайте посмотрим.


>>> class User:
... def __init__(self, username: str, tags: list[str]) -> None:
... self.username = username
... self.tags = tags
... def __reduce__(self) -> tuple[type['User'], tuple[Any, ...]]:
... return (type(self), (self.username, self.tags))


Создадим обычный класс и запиклим его объект:


>>> import pickle
>>> user = User('sobolevn', tags=['python', 'tg'])
>>> pickle.dumps(user, protocol=0)
b'c__main__\nUser\np0\n(Vsobolevn\np1\n(lp2\nVpython\np3\naVtg\np4\natp5\nRp6\n.'


Обратите внимание, что в разных протоколах значение будет разное:


>>> pickle.dumps(user, protocol=1)
b'c__main__\nUser\nq\x00(X\x08\x00\x00\x00sobolevnq\x01]q\x02(X\x06\x00\x00\x00pythonq\x03X\x02\x00\x00\x00tgq\x04etq\x05Rq\x06.'


Всегда необходимо тестировать, что pickle работает для всех версий от 0 до pickle.HIGHEST_PROTOCOL для ваших объектов, которые поддерживают такой способ сериализации.

Что внутри?

Можно, глядя на значения, подумать, что там просто лежит какой-то бинарный формат сериалиации. Однако, там лежат опкоды виртуальной машины для сериалиации объектов. Их можно задисить:


>>> import pickletools
>>> pickletools.dis(pickle.dumps(user, protocol=1))
0: c GLOBAL '__main__ User'
15: q BINPUT 0
17: ( MARK
18: X BINUNICODE 'sobolevn'
31: q BINPUT 1
33: ] EMPTY_LIST
34: q BINPUT 2
36: ( MARK
37: X BINUNICODE 'python'
48: q BINPUT 3
50: X BINUNICODE 'tg'
57: q BINPUT 4
59: e APPENDS (MARK at 36)
60: t TUPLE (MARK at 17)
61: q BINPUT 5
63: R REDUCE
64: q BINPUT 6
66: . STOP
highest protocol among opcodes = 1


Сравните, как будет отличаться вывод для другого протокола, например пятого.

И окажется, что все "случайные" символы на самом деле просто так же обозначают опкоды. Теперь мы умеем их читать.

Мы можем найти все опкоды и посмотреть их доки:


>>> pickletools.opcodes[25].code
']'
>>> pickletools.opcodes[25].doc
'Push an empty list.'


И мы даже можем оптимизировать байткод pickle для более быстрой сериализации / десериализации.
Прям полностью настоящая ВМ :)

Вот за счет чего мы можем с помощью pickle сериализовать любой Python объект (почти), а с помощью других средств - получается сильно сложнее.

Обсуждение: Знали о такой детали реализации? Знаете ли вы как работает pickle сам по себе? Зачем нужны протоколы и версии? Или сделать отдельный пост про детали работы? Знаете ли вы, что pickle - фундаментально небезопасный протокол? И нельзя запускать чужие дампы, только свои доверенные?

Загадка: кстати, какие еще виртуальные машины внутри CPython вы знаете? Я назвал только одну из нескольких. Заходите в комменты за ответами, правильные - покажу завтра.


Присаживайся на диван к аналитикам Авито 👀

Команда AvitoTech запустила проект «Диванная аналитика». Это серия материалов, где специалисты из Авито рассказывают, как принимают решения в одной из крупнейших экосистем страны.

Если ты работаешь с данными, то вот 3 причины зайти на лендинг прямо сейчас:

1️⃣ Все выпуски опираются на реальный опыт — аналитики рассказывают о том, что уже применили у себя и что сработало.
2️⃣ Царит приятная атмосфера: по сути, все видео — это недушные мини-лекции с наглядной презентацией.
3️⃣ Разбираются разные темы — от ML до стратегического планирования.

Контент может пригодиться опытным аналитикам и менеджерам, которым надо говорить с командой на одном языке.

Смотри готовые выпуски и подпишись на новые — телеграм-бот пришлёт уведомление о новом видео!

Посмотреть, что там интересного


Репост из: Starrocks and modern data stack
DBX

Так ли уж много надо для счастья на сегодняшний день? Полный бак бензина, хороший велик и... Чтобы хоть одна sql-ide показывала миллисекунды для datetime колонок в StarRocks!

Я очень люблю сообщества и неформальное общение. Там порой случайно можно узнать что-то интересное, способное поменять твои привычки в работе и сделать картинку вокруг чуточку лучше.

И вот недавно думали тряхнуть стариной и провести новый DBT митап с Алмазом, и он случайно обронил в разговоре dbx. Выглядит интересно, пошел смотреть что это такое.

Да, вся IDE поместилась в 15 мегабайт с поддержкой почти всех бд, которые сейчас есть на рынке. Но эти 15 мегабайт, конечно же, не включают в себя JDBC драйвера для вертики или хайва, например. А вот StarRocks включен в поставку по умолчанию. И то, с чем не справились ни JB с их убер зоопарком, ни DBeaver с аналогом - вот на скриншоте сверху.

А еще в DBX на маке работает cmd+enter для выполнения запросов, что благополучно сломали уже год как в DBeaver.

А еще там есть MCP для всех ваших коннектов и готовое how-to интеграция с курсором и клодом (и остальными). Который впрочем не работает на маках с арм :)

И еще рендеринг тупит и если быстро листать виртуальные столы - то видишь белый экран примерно пару секунд после перехода.

Но ладно, за миллисекунды и хоткеи все можно простить. Теперь это мой топчик. Спасибо, Алмаз :)

Показано 20 последних публикаций.