Data Nature 🕊


Kanal geosi va tili: Rossiya, Ruscha


Канал о жизни BI аналитики и инфо-дизайна в корп реалиях с фокусом на работающих практиках управления.
Веду как летопись полезного для себя и людей с такими же неврозами.
александр бараков @alexbarakov
datanature.ru
data-nature.com
(рекламу не размещаю)

Bog‘liq kanallar  |  O‘xshash kanallar

Kanal geosi va tili
Rossiya, Ruscha
Statistika
Postlar filtri


День на BigDataLND: Слово trust стало ругательным (см фото). Этому миру явно не хватает доверия.

Как обычно:
Заголовки сессий классные. Выступления компаний слабые. Выступления вендоров - маркетинговый пиздеж оверпромис. Разговоры на стендах с технарями - огонек.

Кратко по BI продуктам:
- Много новых, но hex по продуманности и сбалансированности с отрывом впереди, thoughtspot, sigma, omni - слабее. У хекса четкие усиления в виде context studio с кабинетом для эвалов.
- New-BI выходцев из табло - скатываются в жалость. thoughtspot ничего не знают про контекст и повторяют про своего одного (карл!) агента который типа решит все проблемы. golden analytics на любой сложный вопрос - показывали как появляется график в чате и ждали восторг.
- Порадовал.. кликхаус. В их клауде уже дофига всего. Они купили langhuse и librachat. Им добавить etl и семантик и будет датабрикс c православным лицом.

Самое интересное
это границы продуктов - кто как решает для себя
- как и в каком объеме делать у себя семантик слой или ставить на интеграцию (dbt, cube, snowflake, db)
- как и в каком объеме делать у себя контекст менеджмент.
Полный месс )

Укрепил выводы для своей работы:
- Деши должны стать частью тулов, перестать быть чьей то задачей
- Нужен некст левел AI обзервабилити для доменов
- Нужно ужесточить нашу ai-ready модель.
- Все остальное делаем правильно

Отлично погрустили с Денисом из CDO Club и Максом Ивановым.


Бегство от ИИ занесло на остров Скай.
Завтракаю в этой глуши перед алко-хайкингом (это когда хочется и по горам и по виски угореть, а времени мало) - две британские пенсионерки за соседним столом со знанием дела обсуждают секьюрити инциденты с Gemini у себя в компании.

Раз побег в полной мере не удался, дописываю пост с рефлексией про builder команды, тему волнующую нас в Авито:

Тех компаниям по сути в ии трансформации главное, чтобы фичи катились в прод быстрее.

2025-й: на AI все смотрели как усилителя ролей. Каждый на своём месте делает больше и быстрее. аналитик - ресерчи и отчеты, инженер - код.
Но все уперлось в коммуникации: оказалось на длинной фабрике фичей 10+ межролевых стыков, и ускорение каждого этапа по отдельности не сокращает общую длительность. Эффективности на каждом этапе стало больше, но до прода фичей доезжает +-столько же.

2026-й: на AI начали смотреть как T-shape фактор. Раз узкое место - стыки, уберём стыки: сблендим роли и сократим их число на главном пути от гипотезы до раскатки. Появились термины builder-команды и продуктовых инженеров (основные кандидаты в них - продакты, аналитики и тех)

По теме
- расследование Reuters про Project OT в Мете
- доклад Саши Лукьянченко про AI в разработке в Авито
- подкаст с Сашей Поломодовым про AI в разработке в Т-Банке.

Мета ушла дальше всех. Project OT: команда из 10–20 человек (инженер, QA, продукт, дизайнер, DS, UX, аналитик, data engineer) схлопывается в 3–5 «билдеров» + 1 direction lead. Специалисты вынесены в общий пул. Слой миддл-менеджмента срезается. Через полгода:
- изменений кода +220% год к году,
- фич, доехавших до пользователей +36%,
- крупных инцидентов +40%,
- времени на их тушение +70%.

Пилоты показывают проблемы. И много

1. Качество гейтов и скиллов пока низкое. Агенты совершают «масштабные разрушительные действия, которые человек вряд ли бы совершил». Получилась автоматизация с потерей контроля. Дали билдеру катить в прод без ревью (или с лайт гейтом) - подняли личный риск сотрудника, не подняв полномочий и компенсации.

2. Замеряются метрики потока (ttm и инкременты), а просаживаются метрики накопления долга рядом с потоком.
Мета оптимизировала поток, но получила +40% инцидентов и +70% firefighting. Лаг для деградации кодовой базы может быть более отсроченным. Тем дороже откатиться.

3. Discovery - новый боттлнек. Если процесс discovery не менялся, то ускорение раскатки фичей вытягивает задачи из нижней части беклога. Полезность убывает, будут делаться nice to have вещи. Cэкономленное время в эффект не конвертируется - работа как газ занимает всё доступное время. Нужно генерировать больше полезных гипотез.

4. Bus-factor усиливается. Уход такого продуктового инженера сильно болезненнее специализированных ролей. Как и онбординг и обучение.

Общий вывод - нужно качать качество скиллов и гейтов. Проверки безопасности, надёжности, данных, юристов, бренда, комплаенса и проч нужно зашивать в проверки в цикле разработки. Это тупо сложно.
Но сделанные инвестиции в ИИ пушат менеджмент ускоряться.
Биай в этом шторме, как ни странно, кажется засекьюрен - разработка дешей переходит в курирование контекста, семантики и датаскиллов для обеспечения аналитических джобов.

Кто дочитал до конца - для вас детокс-фото из шотландии.
Еще пост Маши про анальные пробки в визуализации данных.
Отдыхайте от ИИ новостей, расслабляйтесь.


Когда AI-гонка и корп-политика подзаёбывает — люди делают настолки.

Все же играли в Codenames?
Сделал с клодексом по ее мотивам — Data Bingo, бесплатную онлайн-версию про профессиональный жаргон.

Мы в миллениальских командах играли в такое в офлайне и пытались утащить в удалёнку. Сейчас все команды распределённые и в офис ходить разучились. Не хватает чего-то человеческого.

При запуске игры выбираешь
- Колоды: Data Governance, BI, Data Analytics, Product Analytics, Agentic Analytics, ML/DS, Data Visualization, Дата-инженерия, Системный анализ. Плюс классическая колода обычных слов, если хочется просто поиграть.
- Уровень сложности: базовый, профессиональный, продвинутый

Наборы и уровни складываются. Можно смешать BI с обычными словами и играть расслабленно. А можно собрать поле только из третьего уровня Agentic Analytics и смотреть, как команда страдает.

Наведёшь на карточку — всплывает определение термина (их там под 1000). Побочный полезный эффект: ньюкамер узнаёт ваши термины вместо онбординга, одни роли узнают больше про жаргон и работу других ролей. Гипотеза - что игроки будут объяснять слова друг другу, переопыляться.

Никакой регистрации: Создал комнату → кинул ссылку/код коллегам. Всё. Заходите в зум и тусите под чаек.
Нужно минимум 4 человека: по капитану и игроку в каждую команду.

Ссылка на игровой сервер

Кто в теме - потестируйте и напишите фидбек, как оно.
У меня работает)
Вообще идеально раз в месяц иметь в команде вечерний game hour. Надо же беречь кукушку - и свою и командную. По коллежски.

Сервис на моей виртуальной машине.
Никаких перс данных не собираю и не храню.

Можно допилить под свои словари и внутренние мемы, будет прикольнее.
Кому интересно - пишите, пошарю репу.

1,5 года назад думали над дата играми, но так и не случилось. Сейчас 2 вечера и рабочая версия.. мда


Агенты по сборке роудмапов/стратегий по BI(+AI) и DG для самоконсалтинга

Запек тут материалы и транскрибации своих курсов и миро-досок в репозиторий со скиллами.

- https://github.com/alexbarakov/DG-strategy-self-consulting-agent-ru
- https://github.com/alexbarakov/BI-strategy-self-consulting-agent-ru

Здесь (как впрочем и везде) нет магии и автопилота. Это скорее подспорье и ускоритель.

Можно сейчас без всяких доп скиллов скормить информацию про свою команду/продукт/функцию в модель и получить кучу условно-релевантного текста.
Моя попытка про повысить пользу - убрать навес общих концепций, бюрократии и булшита, фантазирования в духе за все хорошее.

Полученные агенты имеют в себе
- адекватные на мой взгляд атомы методологий,
- движок задавания правильных вопросов,
- генертаор инициатив на базе as is анализа, с учетом специфики и с ограничителями на булшит,
- ревью скептичным CDO судьей.
Где данных нет, скилл пишет [не хватает данных] и какого замера не хватает.
В итоге дает результат в емком формате 6 (условно) страниц.

Три режима
FORM — собрать стратегию с нуля: интервью, диагностика зрелости, документ
AUDIT — прожарить то, что уже написано
CONSULT — спросить, разобрать свой кейс

Результаты моих тестов сдержанно положительные. Как минимум любопытно). С напильником можно получить в целом заземленный драфт. Голденсеты для оценки качества я пока не добил, задачка нетривиальная. А генерить эвалы на вымышленных компаниях не супер эффективно.
Если развивать, то уже на базе проревьюинных реальных примеров стратегий для индустрий (банк, тех, ритейл, ...)

В общем, ставите себе, прогоняете на своей компании, делитесь фидбеком. Без сверхожиданий.

Как поставить: просто дайте своему клодексу ссылку и попросите поставить, перезапуститесь. No brainer
Посмотреть без установки: В репе - есть html/md с прогонами на вымышленных компаниях.
Как помочь: прогоните FORM на своей компании — в лайт-режиме это минут пятнадцать. Напишите, что получилось и где скилл соврал нафантазировал (или упакуйте и пришлите трейсы).


Наблюдаю за тем, как копится раздражение от ИИ контента. У себя и коллег-менеджеров.

Получаешь презу, html лонгрид с графиками, конфлю документ с признаками генерации - и делаешь усилие чтобы не закрыть сразу.
Потом спрашиваешь автора - сколько итераций ревью было, насколько вычитано.

И сам, когда шаришь что то - добавляешь, что цифры и текст детально проверил. Или (извиняясь) проверил но.. бегло. Дескать экпресс анализ.

Когда большая часть интеллектуального контента превратилась в коммодити, стало важно сколько в нем человека. Не в смысле авторства, а насколько кто-то может за него пояснить, взять ответственность, принять или рекомендовать решение/действие. Иначе бесит.

ИИ щедр на буквы, замыливание незначимым значимого, правдоподобные ошибки - и нужна общая инфо-гигиена, zero bullshit policy, иначе это все выжигает ресурс смотрящего.

Ничего особо странного.
Но забавно.
Одной рукой пушим и множим, другой отгораживаемся.


Semantic Layer все понимают по-разному.
Кто-то помнит про LookML, другой работал с dbt metrics, третий шарит за cube.dev, atscale и другие семантические платформы.

В России Semantic Layer принято рисовать в стратегии, но в итоге вечно двигать на будущее. Нет очевидных решений в рынке и слишком много легаси под дешами нужно перелопатить. Да и ущерб от отсутствия был прямо скажем приемлемым. Так было до новой волны инвестиций в ИИ.

Пообщались на прошлой неделе с Artyom Keydunov (CEO того самого сube.dev) о том, как концепция семантик слоя для унификации метрик для дешей сменилась на семантик для агентов. Мысли со встречи:

1. Семантический движок и Runtime и становится самым важным компонентом
Сложность уже не в унификации метрик, а в их исполнении.
Runtime преобразует бизнес-запрос в план выполнения +security, governance, RLS.
А Execution Engine - решает:
Что материализовать?
Что считать на лету?
Когда создать новый агрегат?
Когда удалить старый?
Как не материализовать всё подряд?

Материализовывать под каждый нужный разрез — не вариант.
Если не материализовать ничего - дорогой Runtime.
Вопрос как научить движок выбирать стратегию исполнения — ключевой.

2. Text-to-SQL → Text-to-Semantic. Архитектура, где агент каждый раз пишет SQL, дает хуже точность, стоит дороже. В идеале спрашиваем "Дай Revenue по Country" - а Runtime уже знает: где данные; какие join, grain, формула.

3. Cube больше не считает BI своим основным рынком
Раньше Semantic Layer был для Tableau, Power BI и других BI-инструментов. Но это уже не очень хороший бизнес. BI вендоры стремительно теряют клиентов и рынок. Теперь AI-агенты будут напрямую consum'ить Semantic Layer.

Уже просматривается следующий уровень, когда не человек будет спрашивать данные, а Product Agent, Marketing Agent, Experiment Agent.
То есть вопрос не «как человек получает инсайт», а «как агент получает доверенную метрику».

4. Никто не знает, какие комбинации интерфейсов победят: Claude/codex Desktop, MCP, CLI, Skillhubs, свои дата порталы или чаты в корпмесенджерах. Поэтому Cube развивает все и идет в Ассистентский UI. Главный конкурент в мире не dbt, а Snowflake и Databricks.

——————-

Короче сегмент Semantic Layer пришел в движение.
Можно сказать, что он разделился на Semantic Editor (про заведение и управление metrics + dims + filters = SQL) и Semantic runtime & engine (про то, как выполнять запросы и материализовывать).
Есть хорошая статья Насти Остапенко про эти типы.

В России нет решений этого уровня (или есть?). То, что есть пока ориентированы на старую модель работы с BI. Есть движение в эту сторону: Trisigma Авито, Datalens Яндекса. Есть mvp решений, типа dataforge от питерских ребят.
Помогите продолжить список.

Кажется самое интересное в AI сейчас происходит не вокруг моделей, а вокруг инфраструктуры и архитектуры для них.


AI не готовность - пост о том, как препарируем доменные данные и контекст в Авито

Антропик напомнил всем кто забыл, что Text2sql бесполезен, если он не шарит в данных домена. Мы догадывались.
Одна из тестируемых тут идей - AI-ready score в целях тимлидов доменов.

Это булевые проверки условно трех групп:

- Роли и в домене (BI-партнёр, Куратор метрик, AI-чемпион). Скучный компонент, но без гавернанс-людей никак;

- Разметка каноничных объектов. Смотрим, что доля трафика через сертифицированные здоровые витрины, деши и метрики не ниже таргета.

- База знаний домена - 11 типов контекста в репозитории: FAQ, глоссарий, lineage, примеры text2sql, eval-кейсы, деревья метрик и др.
Генерация этого контекста - это тоже скилл, встроенный в работу - решил задачу -> закинул агентом PR в базу контекста. Автогенерённые объекты засчитываются только после ревью.

Всё это пока про покрытие.
Качество сразу после: golden sets по типовым задачам + трейсы от AI-дежурных дают базу для тюнинга.
Будет понято, какие эвалы фейк, какие знания - балласт.

AI-дежурные и ассистенты это морковка спереди, рост доли их успешно отвеченных эдхоков в чатах - мотивация вкладываться дальше в контекст.

Замеры в этой части пошарю позднее.

Если интересно включится - все еще есть вакансии в BI

#АвитоBI


пхахахах, картинка угар, сори, не мог не запостить 🤨

🎙Через месяц проведем программу «Разработка BI+AI стратегии» — ежегодные живые воркшопы для BI/Data лидеров.
📅 5–28 августа • 11 дней по 2,5 часа в 18.00

AI-стратегии сейчас писать не лучшее время — никто не понимает ничего, кроме вектора и горизонта пары месяцев. Но и развивать BI без ИИ нет смысла.
Тот случай, когда программа нужна мне самому. Нужно обстучать весь этот поток гипотез, переопылиться.

Старые темы теперь с "ИИ":
– Self-Service, Reporting Factory и теперь Agentic BI: что ИИ каннибализирует, а где сертифицированный репортинг остается;
– Карго-культы в AI: самолёты летающие и соломенные «AI-ассистенты»;
– Data и content management: сертификация, health score, архивация — как не утонуть в собственных витринах и отчётах c приходом AI-слопа;
– Почему text-to-SQL демо работает, а в проде врёт — и причём тут semantic layer, core-витрины и доменный контекст;
– Вайбкодинг в BI-команде: почему это уже обязательный тулинг и «как знать меру»;
– Core слой витрин как «здоровое питание» AI-аналитика вместо фастфуда из 6000 витрин низкого качества;
– Дата-каталоги и глоссарии наконец взлетят — но не для людей, а для AI-агентов;
– Метрики BI и какие новые шансы посчитать таки time-to-insight, Saved FTE и проч

Все это и прочее в режиме живых обсуждений, разборов кейсов друг друга — участников и топ-компаний. Апдейт контента примерно 50% vs прошлый год.
Заходите. Мест немного.

👉 https://biconsult.ru/bi-strategy-barakov


Насмотренность на гавернанс данных дает мрачный образ будущего для гавернанса контекста.

Сегодня в тех компаниях строятся планы:
Соберем весь контекст, свяжем все знания компании в context/knowledge graph. Сделаем AI понимающим бизнес.

Десять лет назад примерно так же выглядели обещания от Data Governance:
Соберем все метаданные. Построим каталог. Назначим владельцев. Опишем определения. Наступит порядок.

Пока у меня есть только вопросы и гипотезы.

Делюсь чтобы собрать мнений.

1. Больше контекста = выше качество AI?
В кейсе Anthropic агент получил доступ к большому корпусу SQL, дашбордов и аналитических артефактов. Качество почти не выросло.
Во многих ошибочных ответах нужная информация находилась внутри доступного корпуса. Проблема была в выборе правильной сущности.
Ценность создавал не объем контекста, а уменьшение пространства выбора.

Большая часть рынка сегодня инвестирует в: knowledge graph; semantic layer; metadata; context. Anthropic пишет что после определенного уровня зрелости дополнительные знания дают меньший эффект, чем качественные процедуры, зашитые в skills: какие источники когда использовать, в каком порядке, с какими проверками и уточнениями.

2. Можно ли через AI собирать, создавать, валидировать контекст Компании?

DataHub исходит, что значительная часть контекста уже существует, просто разбросана по системам. Тут AI явно может помочь с Context Mining — поиском отсутствующего контекста.

Anthropic говорит, что самого важного слоя - бизнес-контекста - в системах нет: почему метрика считается именно так; почему существует исключение; почему доверяют именно этому источнику; почему было принято именно такое решение.
Такой контекст нужно создавать человеку.

Распределенная ответственность за валидацию контекста выглядит одним из главных рисков. То, из-за чего не взлетает DG — человеческий фактор.
Тут AI уже умеет:
находить противоречия;
находить устаревший контекст;
выявлять пробелы;
сравнивать версии;
запускать проверки, evals.

Возможно, мы движемся от модели: AI → Human → Approved
к модели: AI → AI Review → Human для конфликтов.
Но не факт.

3. Что вообще тащить в Context Layer?

На первый взгляд хочется построить новую систему и собрать туда все.
Сделать еще одну устаревающую копию реальности.
Кажется, Context Layer не должен управлять контекстом.
Скорее собирать связи о разном контексте из мастер-систем без дублирования (накидал матрицу на фото)

...и добавлять критичную инфу про:
Trust;
Certification;
Freshness;
Canonicality;
Completeness.

4. Кто такой Context Engineer?

Если контекст становится стратегическим активом, кто-то им должен управлять.
«Context engineering» расщепляется на две роли:
(1) Context Engineer — собирает контекст под конкретного агента: skills, retrieval, tools, evals. Чинит ошибки. Ближе к Analytics Engineer / BI.
(2) Context manager — роль а не позиция. владеет доменным слоем контекста. Эволюция Data Governance / Steward роли.

Откуда только этим людям взять capacity на это? Другие задачи никто не снимал. А эффективность от AI массово не наступила.


Эфир Visiology Cortex про их next gen BI прототип вызвал тут обсуждение в закрытых чатах и резонирует с тем, как мы строим свой BI тулинг в Авито.

Начну с предложения всем посмотреть, Иван с командой хорошо копает в продуктовые гипотезы, дает часто независимую аналитику. Ищут новые сценарии в BI и делятся.

Кто посмотрел - давайте обсудим (тут нет правильных ответов).
Закину свои мысли подробнее, с переходом в душноту:

15:05 Иван начал с того, что разложил базу про основные AI+BI группы юзкейсов. Тут все по делу:
- вайбкодинг в BI стоит своих токенов, годится для ресерча, прототипа, администрирования, но для прода все еще много правдоподобно ошибается, требует реворка/ревью. Ценность межуется с потерями. Всем пробовать.
- чат с базой данных (Text2SQL) работает, но точность сильно зависит от семантического слоя и системы управления контекстом, которые никто в реальной жизни (пока) не построил.
- ИИ помощники в BI, тупо полезные встроенные тулы, которые где то сильно (код), где то не сильно (визуал) ускоряют разработчика.

Потом начинается демо.
Красивое вендорское демо - смелое, с предположениями, иногда далекими от жизни:

32:19 cortex визы, новое поколение self service аналитики в понимании visiology.

Вопрос - почему юзера с бизнес-вопросом отправляют конструировать (пусть и с агентом) подключение? В это пойдет casual explorer а их обычно 5-7%. Кажется правильнее исходить, что качественные сорсы/квери уже размечены для агента аналитиками/BI. Наоборот надо предотвращать тут создание новых сорсов, коннектов неаналитиком.
Первый кусочек продуктового легаси и идеализма. Из области для атоса (юзера) это слишком много, для графа де ла фер (биайщика) слишком мало.

- Далее флоу ведет к генерации метрик.

Первый вопрос зачем их давать так свободно генерить, а не брать из сертифицированного стора ? (риск утраты так долго выстраиваемой версии блять правды)

Второй вопрос - как решена в генерации проблема правдоподобных и скрытых ошибок в логике? Ребята стильно обошли семантического слона в комнате, о котором вели речь в начале ролика.

Третий вопрос — зачем генерить визы и заставлять в них вникать, когда можно сразу ответить на вопрос.
При этом выдача набора виджетов фактоида, с динамикой и основными разрезами сама по себе хорошая фича. Но кажется нужна по спец запросу или уже для креатора.

- Потом клац - на этом "сорсе" с "метриками" селфсервис юзер создал "деш". Тот же наброс — пушим в старое, не? Такое осядет мусором на сервере. Если только в личный сендбокс без шаринга если приспичило.

Сама по себе генерация дешей на базовом виздвижке и доработкой стандартными средствами — это хорошо. Но мы в Авито вероятно от этого пока откажется - слишком дорого, оставим агенту весь JS и не будем мучить всех сборкой дешей на бедной drag-n-drop библиотеке чартов. С UI чата - ожидание от неаналитика в создание визов руками уходит, а профики будут ваять с агентом на JS.

- Короче не хватило встроенного гавернанса - иначе ai-driven серфсервис это немного про обезьяну с грантатой - засрет все BI-слопом и положит dwh кверями.

43:53 - Аватар. Не до конца понял. Пока выглядит как простой rules-based алертинг. Проблема всех алертов была и останется
- в массовом false positive срабатывании чекеров. Поэтому все дайджесты инсайтов в итоге или отключают или пускают через проверку кожаным.
- в плохом выявлении причин событий автоматикой. Тут возврат к системе управления контекстом + агенты судьи. Без этого все тлен (с этим впрочем возможно тоже)).

47:07 - Лаборатория - норм, переупаковка Клода в контуре BI системы. Вопрос - зачем отдельный чат в cortex визы, тут есть mcp dwh/BI и можно его сделать стартовым для ss. Плюс его в мессенджер высадить.
Каждая 10-я цифра будет фейком, но для self service может и норм.

«Не могли этого не сделать. Must have для BI системы»

Звучит как продуктовые чемоданы без ручек, которые стоит бросить, раз уже делаем next gen.

А вообще крутые эксперименты.
Диалог с чатом в левой части экрана а не в шторке справа — значит все серьезно. AI-first.

Понимаю что пост — душнота страшная, но таков путь. Актуалочка.
Visiology Cortex LIVE 3.06
Сortex live 3.06 — большое программное BI-событие Visiology открывает следующий этап BI: куда движется рынок, кто его ведёт и какие решения определят ближайшие годы. Когда: 3 июня 2026, 16:00 МСК Где: МШУ Сколково · «Сингапур» + онлайн-трансляция Переворачиваем подход к работе с BI Как ИИ меняет..


Простой тест: спроси коллегу, кто у вас в компании самый сильный BI. Если назвали тебя — пора откликаться на вакансии в Авито.

Если серьёзно — мы ищем несколько сильных BI на senior и middle.

Нам важно:
— Автономность и самоменеджмент. Не разжевываем.
— End-to-end. Берешь проблему бизнеса и деливеришь результат.
— Диапазон. Свободно ходишь от кода и системного анализа к бизнес-логике и визуалу. И обратно.

Что получишь кроме зп: масштаб проектов, сильное BI-комьюнити и стек с AI блекджеком.
Откликаться мне в личку @alexbarakov или на сайте.
Синьорной позиции нет на сайте, но она есть.

Больше про BI в Авито — по тегу #АвитоBI и в наших каналах.


AI-first data-cтратегии сейчас писать не лучшее время. Никто не понимает ничего кроме вектора.

Для себя сделал компромиссный сценарий для ориентира.
В основе - и наш опыт в Авито и наблюдения/разговоры с мировым техом.
Сценарий на 100% неточен и завтра устареет.
Но мыслей много и надо записать, что есть "на сейчас":

1. Измеримого эффекта сейчас нет никакого. Пока. Большинство жжет токены, получает локальные эффекты, но не масштабирует пилоты. AI добавляют в устоявшиеся процессы. И AI усложняет систему и вносит в процессы хаос. Без новой AI-native инфраструктуры и процессов идет деградация качества, боттлнеки в review, затраты на реворк, блоки с персдатой. Нужен переход к новой модели работы "AI генерирует - человек проверяет", а это очень дорогая и требовательная система.

2. Изменения в BI понятны примерно (см прикидка на картинке)
В пропорции задач будет падать доля разработки BI дашбордов и витрин, доля ad-hoc.
Расти: разработка core моделей данных, semantic layer и governance.
Новый класс задач - создание и поддержка агентных систем.

Экономия будет, но ограниченная и неравномерная и не сразу.
Суммарный extra capacity пусть будет: ~ +0.3– 0.6 FTE на 1 BI разработчика к 28 году. И это скорее бесткейс - частичное ускорение отдельных задач с сильной зависимостью от роста зрелости.

Реально есть ускорение - в создании витрин, пайплайнов, написании кода, создании чекеров и документации, ресерчах.
Причем больше AI ≠ лучше результат. В разработке оптимум ~30–50% AI-кода (не только наше ощущение). Дальше растёт число ошибок. Похоже это не временное ограничение, а некий предел.

Ускорение компенсируется новым оверхедом: human-review, коммуникации с бизнесом, debugging, governance.
С дешами тоже пока рано говорить об ускорении. С BI MCP АI делает норм визы, но для продовых дешей объем реворка сопоставим с ускорением. Вот количество задач упадет - AI based apps заменят те деши, которые делались под разовую аналитическую задачу.

3. Синьоры вайбкодят лучше, получают больше эффекта (не только наш вывод). Новый подход повышает плотность решений и требует высокой итеративности и разборчивости и аутпутам, чтобы получить продовой результат. Мидлы чаще останавливаются и принимают результат ниже качеством, пропускают ошибки. Вайбкодинг нужен таки как отдельных хард (или софт, пофиг).

4. Самый большой эффект — не в ускорении, а в новых до этого не решавшихся задачах: считать 100% вместо 10%, проверять всё, а не выборку, документировать всё, а не частично. То, что раньше не делали из-за ресурса.

5. Главные пререквизиты — semantic layer (как слой метрик и разрезов), trusted сore слой витрин под ним (включая логическую и концептуальную модель) и доменная база знаний сверху (фьюшоты). Без них: text-to-SQL угадывает, делает правдоподобные ошибки, генерит rework, теряется построенная годами консистентность метрик и доверие пользователей.

6. Governance остается и становится важнее.
AI ускоряет генерацию и валидацию меты, но не помогает с принятием решений, ответственностью. Human-in-the-loop остаётся. Плюсом AI увеличивает объемы контента, генерит AI slop, что требует большего ресурса на его разбор (сертификацию и архивацию). Добавляется гавернанс контекста и скиллов.

7. Основные "стены" в которые все врезаются: bottleneck в review, рост ошибок при росте доли AI-контента, низкий эффект из за недобора в governance, semantic layer, графах знаний и контекста.

8. «Как в любой масштабной трансформации - будущее наступает неравномерно».
Если в вашей компании нет волны вайбкода вы вероятно не видите, как сильно меняется профессия работы с данными.
Но переживать не имеет смысла, ведь это вне нашего контроля.
Можно включаться активнее, можно пока спокойно заниматься работой над AI ready архитектурой и следить.
Пока рождаются новые процессы и есть пока только иллюзия ценности AI.
Когда начнутся необратимые вещи — все узнаете и успеете.


Здоровое питание вашего AI (и не AI) аналитика

Прикопаем тут еще одну «скучную» тему, на которую потратил много "мыслетоплива".

Речь про core-слой сертифицированных витрин.


И инженеры и аналитики избегают этой темы. Тут мало низковисящих фруктов, нет готовых подходов, сложно покрыть себя славой.
Но эта вещь решает сутевую проблему - хаоса витрин и низкого переиспользования. Бич мультидоменных платформ с кросс юзаджем.

Поэтому весь прошлый год продавал внутри идею. В итоге скорее продавил, чем продал. В конкуренции с другими инициативами за бюджет - нужен эффект с деньгами.
Цели кор-слоя понятийно правильные — быстрее находить, делать меньше джойнов, ускорять расчеты, сокращать количество объектов, экономить инфру.
Досчитываем метрики уже параллельно с внедрением.

О чем речь.

Кор слой это витрины с заявленным статусом доверия certified.
— удобные для адхоков (широкие) и создания других витрин (3-НФ)
— с покрытием качеством и гарантией (ownership, SLA, DQ-checks, meta)
— c продвижением - reuse вместо «соберу ка еще одну витрину»
Можно воспринимать как основу или как часть семантического слоя (смотря как широко брать).

Ну и из заголовка вы поняли - кор слой - основная часть рациона AI аналитика, вместе с доменным контекстом. Всем нужно думать о здоровом питании.

В Авито проект делается смешанным ресурсом - платформенным DWH и BI в доменах.
Дима Мележиков, лид BI из домена Маркетинга, ворвался в проектную команду, надел шапочку продакта и потащил, под прессингом доменных биай задач. Опасный тип. Читайте его статью на хабре (дайте лайков) про прогресс прошлого года.

С того момента снова перебрали подход и продолжаем экспериментировать. Прикручиваем туда:
— AI generated DQ checks
— AI generated описание витрин
— Автоматический health scoring в каталоге

У Димы будет доклад на Aha-26.
Что сделаем к маю — расскажет. Что не успеем — приукрасит 🙂

Кто решал такую задачу - отзовитесь поболтать.
Вот кстати близкий кейс Airbnb.
Женя Ермаков еще помнится вскользь рассказывал про схожий проект common data marts в яндекс такси. Давно это было.

#АвитоBI


Не знаю, его ли мы все ждали, но шифт на agentic analytics начался. Как минимум в бигтехе.

Бигтехи техничны, гибки, управляемы и при деньгах. Когда компания дает добро на работу с условным Claude Code — начинается почти биология:
За пару недель появляются MCP ко всем основным сервисам.
Самоорганизуются vibe-coding сессии обмена опытом.
Знания передаются на стихийных 1-1.
Скиллы агентов множатся и шарятся.
Мелькают сообщения, доки, код, деши, витрины, написанные агентами.
Безопасники хлопают глазами и переглядываются.

Но agentic приносит не только wow-эмоции.
Он открывает довольно сложные вопросы.

Опыт Amazon, на который весь бигтех смотрит как на фронтира, дает пищу для размышлений:
- одним из первых озвучили жесткий AI-first на сырых инструментах
- первыми обжигаются с кодгеном роняя прод на ~6 часов
- вводят обязательный review AI кода синьорами

Вектор это, правда, не отменяет.

Какие наблюдения:

- будет резко расти доля запросов агентов к платформе. Агенты джойнят как угорелые и не всегда элегантно. Возможна деградация перфоманса от перегрузки инфры. Придется думать о фильтрации и семплировании агентских запросов, агентских квотах.

- после стратегии «дикого запада» придет подсчет сожженных токенов. Многие сценарии могут просто не окупаться. Для сравнения с трудоемкостью операций «по-старому» пока не хватает данных.

- риски доступа к проду. Агент уже может написать код, сделать push и сам же сделать review. Такие кейсы нужно ловить и блокировать (пока). Сейчас доступ агента = доступ пользователя. Но дальше придется думать о регистрации агентов, связанных с сотрудниками, и выдаче им отдельных доступов. Типа сервисных аккаунтов. Но с характером. Появится новый тип observability — мониторинг действий агентов: какие запросы генерируются, сколько токенов потрачено, какой код, что поменял. Такой observability тоже будет агентским. Хорошо ли это.

- объем кода, дешей и др дата-артефактов вырастет на порядок. Тем кто выплыл из хаоса контента - нужно снова сделать вдох перед погружением.

- и есть парадокс. Все ожидали: AI сократит потребность в инженерах и аналитиках. Пока происходит обратное. Вакансий в мире становится больше. Говорят, жажда легкого и доступного кода привела в инжиниринг компании, которые раньше покупали как SaaS ПО.
- Рост AI замедляется стоимостью compute. Если стоимость AI > стоимость человека - автоматизация перестанет быть выгодной. Естественный экономический лимит. Реальный AI адопшн говорят будет тогда как с интернетом или электричеством - замедленным. Ну успокоили.

В общем, ощущение, что дамбу открыли.
И достаточно квартала, чтобы в погоне за эффективностью
затопить всю долину.
Надо продумывать Governance. Сразу.

Нихрена не понятно, но очень интересно.

(На фото - инженеры до изобретения autocad)


Прожарка дешей в Авито

Пару лет назад писал что Ценность визуализации данных преувеличена (В основном Tableau, поскольку это их главная фишка). В ней нет ничего критически важного.
Релевантность, своевременность аналитики и доверие к ней в разы важнее. 95% бизнес дашборда - BANs, бар-чарты и удобные таблицы.
Надо просто набить руку делать базовые шаблоны без явных ошибок. Помогает если по-максимуму закрыть в BI туле опции делать откровенное уродство.

Короче ничего с тех пор не изменилось)
Но. Душа просит красоты некоторым из нас все равно хочется делать хороший визуал )

Женя Мичурин и Лера Смирнова рассказывают про наш подход к прожаркам дешей.
Все как у всех - есть комьюнити жюри, методология, подготовка, эфир.
Недавно добавили доработку деша автором с получением бейджа и "зачетом" на след калибровке по матрице компетенций.

Важно - для любого разговора о визуализации бизнес данных в приличном обществе нужно проверять себя на два условия:
1) Упарываться и придираться стоит если (через AND):
- это операционный деш (не аналитический, там скорость важнее)
- у деша широкая аудитория бизнес-юзеров (UX окупается)
- есть основания считать, что деш проживет долго, хотя бы 6 мес (система дешей как продукт)
В остальных дашах - упоротый датавиз не отбивает инвестиций.
2) Есть спорные вопросы (вкусовщина). Есть объективные (все эксперты будут согласны). Грань тонкая, но ее надо чувствовать.

Традиционный вопрос - ну а что там с AI?

Собрал на коленке Dashboard Roasting Bot в нашей корп LLM (с anthropic под капотом). В контексте - мощный прожарочный промпт + наш BI стайл гайд с конфлюенса и записи прожарок. Перед оценкой бот запрашивает цель деша, аудиторию, регулярность использования.

Результат на 8 из 10. Насыпает детально, развернуто, полезно. Цитирует стайлгайд и Lisa Charlotte Muth. Проверяет на цвета, адекватность layout'а. Дает толковые рекомендации. Ставит оценку по шкале. Точно можно его доучить в промпте - не лить воду, держаться строгих проверок.
Закину в комменты пример деша и ответа.

Вроде рабочая штука.
След шаг - встроить прожарку в BI тул при публикации и в скоринг здоровья сертифицированных дешей. Кажется этого еще никто не делал)

Торопитесь прожаривать короче, пока есть что прожаривать.
Деши уйдут (нет), а вместе с ними и приятный треп про визуализацию.

В тему два наших эфира с Ромой Буниным. Больше не будет - поляна сдана ИИ.)

#АвитоBI

15 ta oxirgi post ko‘rsatilgan.