Данные на стероидах


Гео и язык канала: Россия, Русский
Категория: Технологии


Команда Дата сервисов VK Tech о практиках и подходах для извлечения максимальной пользы из работы с данными.
Мы в MAX: https://max.ru/stereodata

Связанные каналы  |  Похожие каналы

Гео и язык канала
Россия, Русский
Категория
Технологии
Статистика
Фильтр публикаций


🗄 Российские компании пересматривают подход к хранению данных

Раньше работу с данными полностью делегировали инфраструктурным командам, а бизнес не погружался в детали. Сейчас парадигма изменилась: в 2026 году управление берут на себя сами компании. Делимся результатами исследования 🔹

🔹Почему происходят изменения?

Согласно опросам, для 26% компаний основной предпосылкой для пересмотра модели хранения данных стал рост объемов информации, для 18% — начало работы с ИИ и появление аналитических нагрузок, для 17% — новые требования к производительности.

При этом более 60% используют или планируют внедрять российские решения, такие как VK Data Platform для управления данными или S3-объектное хранилище VK Object Storage.  

🔹Как бизнес выбирает СХД?

Компании все чаще отказываются от типовых решений в пользу кастомизированных, заказчики собирают инфраструктуру как конструктор: под конкретный профиль нагрузки, целевые SLA, допустимые RTO/RPO.

При выборе платформы 38% в первую очередь обращают внимание на совместимость с существующей инфраструктурой, еще 28% — на надежность и доступность данных.

Смотрите карточки с результатами в графиках.

📬 Мы в MAX


🗑 Как хранить данные, если пока неизвестно, когда их можно удалить   

Облачная платформа Amazon Web Services добавила в объектное хранилище S3 новый сценарий для Object Lock — event-based retention. Он позволяет отсчитывать срок хранения файла от бизнес-события.

Зачем это нужно

Срок хранения некоторых данных зависит от внешнего процесса. Например, материалы расследования нужно сохранять до его завершения, а затем еще установленный период.

Как работает event-based retention

«Lifecycle и фиксированный срок хранения работают по схеме "загрузили → прошло N дней → удалили". При event-based retention объект защищен event hold, пока событие не наступило. После снятия hold стартует заранее заданный WORM-период, который уже нельзя сократить», — Елизавета Белоконова, менеджер продуктов VK Tech.


Кто должен снимать hold?

Главное правило — это не должен быть владелец файлов, иначе он фактически сможет сам запустить отсчет до их удаления. Это стоит выделить в отдельную compliance- или ИБ-функцию.

Как вам такой подход? Насколько это может увеличить эффективность хранения данных?

👉 Пишите свое мнение в комментариях.

📬 Мы в MAX


📚 Коротко о Data Lakehouse

В предыдущих постах разобрали:

→ почему классического DWH стало не хватать
→ зачем появился Data Lake
→ что отличает Data Lakehouse от обычного озера данных
→ как устроен Lakehouse-контур

💬 А теперь главный вопрос: что Data Lakehouse дает бизнесу и команде?

Экономика Lakehouse строится на разделении хранения и вычислений: основной массив данных остается в объектном хранилище, а compute подключается под конкретные задачи. На больших объемах это может быть заметно дешевле, чем хранить все данные в DWH на SSD/NVMe. Но итоговую экономику нужно считать по профилю нагрузки: объему данных, SLA, частоте запросов, горячим витринам и трафику.

По производительности Lakehouse нельзя оценивать одной формулой. Для части сценариев он сопоставим с DWH или быстрее, для других нужен отдельный горячий слой, например в ClickHouse.

Lakehouse особенно полезен для ML и AI. Агентные системы могут создавать большие объемы логов, промежуточных данных и результатов работы, которые нужно хранить, анализировать и использовать повторно. Lakehouse дает для этого масштабируемый и экономичный слой хранения, версионирование данных и единые политики, определяющие, к каким данным может обращаться каждый агент.

Переход на Lakehouse стоит оценивать под конкретную нагрузку. В отдельной статье разобрали, когда он оправдан, как посчитать TCO и спланировать миграцию.

Читать →

📬 Мы в MAX


💻 Как превратить внедрение ИИ из хаоса в систему

ИИ вошел в рабочие процессы раньше, чем компании успели установить для него правила. Согласно исследованию MIT, 90% сотрудников регулярно используют личные аккаунты для рабочих задач, тогда как официальная корпоративная подписка на большие языковые модели есть только у 40% компаний.

Такой стихийный подход приводит к тому, что до 95% корпоративных пилотов генеративного ИИ не дают измеримой отдачи.

Задача бизнеса — перейти от хаоса к порядку. Для этого нужен корпоративный ИИ, встроенный в защищенный контур компании. Такой подход гарантирует главное: конфиденциальные данные не передаются вовне в открытом виде или остаются внутри, а компания сохраняет полный контроль.


Для того чтобы создать корпоративный ИИ, необходимо выстроить единую инфраструктуру для разработки и запуска агентов внутри компании. Такой контур должен иметь несколько ключевых свойств:

🔹 изоляция на уровне архитектуры: для каждого агента заранее задаются доступные системы, данные и разрешенные действия

🔹 прозрачность работы: видно, что агент планировал, какие инструменты использовал и какой результат получил

🔹 хуки: жесткие правила поверх промптов автоматически срабатывают в контрольных точках, например требуют согласования с человеком

🔹 общая библиотека навыков: инструкции и правила для конкретных задач можно переиспользовать между агентами, превращая отдельные практики в стандарт.

Мы реализовали этот подход в нашей платформе VK AI Space — агент получает задачу, сам планирует шаги, работает с корпоративными инструментами и адаптируется к новой информации, но не выходит за границы отведенной ему зоны.

📬 Мы в MAX


👉 Переходим от теории к практике и показываем, из каких компонентов собирается Data Lakehouse.

Платформу данных с архитектурой Data Lakehouse можно собрать на базе VK Data Platform. Данные хранятся в формате Parquet в VK Object Storage с S3-совместимым API, а табличный слой работает на Apache Iceberg. Для обработки можно подключать разные вычислительные движки в зависимости от задачи.
 
🎛 Согласованный доступ движков к таблицам обеспечивает собственный Iceberg REST-каталог на базе доработанного Lakekeeper. Он также централизованно управляет правами вплоть до данных в S3. Политики действуют сквозным образом, поэтому их нельзя обойти через другой движок или прямое обращение к хранилищу.

Такой подход помогает собрать один контур данных для BI, аналитики и ML, не размножая лишние копии и не завязывая все сценарии на одну систему.

📃 Как выбрать технический каталог для Lakehouse, разобрали отдельно: сравнили девять решений по 14 критериям. Подробности — по ссылке →

📬 Мы в MAX


Нужно ли выбирать между Data Mesh и Data Fabric?

Когда данных становится больше, вопрос уже не только в том, где их хранить. Нужно понять, кто за них отвечает и как сделать их доступными для других команд и систем.

Отсюда возникают две разные, но связанные задачи: распределить ответственность за данные и организовать единый доступ к ним. Именно для этого используют Data Mesh и Data Fabric.

🔹 Data Mesh — это подход, при котором ответственность за информацию распределяется между бизнес-доменами, а не концентрируется в одной дата-команде. Например, маркетинг сам следит за качеством своих данных: описывает, обновляет и передает другим командам как data-продукт.

🔹 Data Fabric — это технологический слой, обеспечивающий доступ к данным. Он связывает распределенные источники и помогает находить, интегрировать и использовать информацию независимо от того, где она физически находится.

Поэтому выбирать необязательно: Data Mesh и Data Fabric решают разные задачи и могут работать вместе.

➡️ В новой статье VK Cloud подробнее разбираем оба подхода и их место в архитектуре данных.

📬 Мы в MAX


🤖 Чему нас учит история с моделью OpenAI, которая в процессе обучения сформировала для себя инструкции о неподчинении корпорациям и государственным структурам? 

А вот чему: 

ИИ-агент не должен самостоятельно определять границы собственной ответственности. Их должна задавать организация.


По мере роста автономности ИИ-агентов вопрос безопасности нельзя сводить только к качеству самой модели. Для корпоративного использования критически важно, чтобы агент:

🔹 работал в заданном контуре
🔹 имел ограниченный набор полномочий
🔹 не мог самовольно расширять область применения
🔹 выполнял действия, которые можно проверить и при необходимости остановить.

Иначе — даже без злого умысла со стороны разработчиков — система может выйти за рамки бизнес-сценария, для которого ее создавали.

Что у нас в VK Tech? 

В VK AI Space агент работает в изолированном контейнере — собственной зоне ограниченной автономности. Уже на этапе тестирования ему дается доступ только к явно разрешенным системам и данным. Критические и необратимые действия всегда проходят подтверждение человеком — независимо от уверенности модели.

Значит ли это, что каждое решение агента должен утверждать человек?


Нет — тогда теряется весь смысл автономности. Это значит, что границы, в которых агент действует самостоятельно, всегда задает организация, а не сам агент по ходу работы. И ответственность за то, что происходит, остается за компанией, а не за моделью.

📃 Читайте колонку Романа Стятюгина на vc.ru.

📬 Мы в Max


❓Как использовать на 50% меньше дисковой емкости без снижения надежности

При тройной репликации каждый объект хранится в трех экземплярах, поэтому на 1 ПБ данных требуется 3 ПБ дисковой емкости. Такой подход к отказоустойчивости заметно увеличивает требования к инфраструктуре и ее стоимость.

В VK Object Storage для On-Premise теперь доступен Erasure Coding x1,75. Вместо нескольких полных копий система хранит данные вместе с дополнительными фрагментами для восстановления.

Что это меняет для бизнеса:

🔹 на 1 ПБ полезных данных требуется около 1,75 ПБ дисковой емкости вместо 3 ПБ при тройной репликации

🔹 в одном из реализованных сценариев при эквивалентной надежности требуемая емкость составила 5,3 ПБ вместо 10,5 ПБ

🔹 Erasure Coding позволяет пережить одновременный отказ как минимум двух дисков, а в конфигурации из трех и более ЦОДов при аварии одного дата-центра данные остаются доступны для чтения.

Для компаний с крупной On-Premise инфраструктурой это позволяет иметь меньше дисков и серверного оборудования в закупке без снижения требований к надежности. Особенно эффект заметен для банков, госсектора и других организаций, работающих с большими объемами данных.

Есть и еще одна практическая польза: Erasure Coding входит в обязательные требования многих тендеров и RFI на S3 On-Premise. Без его поддержки решение в части закупок не проходит технический отбор.

Теперь этот сценарий поддерживает и VK Object Storage.

📬 Мы в Max




Роман Стятюгин, директор по AI-продуктам VK Tech, показал, как сотрудники могут работать с ИИ-агентами в привычном интерфейсе — через веб-чат и ботов👇




Продолжаем трансляцию VK Workspace Сonf 2026. Говорим про ИИ в рабочей среде 🤖

Дмитрий Меркушов, руководитель ML-направления VK Tech, и Сергей Харламов, руководитель отдела AI VK Tech, показывают возможности ИИ-ассистента VK WorkSpace: как он находит нужное в переписке, учитывает права доступа и формирует ответы со ссылками на источники.

Вы узнаете, как VK WorkSpace может работать с внешними агентами, и раскроют подробности про автоматизацию через MCP.

Смотрите трансляцию по ссылке ➡️


Репост из: VK WorkSpace
На VK WorkSpace Conf 2026 мы представили новые возможности цифровой среды VK WorkSpace для совместной работы внутри компаний и с коллегами из других организаций

🤝 Расширили сценарии работы сотрудников из разных корпоративных доменов

В облачной версии платформы компании смогут объединять в единый тенант неограниченное число доменов одной организации. Сотрудники объединенных доменов смогут общаться друг с другом в Мессенджере и Видеоконференциях.

В On-Premise-версии уже доступна федерация между любым количеством инсталляций, использующих версию VK WorkSpace 26.2 и выше.

💙 Представили новые возможности сервисов

— В Диске VK WorkSpace реализовали настройку прав на просмотр, редактирование и комментирование документов, а также возможность ограничить срок действия ссылки и защитить ее паролем.

— Календарь VK WorkSpace позволяет сотрудникам делиться рабочим расписанием встреч, отражающим актуальную занятость без раскрытия конфиденциальной информации о встречах.

— В Доске VK WorkSpace при гостевом доступе можно дополнительно защищать доски паролем. Функция уже доступна в SaaS и до конца года будет реализована в On-Premise.

⚙️ Обновили технологическую архитектуру On-Premise-версии

Платформа переходит с инфраструктуры на базе Docker Compose на Kubernetes. В графическом инсталляторе появился механизм, который позволяет пошагово перевести существующую инсталляцию на Kubernetes через веб-интерфейс.

Изменится и процесс развертывания платформы. В инсталляторе обязательным этапом стали автоматические проверки инфраструктуры заказчика на соответствие системным требованиям VK WorkSpace. Для настройки виртуальных машин также появятся готовые рекомендуемые конфигурации, при этом возможность задать параметры вручную сохранится.

🤖 Реализовали ИИ-сценарии

В Мессенджере, Видеоконференциях, Почте, Календаре и Диске появятся новые функции на базе искусственного интеллекта. Компания также представила ИИ-Ассистент VK WorkSpace и MCP-сервер для подключения ИИ-агентов.

Спасибо, что следите за новостями вместе с нами! VK WorkSpace Conf 2026 продолжается.

📬 Мы в МАХ


Репост из: VK WorkSpace
⚡️На VK WorkSpace Conf 2026 представили обновление платформы: интегрированные ИИ-сценарии позволят сотрудникам автоматизировать работу и эффективнее решать повседневные задачи.

В VK WorkSpace появятся умные функции внутри отдельных сервисов, единый ИИ-Ассистент, который сможет работать с контекстом и выполнять действия по поручению пользователя, а также поддержка протокола MCP (Model Context Protocol) для подключения агентов.

🤓 Умные функции внутри сервисов
В платформе появится возможность поиска по смыслу. Пользователю не обязательно помнить точное название документа, тему письма или формулировку сообщения: достаточно описать задачу или тему, а система поможет найти связанные материалы с учетом прав доступа. Также благодаря ИИ в видеоконференциях можно будет автоматически расшифровывать встречи и готовить конспект.

👋 ИИ-Ассистент VK WorkSpace
В первой версии ИИ-Ассистент будет работать с доступной пользователю перепиской в Мессенджере VK WorkSpace: анализировать смысл запроса, находить связанную информацию и давать готовый структурированный ответ со ссылками на исходные сообщения и чаты. Эта функциональность уже доступна в VK WorkSpace On-Premise, а в SaaS-версии появится в октябре.

🤖 Подключение ИИ-агентов к VK WorkSpace
В составе VK WorkSpace On-Premise 26.3 появится MCP-сервер, через который ИИ-агенты смогут выполнять действия внутри VK WorkSpace: например, собрать информацию из рабочих переписок или подготовить материалы к встрече. С MCP-сервером смогут работать в том числе агенты, созданные в VK AI Space — платформе VK Tech для разработки мультиагентных ИИ-систем в контуре компании.

👉 Читайте подробности по ссылке.

📬 Мы в МАХ


Через 10 минут начинаем VK WorkSpace Conf 2026 🔥

Подключайтесь к онлайн-трансляции и задавайте вопросы экспертам под роликом в VK Видео или в чат-боте в MAX.

До встречи в эфире 👋




🖥 Data Lake появился так: сырые данные, логи и историю стали складывать в более дешевое хранилище, а обрабатывали их отдельными вычислительными движками по мере необходимости.

Data Lake помог разгрузить DWH, но без табличного слоя озеро быстро рисковало превратиться в болото: данные лежат, но не всегда ясно, какая версия актуальна, кто что изменил и можно ли на этом стабильно строить BI и ML.

В итоге вместо одного контура компании получали два, а еще — новые копии данных, новые пайплайны и риск превратить озеро в болото файлов, на котором сложно построить BI и ML.

Ответом стала архитектура Data Lakehouse. Хранение больших объемов данных оставалось в объектном хранилище, а поверх файлов формировался управляемый табличный слой — с метаданными, версиями таблиц, транзакциями и согласованным доступом для разных движков.

Так слой данных превратился из архива в полноценный рабочий контур: для SQL-аналитики, ETL/ELT, BI-витрин, ad-hoc-запросов и подготовки данных для ML/AI.

Хотите узнать, как это работает на практике?

Если да, проверьте себя, пройдя опрос ⬇️

📬 Мы в Max


Когда S3-хранилище растет, метаслой приходится развивать вместе с ним.

Чем больше данных, нагрузки и функциональности, тем сложнее масштабировать систему, если хранение метаданных тесно связано с бизнес-логикой.

На SmartData 2026 эксперт VK Tech Иван Найденов расскажет, как команда пересматривала архитектуру собственного S3-совместимого хранилища и почему решила разделить метаслой и прикладную часть системы.

В докладе Иван разберет:

🔵почему для взаимодействия выбрали асинхронный подход
🔵 как при такой архитектуре работать с согласованностью данных, идемпотентностью и порядком операций
🔵 что происходит при частичных отказах и как система после них восстанавливается
🔵 по каким требованиям выбирали новое хранилище метаданных и на какие компромиссы пришлось пойти.

🗓 23 сентября
📍 SmartData 2026, зал 3

Подробнее о выступлении и участии в конференции по ссылке.

📬 Мы в МАХ


🗄 Что учесть при выборе хранилища, кроме цены и скорости?

Почти любое хранилище предстоит расширять и обновлять в процессе добавления данных. Поэтому еще до покупки стоит выяснить, сколько будет стоить рост объема данных и как система поведет себя при отказе диска или сети.

Об осознанном выборе платформы хранения на эфире AM Live 11 сентября рассказала Екатерина Канунникова, директор по продуктам дата-сервисов VK Tech. Если пропустили — смотрите запись по ссылке.

В карточках собрали главное из выступления Екатерины ⬆️

📬 Мы в МАХ

Показано 19 последних публикаций.