ИИ в проде: что агенты уже могут делать в Data Engineering
Про ИИ-агентов сейчас много шума. Иногда агентом называют обычный чат с LLM 😺, хотя разница довольно простая.
Чат отвечает. Агент может сам сходить за информацией и что-то сделать 🤖
То есть это уже не просто скинь ошибку в ChatGPT. Агент получает доступ к Airflow, мониторингу, каталогу данных и другим инструментам.
🧐Звучит удобно, но сразу появляется вопрос: а стоит ли давать ему самому что-то менять в проде?
Прочитать логи и найти подозрительное место — нормально. Удалить данные, изменить схему или запустить большой backfill без подтверждения человека — уже страшновато😱
Поэтому в реальной системе вокруг агента нужны права, ограничения, история действий и подтверждение опасных операций.
Сейчас самые понятные сценарии выглядят так:
⏺описание таблиц и колонок;
⏺поиск связей между данными;
⏺генерация SQL;
⏺разбор логов и упавших пайплайнов;
⏺поиск аномалий и причин алертов.
Например, MWS запустила
Data Scout. Агент анализирует метаданные, ищет связи между таблицами и помогает наполнять каталог данных.
Пока агенты не заменяют дата-инженеров. Скорее, становятся еще одним слоем над платформой🧠
Всё упирается в качество платформы данных. Без описаний, связей и контроля доступа агент может неправильно понять данные, выбрать не ту таблицу или получить лишние права.
Агент не исправляет плохие данные. Без проверок он может быстро распространить ошибку на всю систему. Поэтому нужны проверки качества, правила доступа и подтверждение рискованных действий человеком.
💡Кстати, в программе появилось видео про ИИ в проде: как агенты сейчас устроены и работают на реальной платформе в крупном бигтехе. + Сейчас планируем видео курс (для менти) про внедрение ИИ агентов в проект 😎
Про ИИ-агентов сейчас много шума. Иногда агентом называют обычный чат с LLM 😺, хотя разница довольно простая.
Чат отвечает. Агент может сам сходить за информацией и что-то сделать 🤖
Например, ночью упал DAG. Агент открывает логи, смотрит прошлые запуски, проверяет схему и пытается понять, где всё сломалось. После этого может предложить retry, backfill или завести инцидент.
То есть это уже не просто скинь ошибку в ChatGPT. Агент получает доступ к Airflow, мониторингу, каталогу данных и другим инструментам.
🧐Звучит удобно, но сразу появляется вопрос: а стоит ли давать ему самому что-то менять в проде?
Прочитать логи и найти подозрительное место — нормально. Удалить данные, изменить схему или запустить большой backfill без подтверждения человека — уже страшновато😱
Поэтому в реальной системе вокруг агента нужны права, ограничения, история действий и подтверждение опасных операций.
Сейчас самые понятные сценарии выглядят так:
⏺описание таблиц и колонок;
⏺поиск связей между данными;
⏺генерация SQL;
⏺разбор логов и упавших пайплайнов;
⏺поиск аномалий и причин алертов.
Например, MWS запустила
Data Scout. Агент анализирует метаданные, ищет связи между таблицами и помогает наполнять каталог данных.
Пока агенты не заменяют дата-инженеров. Скорее, становятся еще одним слоем над платформой🧠
Всё упирается в качество платформы данных. Без описаний, связей и контроля доступа агент может неправильно понять данные, выбрать не ту таблицу или получить лишние права.
Агент не исправляет плохие данные. Без проверок он может быстро распространить ошибку на всю систему. Поэтому нужны проверки качества, правила доступа и подтверждение рискованных действий человеком.
💡Кстати, в программе появилось видео про ИИ в проде: как агенты сейчас устроены и работают на реальной платформе в крупном бигтехе. + Сейчас планируем видео курс (для менти) про внедрение ИИ агентов в проект 😎