🌴Как только наш CPO уходит в феврале в отпуск, начинается настоящая работа😂
В прошлом году – это было «все теперь делаем ai-агентов, давайте вносить в цели», в этом – все, что могло сломаться и пойти не так – сломалось и пошло не так😁
• Сломались тракты на получение данных и на передачу данных из-за ужесточения проверок кибербезы и из-за зависших серверов
• Упали пайплайны, которые собирали витрины (в том числе из-за отсутствия данных, но это не единственная причина)
• Закончились ресурсы на кластере, что не позволило быстро пересчитать упавшие пайплайны. Пришлось отключить часть потоков, которые собирали другие витрины
• Мы чуть не залетели в инцидент с критическим приоритетом (а это на ковёр к президенту🥲 ) по своей же ошибке
• Все это, конечно, усиливается справедливым возмущением и негодованием заказчиков: где данные, Карл!?
Но есть и приятное в этом всем – понемногу, но мы справляемся с трудностями:
• оперативно расширили ресурсы (другая команда пошла навстречу и руками поправили нам конфигм)
• по ручному тракту догружаем данные и чиним автоматизированный тракт
• провели рефакторинг витрин: будем разделять и властвовать над разными частями тяжеловестных витрин независимо друг от друга
• дорабатываем мониторинг: обнаружение проблем на ранних стадиях и их прогнозирование – гораздо лучшая стратегия, чем пассивное ожидание, когда придёт заказчик
• запланировали переезд функционала по передачи данных с чужой платформы на нашу
• держим заказчиков в курсе ситуации
Я «с нетерпением» жду новый день, что ещё «интересного» произойдёт😂
Причин, почему мы попали в такую ситуацию, в которой нас испытали на прочность со всех сторон (и прочность не выдержала) множество, но главная ошибка здесь кроется в управлении.
Часть управленческих ошибок исправлена уже (это были приятные небольшие победы), но работы предстоит еще много. Сейчас я думаю, как должна быть перестроена работа с командой и внутри нее, какой должен быть лидер такой команды, чтобы таких ситуаций не возникало или хотя бы их минимизировать, как сделать систему более устойчивой и надёжной, как стать платформой. Где нам надо усилиться, где пересмотреть приоритеты. И какие мои компетенции надо ещё прокачать: я искренне испугалась в ситуации с инцидентом, моя первая😅 рада, что все обошлось, необычный опыт, но больше не надо😁
---
В прошлом году – это было «все теперь делаем ai-агентов, давайте вносить в цели», в этом – все, что могло сломаться и пойти не так – сломалось и пошло не так😁
• Сломались тракты на получение данных и на передачу данных из-за ужесточения проверок кибербезы и из-за зависших серверов
• Упали пайплайны, которые собирали витрины (в том числе из-за отсутствия данных, но это не единственная причина)
• Закончились ресурсы на кластере, что не позволило быстро пересчитать упавшие пайплайны. Пришлось отключить часть потоков, которые собирали другие витрины
• Мы чуть не залетели в инцидент с критическим приоритетом (а это на ковёр к президенту🥲 ) по своей же ошибке
• Все это, конечно, усиливается справедливым возмущением и негодованием заказчиков: где данные, Карл!?
Но есть и приятное в этом всем – понемногу, но мы справляемся с трудностями:
• оперативно расширили ресурсы (другая команда пошла навстречу и руками поправили нам конфигм)
• по ручному тракту догружаем данные и чиним автоматизированный тракт
• провели рефакторинг витрин: будем разделять и властвовать над разными частями тяжеловестных витрин независимо друг от друга
• дорабатываем мониторинг: обнаружение проблем на ранних стадиях и их прогнозирование – гораздо лучшая стратегия, чем пассивное ожидание, когда придёт заказчик
• запланировали переезд функционала по передачи данных с чужой платформы на нашу
• держим заказчиков в курсе ситуации
Я «с нетерпением» жду новый день, что ещё «интересного» произойдёт😂
Причин, почему мы попали в такую ситуацию, в которой нас испытали на прочность со всех сторон (и прочность не выдержала) множество, но главная ошибка здесь кроется в управлении.
Часть управленческих ошибок исправлена уже (это были приятные небольшие победы), но работы предстоит еще много. Сейчас я думаю, как должна быть перестроена работа с командой и внутри нее, какой должен быть лидер такой команды, чтобы таких ситуаций не возникало или хотя бы их минимизировать, как сделать систему более устойчивой и надёжной, как стать платформой. Где нам надо усилиться, где пересмотреть приоритеты. И какие мои компетенции надо ещё прокачать: я искренне испугалась в ситуации с инцидентом, моя первая😅 рада, что все обошлось, необычный опыт, но больше не надо😁
---
Делитесь, были у вас такие тёмные деньки и что помогло справиться вам? Как команду поддерживали?)
😎 - никогда такого не было
😭 - было дело, справились
🗿- ничего не понятно