BeerPanda. Органично недоразвитый DevOps


Гео и язык канала: Россия, Русский
Категория: Технологии


http://beerpanda.ru

Связанные каналы  |  Похожие каналы

Гео и язык канала
Россия, Русский
Категория
Технологии
Статистика
Фильтр публикаций


Сгорел ЦОД Яндекса. Что делать?

В 22м году писал о том, как надо заходить в облако, чтобы не было мучительно больно. В 22м году отмечал юбилей - уже 10 лет как говорил об этой схеме на каждой конференции.

Значит надо повторить еще раз.


1. Необходимо иметь полный актуальный (а лучше несколько) бэкап всех данных и АС в физически контролируемом периметре.
2. Каждая АС должна размещаться в облаке одновременно с написанием плана выведения ее в on-premise (colocation включается в on-premise) либо в другое облако.
3. Все бэкапы должны быть совместимы для быстрого развертывания с собственными системами / другим облаком.
4. План по миграции / восстановлению, известный также как DRP (disaster recovery plan) должен проверяться регулярно, должны проводиться учения по миграции.

И добавляются новые пункты, которые в целом были понятны, но сейчас актуальны как никогда:
5. Желательно, чтобы провайдер находился в вашей юрисдикции (гражданство, подсудность), физический доступ.
6. Провайдер последнего шанса (коммерческий ЦОД, облако) ДОЛЖЕН находиться в вашей юрисдикции.

Мы наблюдаем не только юридически обусловленные санкции (по решению суда / правительства. Не только почти полное отсутствие ответственности провайдера за простой и утерю данных - не считать же ответственностью скидку на месячный счет. И в том и в другом случае мы исходим все же из добросовестности провайдера и принципа best effort.
Как показал пример Parler и мы начинаем массово наблюдать - отказать в сервисе могут из гражданской или идеологической солидарности. Причем даже пункт 5 может не спасти, как в случае того же Parler. Формируется новый мир коммерческих монополий и олигополий, способных игнорировать принцип best effort и даже в определенном моменте и собственные локальные законы - и цензурировать / отказывать в сервисе не только коммерческому клиенту, но официальным лицам государства, вплоть до собственного действующего президента.

В этих условиях единственная сколько нибудь стоящая гарантия - это собственная инфраструктура и собственные специалисты.

Добавлю ссылку на прошлогодний пост с разбором "Почему у Я.Облака нет ДГУ и что с этим делать". Не менее актуально в условиях не только сбоев электроэнергии, но и в угрозах БПЛА.












Интересно, давно ли гипервизоры потребляют GPU для собственных нужд?

1k 0 9 13 45

6-го августа 2026 тряхнем стариной виртуализацией!

Встреча сообщества (юзер групп) инженеров по виртуализации.

Буду там рассказывать про "Древнее зло и производительность. От MS DOS к планировщику процессора гипервизора"

Приходите будет лампово и интересно!

https://event.jet.su/virtualization-community-day


VK и макбуки. Анализ на коленке.

Прокатилась волна про VK и супермодные макбуки по 300к для сотрудников. Каналы и чаты полны обсуждений и праведного гнева.

Дорог ли макбук?

Оставим рассуждения нужны ли именно M5 или хватит даже М1 в разы дешевле. Да и в разы ли?
Не далее как решил обновить свой BYOD и взять ноутбук под винду. Не сказать, что мне как то не хватало М1 макбука, до сих пор не знаю чем его загрузить, но нужно было именно с виндой. Просто нормальный рабочий, надежный, живущий от батарейки, с возможностью апгрейда железа.
Взял Lenovo T16. Базовая цена 155 тыр за 16/512. Апгрейд хотя бы до 32 памяти (маст хев для комфортной работы) +30к, до 48 +40к. Апгрейд системного диска (увы, только апгрейд, а не установка еще одного) при нынешних ценах на SSD - еще столько же.
И вот уже 220 как с куста. Это к вопросу о "сверхстоимости" макбука.

Найм команды

Далее. Надо найти и нанять этих самых сотрудников. Т.е. затраты на размещение вакансий, на поиск, собеседования, на ФОТ рекрутерам и HRам. Считаем приближенно, нам интересен порядок цен, а не их точность до копеек.
Суммарная стоимость найма сотрудника с ЗП Х руб примерно равна 3,5-4 Х руб.

Отдельно посчитаем стоимость упущенного времени пока сотрудника нет. Не привязываясь к прибыли и важности проекта возьмем с потолка упущенное время по цене ФОТ. Предположим вся команда будет нанята равномерно за 6 мес. Т.е. для N сотрудников стоимость простоя проекта в самом простом приближении - 3 месяца ФОТ x N сотрудников.
Добавим 15% на стоимость обеспечения сотрудника рабочими метрами. Добавим х1.5 за налоги. Для 13% сотрудника 300к на руки компания тратит 450к.

Стоимость работы команды

Сколько стоит разработчик, который будет работать на этом супермодном ультра хайтех ноутбуке?
Вряд ли ошибусь в большую сторону, если возьму 300к (стоимость ноутбука) как ЗП на руки.
Итого, из расчета стоимости команды на 2 года.

Стоимость найма 65 * 300к * 4 = 78М
Стоимость простоя в процессе найма 450к * 65 * 3 = 88М
Стоимость команды на 2 года 24 * 450 * 65 * 1,15 = 807М

Итого стоимость команды из 65 человек при ставке 300к на 2 года с наймом составляет 973М, стоимость ноутбуков (рабочего инструмента) 19,5М.

2%, Карл!

Интернет и каналы с чатиками обсуждают 2% затрат!

2k 6 37 61 53

Сервер выключается

Есть в одной организации сервер большой тяжелый и с ускорителями. И начал выключаться самопроизвольно.
Исследование не дало никаких ошибок аппаратных.
Включают - а он выключается. Непредсказуемо. Т.е. никаких там “через 10 минут”. Работает, работает, выключился завтра, например.
Две недели бились инженеры с проблемой.

Оказалось, что две недели назад появился в команде новый инженер. Который при завершении своей сессии заодно сервер выключал.
“Для экономии электричества”.


Аптайм - это важно?

Наткнулся на рекламу прямо из 90х. Винтажную, практически.

15 лет аптайма в масштабах Галактики

474 359 400 секунд системы *** работают без остановки!

P.S. Пока вы читаете этот пост, аптайм увеличился на 52 секунды, а Земля улетела еще на 12 480 км.


Умение проектировать и строить системы, способные выдать аптайм 15 лет - это умение без всяких шуточек важное и попросту отличное. Но надо понимать что это и зачем мы это делаем.
Аптайм - время непрерывной работы *единичной* системы. Той, которую можно рассматривать как квант масштабирования. До массового внедрения систем виртуализации (системных виртуальных машин) аптайм был важнейшим показателем в мире больших серверов. Сдвоенное всё, аппаратная устойчивость, проверки всего, добавление и удаление аппаратных компонентов на-горячую (hot plug). Только бы сервер не надо было выключать. Кластерные системы в те времена были уделом совсем уж небожителей.

Пришла VMware и сказала - а давайте вообще то выключать серверы. Причем не просто выключать, а прямо в рабочее время. Потому что мы придумали Live Migration - виртуальная машина с нагрузкой прямо на-горячую, без остановки и разрывов соединений, меняет точку исполнения и переезжает на другой физический сервер (квант масштабируемости). А мы прямо в рабочее время, без овертаймов и ночных работ, получили возможность поставить патчи на системное ПО, прошить свежий биос, и вообще делать все то, что раньше приводило к недоступности сервиса.

Пришло время свернизкого входа в кластерные системы.

Дальнейшее появление контейнерной виртуализации и концепции "pet vs cattle" добило аппаратный и программный "design to last". Современные ИТ - это "design to fail", когда мы проектируем систему (кластерную прежде всего) на быструю обработку отказов и на поддержание доступности сервиса, а не на аптаймы железа и квантов масштабируемости.

Всё, аптайм с 2003 года (время выхода Live Migration) - очень нишевый показатель, он лишен практического применения в массовом ИТ.

Инфраструктура ИТ и вовсе с незапамятных времен почти не интересуется аптаймами. Питание по двум лучам, кондиционеры все с избыточностью, сети тоже все дублированы.

Не, коллеги из *** на самом деле молодцы, что у них 15 лет без простоев работает ЦОД и услуги.
Просто термин для этого другой нужен, не аптайм. И да, это душноты псот. Но раз мы осмеливаемся называться инженерами, то должна быть и инженерная культура. А она прежде всего начинается с терминологии.




Найм в ИТ сломан?

Недавно была большая битва HR против накрутчиков под лозунгом "найм сломан"

Где HR открыто признает, что на отклики на вакансии натравливает ИИ.

С другой стороны мы видим по блогам как хитрые соискатели натравливают ИИ на обход этих ИИ.

Сегодня увидел на хабре новую серию.

"У меня возникла потребность в поиске и найме Python-разработчика. ... Оплачиваю за размещение вакансии 3000 рублей. Получаю письмо на почту.

Мне сразу начинают сыпаться куча не очень релевантных мне резюме. Оказывается так происходит если стоит галочка «отображать автоотклики». Автоотклики это вообще что за чудо функционал. Площадка сама берет резюме пользователей, которые по версии их ИИ подходят мне и пачкой вываливает на меня. С моей стороны кстати есть кнопочка которая позволяет с помощью ИИ разгрести все эти вакансии которые мне упали и ответить соискателям. Сами соискатели даже и не знают что откликаются на мою вакансию. Кстати они тоже за это платят. Это же гениально (сарказм). ИИ тебе ищет работу. Сам решает куда ты подать твое резюме и сам решает что твое резюме там не подходит."


Т.е. в дело вступает платформа, которая за отдельные деньги продает соискателям ИИ, а потом работодателям ИИ бороться с ИИ.

Найм в ИТ не просто сломан, он сломан высокотехнологично. С одной стороны работодатели не могут месяцами найти сотрудников, с другой сотрудники (далекие от ИИ) не могут пробиться через ИИ заслоны и HR. А где-то посередине растет сингулярность, в которой ИИ борется с ИИ во славу ИИ.


Лучшие практики от Netflix!

Kubernetes и контейнеры не избавляют от необходимости знать что такое NUMA и как работает HyperThreading. Т.е. хочешь считаться инженером - изучай как работает железо.

https://netflixtechblog.com/mount-mayhem-at-netflix-scaling-containers-on-modern-cpus-f3b09b68beac


Подъехала статистика по источникам данных для LLM AI.

40% - это реддит, форум с мнениями анонимусов.
26% вики - но если хоть сколько нибудь про технику можно считать плюс-минус нормальным, то по любым политическим вопросам или неоднозначным историческим там ничуть не лучше, чем на среднем форуме.
20% фейсбук - просто без комментариев.

К вопросу о доверенности мнения LLM. и их использовании в работе как источника информации.

Upd: уточнили, что речь не про источники данных для обучения нейросетей. Речь про ссылки, используемые в ответах.


Видео недоступно для предпросмотра
Смотреть в Telegram
Антон Жбанков. Хочешь настоящий хайлоад по Хардкору?


Видео недоступно для предпросмотра
Смотреть в Telegram
Вадим Подольный. Как НЕ нужно делать хайлоад.


Видео недоступно для предпросмотра
Смотреть в Telegram
Евгений Парфенов. Как НЕ надо работать с облаком. Быль полная слез.


Репост из: IT-link Весна 2026
🖥 Highload — территория для тех, кто не боится слова “нагрузка” и живёт на пределе возможностей системы.

Это направление соберёт классных архитекторов, инженеров и практиков. Представляем спикеров секции «Высокие нагрузки»:

⏩ Антон Жбанков, Архитектор вычислительной инфраструктуры, независимый эксперт
Тема: «Хочешь настоящий ИТ-хайлоад по хардкору?»

⏩ Вадим Подольный, руководитель комитета промышленной автоматизации АРПП «Отечественный софт», член совета клуба топ-менеджеров 4CIO, автор книги «Архитектура Высоконагруженных Систем»
Тема: «Как НЕ надо строить хайлоад»

⏩ Евгений Парфёнов, enterprise-архитектор
Тема: «Как НЕ надо работать с облаком. Быль, полная слёз»

⏩ Игорь Гальцев, технический директор облачных разработок Softline
Тема: «Highload расходы. ФинОпс — методика оптимизации»


До ⚡️⚡️⚡️⚡️ осталось 2 дня! Готовы к нетворкингу и экспертным выступлениям?

📌 8 ноября, г. Чебоксары
Театр юного зрителя имени Михаила Сеспеля

🟢Больше про IT-link Осень 2025
🟢Зарегистрироваться


Сводная таблица с российскими решениями по виртуализации.

Создана силами сообщества RusVirtUG при участии вендоров, но лишь при участии.
Не является рекламой

https://docs.google.com/spreadsheets/d/1fk8Hin2J31RIwnbPukPPKvrMJnu5hCq2wF6hjL8hiVQ/edit?usp=sharing

2.2k 0 75 10 20
Показано 20 последних публикаций.