Как-то писал про 1-ю часть классного бесплатного учебника по ML, а уже появилась 2 часть
Гарвардский профессор выложил в открытый доступ 2-ю часть своего учебника по ML-системам — Machine Learning Systems at Scale (издательство The MIT Press). Бесплатно.
Это продолжение фундаментального руководства, которое переходит от работы на одном устройстве к масштабным распределенным системам: от дата-центров до обслуживания миллионной аудитории.
Ключевые темы:
— Инфраструктура флита (The Fleet): архитектура дата-центров, высокоскоростные сети и масштабируемые системы хранения данных.
— Распределенное обучение (Distributed ML): параллелизм (data/tensor/pipeline), алгоритмы коллективных коммуникаций, отказоустойчивость и оркестрация тысяч GPU/TPU.
— Развертывание и инференс (Deployment at Scale): оптимизация стека обслуживания моделей, оптимизация инференса, краевые вычисления (Edge) и MLOps на уровне глобальных флитов.
— Безопасность и ответственность (The Responsible Fleet): устойчивость к атакам, энергоэффективность, эко-устойчивость (sustainability) и этическое управление крупными ИИ-системами.
Для закрепления теории авторы предлагают симуляторы (MLSys·im), разбор практических кейсов (StaffML) и лабораторные упражнения (Co-Labs).
Замечательное продолжение первой части и незаменимый ресурс для всех, кто проектирует, обучает и разворачивает масштабные ИИ-системы!
P.S. В комментариях можно найти все 2 части в pdf.
Гарвардский профессор выложил в открытый доступ 2-ю часть своего учебника по ML-системам — Machine Learning Systems at Scale (издательство The MIT Press). Бесплатно.
Это продолжение фундаментального руководства, которое переходит от работы на одном устройстве к масштабным распределенным системам: от дата-центров до обслуживания миллионной аудитории.
Ключевые темы:
— Инфраструктура флита (The Fleet): архитектура дата-центров, высокоскоростные сети и масштабируемые системы хранения данных.
— Распределенное обучение (Distributed ML): параллелизм (data/tensor/pipeline), алгоритмы коллективных коммуникаций, отказоустойчивость и оркестрация тысяч GPU/TPU.
— Развертывание и инференс (Deployment at Scale): оптимизация стека обслуживания моделей, оптимизация инференса, краевые вычисления (Edge) и MLOps на уровне глобальных флитов.
— Безопасность и ответственность (The Responsible Fleet): устойчивость к атакам, энергоэффективность, эко-устойчивость (sustainability) и этическое управление крупными ИИ-системами.
Для закрепления теории авторы предлагают симуляторы (MLSys·im), разбор практических кейсов (StaffML) и лабораторные упражнения (Co-Labs).
Замечательное продолжение первой части и незаменимый ресурс для всех, кто проектирует, обучает и разворачивает масштабные ИИ-системы!
P.S. В комментариях можно найти все 2 части в pdf.