🔥 PyTorch Monarch теперь поддерживает AMD GPU через ROCm
Monarch позволяет управлять распределённым обучением на сотнях GPU из одной Python-программы. Вместо ручной координации процессов разработчик работает с акторами и группами устройств, а runtime берёт оркестрацию на себя.
Главное преимущество - отказоустойчивость. Если один узел выходит из строя, исправные реплики продолжают обучение. Система перезапускает повреждённую группу, восстанавливает её состояние и возвращает в работу без полного рестарта кластера.
Поддержка ROCm включает:
- Actor runtime и supervision trees
- шардирование тензоров
- RCCL и RDMA
- SLURM, Kubernetes и SkyPilot
- интеграцию с TorchTitan и TorchFT
Подход протестировали на кластерах из 128 AMD MI300 и 256 MI355 GPU. Даже при искусственно вызванных сбоях обучение продолжалось почти так же стабильно, как в обычном запуске.
Для команд, обучающих большие модели, это означает меньше потерянных вычислений, простоев и дорогих перезапусков инфраструктуры.
Подробнее:
https://pytorch.org/blog/bringing-pytorch-monarch-to-amd-gpus-single-controller-distributed-training-on-rocm/
Monarch позволяет управлять распределённым обучением на сотнях GPU из одной Python-программы. Вместо ручной координации процессов разработчик работает с акторами и группами устройств, а runtime берёт оркестрацию на себя.
Главное преимущество - отказоустойчивость. Если один узел выходит из строя, исправные реплики продолжают обучение. Система перезапускает повреждённую группу, восстанавливает её состояние и возвращает в работу без полного рестарта кластера.
Поддержка ROCm включает:
- Actor runtime и supervision trees
- шардирование тензоров
- RCCL и RDMA
- SLURM, Kubernetes и SkyPilot
- интеграцию с TorchTitan и TorchFT
Подход протестировали на кластерах из 128 AMD MI300 и 256 MI355 GPU. Даже при искусственно вызванных сбоях обучение продолжалось почти так же стабильно, как в обычном запуске.
Для команд, обучающих большие модели, это означает меньше потерянных вычислений, простоев и дорогих перезапусков инфраструктуры.
Подробнее:
https://pytorch.org/blog/bringing-pytorch-monarch-to-amd-gpus-single-controller-distributed-training-on-rocm/