Яндекс Алексеев-3.pdf
Спасибо всем, кто послушал доклад 🙌
Как и обещал, оставляю ссылки на наши proposal / PR / issue в Kubeflow Pipelines. Пулреквесты делал мой коллега Антон Печенин — Антон, тебе большое спасибо!
• proposal for central driver implementation — proposal по переводу KFP с driver pod на более лёгкую central driver архитектуру, чтобы уменьшить overhead запуска задач.
• central driver implementation — практическая реализация central driver подхода через Argo plugin flow вместо отдельного driver pod на каждую task.
• recurring runs queue throughput optimization — оптимизация scheduled/recurring runs, которая уменьшает лишние reconciliations и повышает throughput очереди регулярных запусков.
• gRPC metrics to api-server / optimize execution spec reporting — добавляет метрики в api-server и улучшает observability и эффективность backend-части KFP.
• pod lifecycle failure visualization — улучшает отображение и диагностику pod lifecycle ошибок в UI, чтобы такие сбои не приходилось искать только через kubectl.
Отдельно:
• Kubeflow ML Hub
• Kubeflow Manifests — для тех, кто хочет попробовать развернуть платформу у себя: манифесты и чарты можно брать оттуда.
Остальные источники, которые тоже могут помочь при построении ML-платформы, собрал здесь:
https://t.me/mlops_infra/114
Как и обещал, оставляю ссылки на наши proposal / PR / issue в Kubeflow Pipelines. Пулреквесты делал мой коллега Антон Печенин — Антон, тебе большое спасибо!
• proposal for central driver implementation — proposal по переводу KFP с driver pod на более лёгкую central driver архитектуру, чтобы уменьшить overhead запуска задач.
• central driver implementation — практическая реализация central driver подхода через Argo plugin flow вместо отдельного driver pod на каждую task.
• recurring runs queue throughput optimization — оптимизация scheduled/recurring runs, которая уменьшает лишние reconciliations и повышает throughput очереди регулярных запусков.
• gRPC metrics to api-server / optimize execution spec reporting — добавляет метрики в api-server и улучшает observability и эффективность backend-части KFP.
• pod lifecycle failure visualization — улучшает отображение и диагностику pod lifecycle ошибок в UI, чтобы такие сбои не приходилось искать только через kubectl.
Отдельно:
• Kubeflow ML Hub
• Kubeflow Manifests — для тех, кто хочет попробовать развернуть платформу у себя: манифесты и чарты можно брать оттуда.
Остальные источники, которые тоже могут помочь при построении ML-платформы, собрал здесь:
https://t.me/mlops_infra/114