Model Server — одно из ключевых понятий в MLOps.
Если говорить проще:
* Nginx-сервер обслуживает веб-приложения
* Model Server обрабатывает inference-запросы к ML-модели
Работает это следующим образом.
Model Server загружает артефакты обученной модели в оперативную память или память GPU, чтобы не загружать модель заново при каждом запросе.
Он предоставляет inference-эндпоинты по HTTP и gRPC.
Также он экспортирует метрики и трейсы – например, через Prometheus и OpenTelemetry (OTEL).
Среди часто используемых Model Server – MLServer, TensorFlow Serving, NVIDIA Triton Inference Server и другие.
Теперь важный момент.
Model Server сам по себе не умеет горизонтально масштабироваться.
Для масштабирования и обеспечения высокой доступности поверх него используется оркестрация Kubernetes.
Когда речь идёт о model serving, KServe – один из ключевых serving-фреймворков для Kubernetes.
Model Server отвечает за обработку inference-запросов, а KServe выступает в роли слоя оркестрации.
👉 DevOps Portal
Если говорить проще:
* Nginx-сервер обслуживает веб-приложения
* Model Server обрабатывает inference-запросы к ML-модели
Работает это следующим образом.
Model Server загружает артефакты обученной модели в оперативную память или память GPU, чтобы не загружать модель заново при каждом запросе.
Он предоставляет inference-эндпоинты по HTTP и gRPC.
Также он экспортирует метрики и трейсы – например, через Prometheus и OpenTelemetry (OTEL).
Среди часто используемых Model Server – MLServer, TensorFlow Serving, NVIDIA Triton Inference Server и другие.
Теперь важный момент.
Model Server сам по себе не умеет горизонтально масштабироваться.
Для масштабирования и обеспечения высокой доступности поверх него используется оркестрация Kubernetes.
Когда речь идёт о model serving, KServe – один из ключевых serving-фреймворков для Kubernetes.
Model Server отвечает за обработку inference-запросов, а KServe выступает в роли слоя оркестрации.
👉 DevOps Portal