Kubeflow en Producción · Lección 22
¿Qué define un recurso 'InferenceService' de KServe al desplegar un modelo?
La ubicación del artefacto del modelo entrenado, el runtime de predicción a usar, y la configuración de recursos y autoescalado para ese endpoint de inferencia específico
Un InferenceService reemplaza por completo la necesidad de tener el artefacto real del modelo entrenado almacenado en algún lugar
Solo puede desplegar exactamente un único modelo en toda la vida útil del cluster de Kubeflow
Requiere que el modelo esté escrito específicamente en el lenguaje Go para poder desplegarse
Kubeflow en Producción · Lección 22
Completa el código
Un InferenceService puede escalar automáticamente incluso hasta
Revisa: puede escalar automáticamente incluso hasta cero réplicas cuando no hay tráfico.
Kubeflow en Producción · Lección 22
¿Por qué la capacidad de un InferenceService de escalar hasta cero réplicas cuando no hay tráfico reduce el costo de servir un modelo con uso intermitente, comparado con mantenerlo siempre activo?
Pista: si el modelo tiene uso esporádico (no constante), mantenerlo siempre activo con recursos reservados desperdiciaría capacidad durante los períodos sin tráfico; escalar automáticamente hasta cero libera esos recursos cuando no se necesitan, reduciendo el costo real de operar ese modelo específico.
✓
¡Lección completada!
InferenceService — despliegue de modelos
0
XP ganado
3
Vidas restantes