Kubeflow en Producción · Lección 27
¿Qué tipo de métricas es especialmente importante monitorear en una instalación de Kubeflow con Prometheus, más allá de las métricas genéricas de Kubernetes?
El estado de ejecución de pipelines (éxito/fallo), duración de Trials de Katib, y latencia/throughput de los InferenceServices activos
Solo el número de estrellas del repositorio de Kubeflow en GitHub
El color del tema visual configurado en el Central Dashboard
La cantidad de emojis usados en los nombres de los notebooks de los usuarios
Kubeflow en Producción · Lección 27
Completa el código
Un aumento en la latencia de un InferenceService puede indicar un problema de
Revisa: puede indicar un problema de recursos (CPU/GPU) insuficientes para la carga actual.
Kubeflow en Producción · Lección 27
¿Por qué monitorear específicamente el estado de ejecución de pipelines (no solo métricas genéricas de infraestructura) ayuda a detectar un problema de reentrenamiento automático fallando silenciosamente?
Pista: un pipeline de reentrenamiento podría fallar silenciosamente (por ejemplo, por un problema de datos) sin que eso se refleje necesariamente en métricas genéricas de CPU o memoria del cluster; monitorear específicamente el estado de éxito/fallo de cada ejecución del pipeline es lo que realmente revelaría ese problema específico de ML.
✓
¡Lección completada!
Monitoreo de Kubeflow con Prometheus
0
XP ganado
3
Vidas restantes