Ollama y LLMs Self-Hosted · Lección 27
¿Qué tipo de métricas es especialmente relevante monitorear en una instalación de Ollama sirviendo tráfico real en producción?
Latencia de respuesta, tokens generados por segundo, uso de memoria/GPU, y tasa de errores o timeouts en las peticiones recibidas
Solo el número de estrellas del repositorio de Ollama en GitHub
El color del tema visual configurado en alguna interfaz gráfica que consuma la API
La cantidad de emojis usados en los prompts enviados por los usuarios del sistema
Ollama y LLMs Self-Hosted · Lección 27
Completa el código
Un aumento sostenido en la latencia puede indicar saturación de los recursos de
Revisa: puede indicar saturación de los recursos de GPU disponibles.
Ollama y LLMs Self-Hosted · Lección 27
¿Por qué monitorear la tasa de errores o timeouts, además de las métricas de rendimiento normales, ayuda a detectar problemas que no se reflejarían simplemente observando que el servicio 'sigue corriendo'?
Pista: un servicio podría seguir 'corriendo' técnicamente (el proceso está activo) mientras al mismo tiempo falla silenciosamente en atender correctamente una parte significativa de las peticiones recibidas, algo que solo se detectaría monitoreando específicamente la tasa de errores y timeouts, no solo confirmando que el proceso general sigue activo.
✓
¡Lección completada!
Monitoreo de Ollama en producción
0
XP ganado
3
Vidas restantes