Observabilidad de IA · Lección 23
¿Qué contenido específico debería incluir un runbook diseñado para guiar la respuesta ante un incidente de 'degradación de calidad de respuestas' en un sistema de IA, más allá de un runbook genérico de infraestructura?
Pasos específicos como verificar si hubo un cambio reciente de modelo o prompt, revisar métricas de drift, consultar ejemplos recientes de respuestas problemáticas capturadas por el sistema de evaluación, y considerar un rollback a una versión anterior conocida como estable
Un runbook para este tipo de incidente es idéntico en todo su contenido a un runbook genérico de infraestructura tradicional, sin ninguna diferencia real específica de IA
Solo debe incluir exactamente un único paso en total, sin ninguna secuencia más detallada de investigación posible
Elimina por completo la necesidad de que un humano tome cualquier decisión durante el proceso de respuesta al incidente
Observabilidad de IA · Lección 23
Completa el código
Un paso común es considerar un rollback a una versión anterior conocida como
Revisa: un paso común es considerar un rollback a una versión anterior conocida como estable.
Observabilidad de IA · Lección 23
¿Por qué tener un runbook específico con pasos ya definidos para este tipo de incidente acelera la respuesta del equipo, comparado con improvisar la investigación desde cero cada vez que ocurre un problema similar?
Pista: durante la presión de un incidente real, tener ya definidos los pasos específicos de investigación (qué revisar primero, qué preguntas hacer) ahorra el tiempo valioso que se perdería si cada persona tuviera que decidir desde cero por dónde empezar; el runbook captura el conocimiento acumulado de investigaciones anteriores similares, acelerando y haciendo más consistente la respuesta del equipo.
✓
¡Lección completada!
Runbooks para incidentes específicos de IA
0
XP ganado
3
Vidas restantes