LLMOps en Producción · Lección 17
¿Qué permite hacer la técnica de 'LLM-as-judge' al evaluar la calidad de las respuestas de una aplicación en producción?
Usar un LLM (normalmente uno más potente o especializado) para juzgar automáticamente la calidad de las respuestas generadas por otro modelo, según criterios definidos en un prompt de evaluación, escalando mucho más que la revisión humana manual
LLM-as-judge elimina por completo la posibilidad de que un humano revise alguna vez las respuestas
Solo puede usarse si el modelo evaluador y el modelo evaluado son exactamente el mismo modelo
Requiere que el modelo evaluador tenga acceso directo a los pesos internos del modelo evaluado
LLMOps en Producción · Lección 17
Completa el código
El prompt de evaluación suele definir criterios explícitos como precisión, relevancia y
Revisa: suele definir criterios explícitos como precisión, relevancia y tono, entre otros.
LLMOps en Producción · Lección 17
¿Por qué usar LLM-as-judge para evaluar miles de respuestas diarias es más práctico que depender exclusivamente de revisores humanos evaluando cada respuesta manualmente?
Pista: la revisión humana manual de miles de respuestas diarias sería extremadamente costosa en tiempo y recursos; un LLM-as-judge puede evaluar ese mismo volumen de forma automatizada y consistente, dando cobertura mucho más amplia de lo que sería posible con revisión humana exclusivamente.
✓
¡Lección completada!
LLM-as-judge — usar un modelo para evaluar a otro
0
XP ganado
3
Vidas restantes