♥ 3
⚡ 0
LLMOps en Producción · Lección 17

¿Qué permite hacer la técnica de 'LLM-as-judge' al evaluar la calidad de las respuestas de una aplicación en producción?

Usar un LLM (normalmente uno más potente o especializado) para juzgar automáticamente la calidad de las respuestas generadas por otro modelo, según criterios definidos en un prompt de evaluación, escalando mucho más que la revisión humana manual
LLM-as-judge elimina por completo la posibilidad de que un humano revise alguna vez las respuestas
Solo puede usarse si el modelo evaluador y el modelo evaluado son exactamente el mismo modelo
Requiere que el modelo evaluador tenga acceso directo a los pesos internos del modelo evaluado
LLMOps en Producción · Lección 17

Completa el código

El prompt de evaluación suele definir criterios explícitos como precisión, relevancia y
LLMOps en Producción · Lección 17

¿Por qué usar LLM-as-judge para evaluar miles de respuestas diarias es más práctico que depender exclusivamente de revisores humanos evaluando cada respuesta manualmente?

✓

¡Lección completada!

LLM-as-judge — usar un modelo para evaluar a otro

0
XP ganado
3
Vidas restantes