♥ 3
⚡ 0
LLMOps en Producción · Lección 16

¿Por qué métricas tradicionales de NLP como BLEU o ROUGE (diseñadas para comparar texto generado contra una referencia exacta) son limitadas para evaluar respuestas de un LLM conversacional?

Penalizan respuestas que son correctas y útiles pero están redactadas de forma distinta a la referencia exacta, sin capturar bien la equivalencia semántica o la calidad subjetiva de la respuesta
BLEU y ROUGE no pueden calcularse bajo ninguna circunstancia para texto generado por un LLM
Estas métricas solo funcionan si el LLM genera código de programación, ningún otro tipo de texto
Elimina por completo la necesidad de tener cualquier tipo de evaluación de calidad del modelo
LLMOps en Producción · Lección 16

Completa el código

Estas métricas comparan el texto generado contra una respuesta de
LLMOps en Producción · Lección 16

¿Por qué dos respuestas completamente distintas en su redacción, pero igualmente correctas y útiles para el usuario, podrían recibir puntuaciones muy diferentes en una métrica como BLEU?

✓

¡Lección completada!

Evaluación de LLMs — métricas y desafíos

0
XP ganado
3
Vidas restantes