LLMOps en Producción · Lección 16
¿Por qué métricas tradicionales de NLP como BLEU o ROUGE (diseñadas para comparar texto generado contra una referencia exacta) son limitadas para evaluar respuestas de un LLM conversacional?
Penalizan respuestas que son correctas y útiles pero están redactadas de forma distinta a la referencia exacta, sin capturar bien la equivalencia semántica o la calidad subjetiva de la respuesta
BLEU y ROUGE no pueden calcularse bajo ninguna circunstancia para texto generado por un LLM
Estas métricas solo funcionan si el LLM genera código de programación, ningún otro tipo de texto
Elimina por completo la necesidad de tener cualquier tipo de evaluación de calidad del modelo
LLMOps en Producción · Lección 16
Completa el código
Estas métricas comparan el texto generado contra una respuesta de
Revisa: comparan el texto generado contra una respuesta de referencia exacta.
LLMOps en Producción · Lección 16
¿Por qué dos respuestas completamente distintas en su redacción, pero igualmente correctas y útiles para el usuario, podrían recibir puntuaciones muy diferentes en una métrica como BLEU?
Pista: BLEU mide principalmente la superposición literal de palabras/frases entre el texto generado y la referencia; dos respuestas con el mismo significado correcto pero expresadas con palabras y estructura muy distintas tendrían poca superposición textual, resultando en una puntuación baja a pesar de ser igualmente válidas.
✓
¡Lección completada!
Evaluación de LLMs — métricas y desafíos
0
XP ganado
3
Vidas restantes