RAG en Producción · Lección 21
¿Qué mide específicamente la métrica de 'faithfulness' (fidelidad) al evaluar la calidad de una respuesta generada por un sistema RAG?
Qué tan bien la respuesta generada se apega exclusivamente a la información realmente presente en el contexto recuperado, sin introducir afirmaciones inventadas o no respaldadas por ese contexto
La velocidad con la que el sistema genera la respuesta completa desde que se recibe la pregunta del usuario
El costo económico total de procesar esa consulta específica a través de todo el pipeline del sistema
Solo es relevante evaluarla si el sistema RAG tiene exactamente un único documento fuente en su base de conocimiento completa
RAG en Producción · Lección 21
Completa el código
La métrica de relevance evalúa si los fragmentos recuperados realmente responden a la
Revisa: evalúa si los fragmentos recuperados realmente responden a la pregunta planteada.
RAG en Producción · Lección 21
¿Por qué una respuesta podría tener alta 'relevance' (los fragmentos recuperados sí son pertinentes a la pregunta) pero baja 'faithfulness' (el modelo de todas formas inventó parte del contenido no respaldado por esos fragmentos)?
Pista: relevance evalúa si el sistema de recuperación encontró los fragmentos correctos y pertinentes a la pregunta, mientras faithfulness evalúa una etapa completamente distinta y posterior: si el LLM, al generar la respuesta final, realmente se apegó fielmente a ese contexto correcto recuperado o si de todas formas introdujo contenido inventado no respaldado por él, siendo posible que una etapa funcione bien mientras la otra falle independientemente.
✓
¡Lección completada!
Métricas de evaluación de RAG — faithfulness, relevance
0
XP ganado
3
Vidas restantes