RAG en Producción · Lección 26
¿Qué desafío adicional presenta construir un sistema RAG que debe recuperar y usar información contenida en imágenes o tablas complejas, más allá del texto narrativo plano?
Requiere generar representaciones (embeddings) apropiadas para contenido no textual, o convertir ese contenido visual/tabular hacia una descripción textual procesable, dado que los modelos de embeddings tradicionales están diseñados principalmente para texto
Es técnicamente imposible incluir cualquier tipo de contenido visual en un sistema RAG bajo cualquier circunstancia
Solo es relevante si el documento tiene exactamente una única imagen en total, sin ninguna tabla ni gráfico adicional
Elimina por completo la necesidad de tener cualquier tipo de contenido de texto narrativo en el sistema
RAG en Producción · Lección 26
Completa el código
Convertir una tabla compleja hacia una descripción en lenguaje natural facilita que sea procesable por modelos de
Revisa: facilita que sea procesable por modelos de embeddings diseñados principalmente para texto.
RAG en Producción · Lección 26
¿Por qué una tabla de datos financieros compleja no puede simplemente 'copiarse y pegarse' como texto plano sin perder información estructural importante sobre las relaciones entre filas y columnas?
Pista: una tabla tiene una estructura bidimensional real donde el significado de cada valor depende de su fila y columna específica correspondiente; simplemente extraer el texto de forma lineal sin preservar esa estructura relacional perdería información importante sobre qué dato específico corresponde a qué categoría, requiriendo un tratamiento más cuidadoso para mantener ese significado estructural original al procesarla.
✓
¡Lección completada!
RAG multi-modal — imágenes y tablas
0
XP ganado
3
Vidas restantes