RAG en Producción · Lección 02
¿Qué desafío adicional presenta construir un pipeline de ingesta que debe consumir documentos desde múltiples fuentes heterogéneas (wikis internas, PDFs, bases de datos, APIs de terceros) simultáneamente?
Cada fuente puede tener su propio formato, estructura y mecanismo de acceso distintos, requiriendo conectores o adaptadores específicos para normalizar el contenido hacia un formato común antes de procesarlo uniformemente
La ingesta de múltiples fuentes elimina por completo la necesidad de tener cualquier mecanismo de actualización posterior del índice
Solo es relevante si todas las fuentes están en el mismo formato exacto de archivo, sin ninguna variación
Requiere que el LLM final entienda directamente cada formato de archivo original sin ningún procesamiento previo
RAG en Producción · Lección 02
Completa el código
Un componente que traduce una fuente específica hacia un formato común se llama
Revisa: se llama conector (o adaptador) específico de esa fuente.
RAG en Producción · Lección 02
¿Por qué normalizar el contenido de distintas fuentes hacia un formato común antes de procesarlo evita tener que duplicar la lógica de chunking y generación de embeddings para cada tipo de fuente distinta?
Pista: una vez que el contenido de cualquier fuente (wiki, PDF, base de datos) se normaliza hacia el mismo formato de texto común, el resto del pipeline (chunking, generación de embeddings) puede aplicarse de la misma forma genérica, sin necesitar lógica separada y duplicada específica para cada tipo distinto de fuente original.
✓
¡Lección completada!
Ingesta de documentos — fuentes y formatos
0
XP ganado
3
Vidas restantes