RAG en Producción · Lección 03
¿Qué desafío particular presenta extraer texto útil de un PDF con estructura compleja (tablas, columnas múltiples, imágenes con texto), comparado con extraer texto de un archivo de texto plano?
El PDF no tiene una estructura semántica explícita de párrafos y secciones como un formato de texto plano, requiriendo heurísticas o herramientas especializadas para reconstruir correctamente el orden de lectura y separar contenido de tablas del texto narrativo
Es técnicamente imposible extraer cualquier texto útil de un archivo PDF bajo cualquier circunstancia
Solo es un problema si el PDF fue creado hace más de 10 años, ningún PDF reciente presenta esta dificultad
Elimina por completo la necesidad de tener cualquier tipo de chunking posterior del contenido extraído
RAG en Producción · Lección 03
Completa el código
Extraer texto de una imagen escaneada dentro de un documento requiere una tecnología llamada
Revisa: requiere una tecnología llamada OCR (reconocimiento óptico de caracteres).
RAG en Producción · Lección 03
¿Por qué un PDF con contenido en dos columnas podría extraerse con el orden de lectura mezclado si el parser no maneja correctamente esa estructura de columnas múltiples?
Pista: un parser simple podría extraer el texto siguiendo el orden físico de las líneas en la página (de izquierda a derecha, de arriba a abajo) sin reconocer que el contenido está organizado en columnas separadas, resultando en fragmentos de texto de columnas distintas mezclados entre sí de forma incoherente, en vez de seguir el orden de lectura lógico real del documento.
✓
¡Lección completada!
Parsers y extracción de contenido (PDF, HTML, Office)
0
XP ganado
3
Vidas restantes