RAG en Producción · Lección 04
¿Por qué es importante limpiar el texto extraído de un documento (eliminando encabezados repetidos, números de página, artefactos de formato) antes de generar embeddings a partir de él?
Contenido irrelevante o repetitivo mezclado con el texto útil puede diluir el significado semántico capturado por el embedding, afectando negativamente la relevancia de las búsquedas posteriores
La limpieza de texto elimina por completo la necesidad de tener cualquier tipo de chunking posterior del documento
Solo es relevante si el documento fue escrito en un idioma distinto al inglés, ningún otro caso lo requiere
Elimina por completo la necesidad de tener cualquier tipo de metadata asociada al fragmento de texto
RAG en Producción · Lección 04
Completa el código
Un encabezado que se repite en cada página del documento se considera
Revisa: se considera ruido que conviene eliminar antes de procesar el contenido.
RAG en Producción · Lección 04
¿Por qué un número de página repetido en cada fragmento de texto extraído podría distorsionar sutilmente el embedding generado, afectando la precisión de una búsqueda semántica posterior sobre ese fragmento?
Pista: el embedding se calcula a partir de todo el texto del fragmento, incluido cualquier contenido irrelevante mezclado como números de página o encabezados repetidos; esa información sin valor semántico real diluye ligeramente la representación vectorial resultante, alejándola de capturar fielmente solo el significado del contenido realmente útil del fragmento.
✓
¡Lección completada!
Preprocesamiento y limpieza de texto
0
XP ganado
3
Vidas restantes