Seguridad en IA · Lección 18
¿Qué protege un mecanismo de filtrado de salida aplicado a la respuesta generada por el LLM, justo antes de entregarla al usuario final?
Detecta y bloquea contenido problemático que el modelo haya generado (como información sensible filtrada, contenido dañino, o una respuesta que no cumple el formato esperado), actuando como una última capa de verificación incluso si algo pasó las defensas anteriores
El filtrado de salida modifica retroactivamente el prompt original que se envió al modelo, cambiando la petición después de que ya fue procesada
Solo es relevante si el modelo nunca comete ningún tipo de error en sus respuestas generadas, sin ninguna posibilidad real de fallo
Este mecanismo elimina por completo la necesidad de tener cualquier tipo de filtrado de entrada aplicado antes de que la consulta llegue al modelo
Seguridad en IA · Lección 18
Completa el código
Actúa como una última capa de verificación antes de entregar la respuesta al usuario
Revisa: actúa como una última capa de verificación antes de entregar la respuesta al usuario final.
Seguridad en IA · Lección 18
¿Por qué tener un filtrado de salida es valioso incluso si el filtrado de entrada y los guardrails del propio modelo funcionaron correctamente la mayoría de las veces, actuando como una red de seguridad adicional para los casos excepcionales?
Pista: incluso si el filtrado de entrada y los guardrails del modelo funcionan correctamente en la gran mayoría de los casos, ninguna defensa es perfecta al 100%; el filtrado de salida actúa como una red de seguridad final que puede atrapar ese pequeño porcentaje de casos excepcionales donde, por alguna razón, una respuesta problemática logró pasar todas las capas anteriores sin ser detectada.
✓
¡Lección completada!
Filtrado de salida — validación de respuestas antes de entregarlas
0
XP ganado
3
Vidas restantes