Seguridad en IA · Lección 17
¿Qué busca detectar o bloquear un mecanismo de filtrado de entrada aplicado antes de que la consulta del usuario llegue realmente al LLM?
Patrones conocidos de intentos de manipulación (como instrucciones típicas de jailbreak o prompt injection), contenido claramente malicioso, o entradas que no cumplen con el formato o alcance esperado de la aplicación
El filtrado de entrada garantiza con total certeza que ningún tipo de ataque de prompt injection pueda tener éxito bajo ninguna circunstancia posterior
Solo es relevante si la aplicación recibe exactamente un único tipo de consulta en total, sin ninguna variedad real de entradas distintas
El filtrado de entrada elimina por completo la necesidad de tener cualquier tipo de filtrado adicional aplicado sobre la salida generada por el modelo
Seguridad en IA · Lección 17
Completa el código
El filtro busca patrones conocidos de intentos de
Revisa: busca patrones conocidos de intentos de manipulación del sistema.
Seguridad en IA · Lección 17
¿Por qué el filtrado de entrada por sí solo no puede garantizar protección completa contra prompt injection, dado que un atacante creativo podría formular su ataque de una forma que el filtro nunca había visto antes?
Pista: un filtro de entrada típicamente se basa en reconocer patrones ya conocidos de ataques anteriores; un atacante suficientemente creativo y motivado podría diseñar deliberadamente una formulación completamente nueva que ese filtro nunca haya visto ni anticipado, evadiendo esa capa específica, razón por la cual el filtrado de entrada por sí solo nunca debería considerarse la única línea de defensa del sistema.
✓
¡Lección completada!
Filtrado de entrada — sanitización de prompts
0
XP ganado
3
Vidas restantes