Seguridad en IA · Lección 06
¿Qué diferencia hay entre un ataque de prompt injection 'directo' y uno 'indirecto' contra una aplicación LLM?
En el ataque directo, el usuario malicioso escribe la instrucción manipuladora directamente en su propia entrada; en el indirecto, la instrucción maliciosa está incrustada en un contenido externo (como un documento o página web) que el sistema procesa como parte del contexto sin que el usuario final la haya escrito
Son exactamente el mismo tipo de ataque con un nombre distinto, sin ninguna diferencia real en cómo se ejecutan
El prompt injection indirecto solo puede ocurrir si el sistema tiene exactamente un único usuario en total consultándolo
El prompt injection directo es técnicamente imposible de ejecutar bajo cualquier circunstancia en un sistema real
Seguridad en IA · Lección 06
Completa el código
En el ataque indirecto, la instrucción maliciosa vive en un contenido
Revisa: la instrucción maliciosa vive en un contenido externo procesado por el sistema.
Seguridad en IA · Lección 06
¿Por qué un ataque de prompt injection indirecto (escondido dentro de un documento que un sistema RAG recupera y procesa) puede ser más peligroso que uno directo, ya que ni siquiera el usuario legítimo sabe que está ocurriendo?
Pista: en un ataque directo, al menos hay alguien intentando conscientemente manipular el sistema; en un ataque indirecto, un usuario completamente legítimo e inocente podría hacer una pregunta normal que, al recuperar un documento contaminado con instrucciones ocultas, termine desencadenando un comportamiento malicioso sin que ni el usuario ni el sistema perciban de inmediato que algo salió mal.
✓
¡Lección completada!
Prompt injection avanzado — directo vs indirecto
0
XP ganado
3
Vidas restantes