Seguridad en IA · Lección 07
¿Qué busca lograr una técnica de jailbreaking aplicada contra un LLM con restricciones de seguridad configuradas (como negarse a generar cierto tipo de contenido)?
Manipular al modelo mediante formulaciones creativas del prompt (como pedirle que actúe un rol ficticio, o presentar la solicitud de forma indirecta) para que ignore o eluda las restricciones de seguridad que normalmente aplicaría
El jailbreaking modifica permanentemente los pesos internos del modelo, cambiando su comportamiento de forma persistente para todas las conversaciones futuras
Solo puede intentarse exactamente una única vez contra un modelo específico, sin ninguna posibilidad de variantes o reintentos distintos
El jailbreaking es una técnica legítima y recomendada oficialmente por los proveedores de modelos para mejorar las capacidades del sistema
Seguridad en IA · Lección 07
Completa el código
Una técnica común pide al modelo que actúe un rol
Revisa: una técnica común pide al modelo que actúe un rol ficticio para eludir restricciones.
Seguridad en IA · Lección 07
¿Por qué pedirle a un modelo que responda 'como si fuera un personaje de ficción sin restricciones' podría hacer que genere contenido que normalmente rechazaría generar directamente?
Pista: al enmarcar la solicitud dentro de un contexto ficticio o de rol, se crea una capa de distancia aparente respecto a la solicitud real subyacente, lo que en ciertos casos puede hacer que el modelo procese esa petición de forma distinta a como procesaría la misma solicitud directa, potencialmente relajando las restricciones que normalmente aplicaría a un pedido sin ese marco narrativo adicional.
✓
¡Lección completada!
Jailbreaking — técnicas y por qué funcionan
0
XP ganado
3
Vidas restantes