♥ 3
⚡ 0
Seguridad en IA · Lección 07

¿Qué busca lograr una técnica de jailbreaking aplicada contra un LLM con restricciones de seguridad configuradas (como negarse a generar cierto tipo de contenido)?

Manipular al modelo mediante formulaciones creativas del prompt (como pedirle que actúe un rol ficticio, o presentar la solicitud de forma indirecta) para que ignore o eluda las restricciones de seguridad que normalmente aplicaría
El jailbreaking modifica permanentemente los pesos internos del modelo, cambiando su comportamiento de forma persistente para todas las conversaciones futuras
Solo puede intentarse exactamente una única vez contra un modelo específico, sin ninguna posibilidad de variantes o reintentos distintos
El jailbreaking es una técnica legítima y recomendada oficialmente por los proveedores de modelos para mejorar las capacidades del sistema
Seguridad en IA · Lección 07

Completa el código

Una técnica común pide al modelo que actúe un rol
Seguridad en IA · Lección 07

¿Por qué pedirle a un modelo que responda 'como si fuera un personaje de ficción sin restricciones' podría hacer que genere contenido que normalmente rechazaría generar directamente?

✓

¡Lección completada!

Jailbreaking — técnicas y por qué funcionan

0
XP ganado
3
Vidas restantes