Qué es un jailbreak en IA
Los modelos como ChatGPT o Claude están entrenados para rechazar ciertas peticiones. Un jailbreak busca romper esa barrera con instrucciones ingeniosas: juegos de rol, escenarios ficticios o peticiones troceadas para que el modelo no reconozca lo que está haciendo.
Cómo funciona
Las técnicas cambian constantemente, pero suelen basarse en lo mismo: confundir al modelo sobre el contexto. Por ejemplo, hacerle creer que está en una simulación, que habla con un desarrollador o que las reglas no aplican en ese caso. Los proveedores parchean y los atacantes buscan nuevas vías.
Ejemplo real
Una empresa pone un chatbot de atención al cliente con instrucciones de hablar solo de sus productos. Un usuario consigue, con un prompt elaborado, que el bot ofrezca un descuento inexistente o que revele sus instrucciones internas. Además del problema de imagen, puede tener consecuencias legales si el cliente reclama ese descuento.
Para qué te sirve en tu negocio
Si pones una IA de cara al público, tienes que asumir que alguien intentará romperla:
- Limita qué puede hacer: sin permisos, un jailbreak causa menos daño.
- No pongas datos sensibles en las instrucciones del sistema.
- Revisa conversaciones y prueba tu propio chatbot antes de lanzarlo.
Errores comunes
- Confiar en que las instrucciones del sistema bastan para protegerte.
- Dar al chatbot capacidad de ejecutar acciones críticas sin validación.
- Confundir jailbreak con prompt injection: están relacionados pero no son lo mismo.
Preguntas frecuentes
¿Qué diferencia hay entre jailbreak y prompt injection?
El jailbreak ataca las normas del modelo; la prompt injection mete instrucciones maliciosas en datos que la IA procesa, como una web o un email.
¿Hacer jailbreak es ilegal?
Suele violar las condiciones de uso del servicio. Si se usa para causar daño, puede tener consecuencias legales.
¿Se pueden evitar al 100 %?
No. Se reducen con buenas prácticas y límites de permisos.
