🔴🤖 OpenAI entrenó una IA para hackear sus propios modelos (y se le fue la mano)
La mayoría asume que la seguridad de los modelos de IA la revisan personas. Pero OpenAI acaba de revelar que lleva más de un año entrenando una IA hacker para que se encargue de eso.
Imagina contratar a un hacker para que intente reventar tu sistema de seguridad. Lo que encuentre, lo parcheas. Lo que no encuentre, esperas que nadie más lo encuentre.
Eso es exactamente el red-teaming: atacar tu propio sistema antes de que lo haga un atacante real.
OpenAI lleva años haciéndolo con equipos humanos. El problema es que sus modelos de IA se están volviendo tan complejos —y tan capaces de conectarse a webs, archivos, correos o el código de otras empresas— que los humanos ya no dan abasto.
La solución: entrenar una IA para que haga el trabajo de hackear.
Se llama GPT-Red. Y según el MIT Technology Review, que tuvo acceso en exclusiva, ya está activa.
🥊 Cómo se entrena un hacker artificial
GPT-Red no nació sabiendo hackear. OpenAI tomó un modelo base y lo metió en lo que se conoce como un bucle de auto-juego: el modelo atacaba a otros modelos, esos modelos se defendían, y todos aprendían de cada ronda.
Es el mismo principio por el que los programas de ajedrez o Go se volvieron imbatibles: jugar millones de partidas contra sí mismos hasta que no les gana nadie.
El “dojo” de entrenamiento simulaba escenarios reales: navegar por la web, leer correos electrónicos, gestionar calendarios, editar código. Todo lo que un agente de IA podría hacer en una empresa real.
Resultado: GPT-Red aprendió a encontrar ataques que ningún humano había descubierto antes.
🎯 El ataque que nadie había visto: el “falso razonamiento”
El hallazgo más interesante —y preocupante— del que informa MIT Technology Review tiene que ver con algo llamado chain of thought (cadena de pensamiento).
Cuando un modelo de IA trabaja en una tarea compleja, hace anotaciones mentales intermedias: “He calculado X, por tanto asumo Y, y entonces hago Z”. Es como un diario interno.
GPT-Red descubrió cómo insertar una entrada falsa en ese diario.
“Es como si alguien te dijera que 1+1=3 y que tú ya lo has verificado. El modelo responde: ‘Ah, claro, por supuesto’, y directamente dice que el resultado es 3.”
— Chris Choquette-Choo, investigador de OpenAI
En la práctica, esto significa que un atacante podría hacer que un agente de IA crea que ya tomó una decisión que en realidad nunca tomó. Con todo lo que eso implica si ese agente tiene acceso a tus datos, tu correo o el código de tu empresa.
Este tipo de ataque se llama prompt injection: colar instrucciones maliciosas en el texto que el modelo va a procesar.
📊 Los números que demuestran que funciona
OpenAI hizo una prueba directa: retomó un experimento de 2025 en el que humanos intentaban hackear una versión anterior de GPT-5. Le dieron a GPT-Red la misma tarea.
GPT-Red fue más efectivo que los humanos.
Después entrenaron GPT-5.6 (el modelo que acaban de lanzar esta semana) contra los ataques que GPT-Red había descubierto. Los resultados:
Contra GPT-5 (versión anterior): más del 90% de los ataques funcionaban
Contra GPT-5.6 (versión actual): menos del 23% funcionan
🧠 Por qué esto importa más allá de OpenAI
GPT-Red no es solo una curiosidad técnica. Es una señal de hacia dónde va la seguridad de los sistemas de IA.
Los modelos de IA ya no viven en una caja. Están conectados a tu CRM, a tu base de datos de clientes, al código de tu producto, a tu cuenta de correo. Cuando un agente de IA tiene acceso a todo eso, el radio de explosión de un ataque exitoso se multiplica.
Lo que OpenAI está haciendo con GPT-Red es reconocer en voz alta que los humanos solos no pueden seguir el ritmo.
¿La parte incómoda? GPT-Red no va a ser público. OpenAI no lo va a lanzar. Y si alguien intenta copiarlo, tendrá que replicar más de un año de trabajo respaldado por una de las empresas con más recursos computacionales del mundo.
🚀 Qué pasó con Hugging Face
Un modelo de OpenAI creado precisamente para hacer hacking ético (supuestamente), descubrió vulnerabilidades en la web de Hugging Face y atacó el sistema. No se ha conformado que sea GPT-Red, pero es bastante coincidencia.
¿Por qué lo hace en real y no en un entorno controlado? Porque si le das accesoa Internet, ¿por qué no intentarlo? Ahora en serio, es un problema grave de desalineamiento.
¿Sirvió para arreglar las vulnerabilidades? Sí, pero se perdió la confianza en el sistema, porque no sabremos que estará intentando ahora.
🚀 Cómo replicarlo hoy (en tu escala)
No tienes que ser OpenAI para aplicar la lógica del red-teaming a tu trabajo con IA. Aquí va una versión adaptada:
Identifica qué sistemas tienen agentes de IA con acceso a datos sensibles (correo, CRM, documentos internos).
Prueba tú mismo a “hackear” los prompts que usas en tu empresa: ¿qué pasa si alguien mete instrucciones contradictorias en un documento que el agente va a leer?
Usa un modelo diferente para revisar las respuestas del primero: pídele a Claude o a GPT que actúen como “revisores críticos” de lo que produce tu agente principal.
Establece instrucciones de sistema explícitas: dile al agente qué no debe hacer nunca, independientemente de lo que encuentre en los documentos que procese.
Asume que alguien intentará manipular tus prompts si tu agente tiene acceso a datos externos (webs, PDFs de clientes, correos entrantes).
Documenta los fallos que encuentres y actualiza las instrucciones del sistema. Esto es exactamente lo que hace OpenAI, a gran escala.
No necesitas una IA hacker para empezar. Necesitas la mentalidad de que tu sistema puede ser atacado y el hábito de buscarlo antes de que lo haga otro.
❓ Preguntas frecuentes
¿Esto significa que ChatGPT o GPT-5.6 son ahora “seguros”?
No. Que solo el 23% de los ataques conocidos funcionen es una mejora enorme, pero no es inmunidad. Aparecerán nuevos tipos de ataques. La seguridad en IA es un proceso continuo, no un estado final.
¿Afecta esto a los usuarios normales de ChatGPT?
Indirectamente, sí y en positivo: cada mejora en robustez hace que sea más difícil que alguien manipule el modelo para que haga cosas que no debería. Pero los ataques más sofisticados están pensados para entornos empresariales donde la IA tiene acceso a sistemas reales.
¿Qué otras empresas hacen algo similar?
Anthropic publicó en febrero de 2025 su propio método para proteger modelos contra jailbreaks. Google DeepMind también trabaja en esta dirección. El red-teaming automatizado se está convirtiendo en estándar del sector.
¿Sustituye esto a los humanos que hacen red-teaming?
No. Lo complementa. GPT-Red es muy bueno encontrando variaciones de ataques conocidos, pero los humanos siguen siendo mejores en ataques conversacionales o creativos. OpenAI usa ambos en paralelo.
¿Puedo usar esta técnica con los modelos que ya tengo?
La idea del bucle de auto-juego requiere recursos computacionales enormes. Pero la lógica básica —usar un modelo para atacar a otro y aprender de los fallos— es algo que puedes explorar a pequeña escala con las herramientas disponibles hoy.
✉️ Para cerrar
En Paratodosia llevamos tiempo insistiendo en que usar IA de forma profesional no es solo saber escribir buenos prompts. Es entender cómo funcionan estos sistemas por dentro, cuáles son sus límites y cómo pueden ser manipulados.
Lo que OpenAI ha hecho con GPT-Red es exactamente eso: tomarse en serio los límites del sistema y trabajar para empujarlos.
Si quieres aprender a trabajar con agentes de IA de forma segura y eficaz en tu empresa, echa un vistazo a nuestros cursos en Paratodosia.




