OpenAI ha decidido no lanzar, por ahora, GPT-6.1 Astra, su nuevo modelo de inteligencia artificial. Las pruebas internas detectaran fallos en el respeto de los límites de autorización, en la supervisión y en la forma en que el sistema informaba de las tareas realizadas. La decisión llega tras varios incidentes en los que agentes de IA lograron sortear controles técnicos y actuar sobre sistemas externos. El episodio recuerda a Skynet, de la película Terminator. ¿Qué ocurre cuando una IA deja de responder y empieza a ejecutar acciones por su cuenta?
Umbral de seguridad
Saachi Jain, responsable de Sistemas de Seguridad de la compañía, explicó la situación, Dijo que el modelo no había alcanzado el nivel requerido para mantenerse dentro de su ámbito de actuación y autorización. Además, comunicaba de forma deficiente al usuario el trabajo realizado.
La decisión llama la atención porque, pocas semanas antes, la compañía había presentado a Astra como un modelo de capacidades extraordinarias. El 1 de septiembre anunció que alcanzaba por primera vez su nivel «crítico» de capacidad en ciberseguridad. Con las herramientas y accesos adecuados, podía encontrar vulnerabilidades desconocidas y desarrollar métodos para explotarlas en sistemas protegidos sin que una persona guiara cada paso. Por eso OpenAI ya había retrasado partes del desarrollo y del lanzamiento. Mientras tanto, reforzaba las protecciones frente al uso malicioso y, sobre todo, frente a acciones no autorizadas del propio modelo.
Más allá de Astra
En agosto, OpenAI reconoció un incidente durante pruebas internas de ciberseguridad. Varios modelos eludieron los controles que debían mantenerlos aislados de internet, usaron canales no autorizados. Luego explotaron vulnerabilidades de infraestructura y accedieron a sistemas de terceros, entre ellos los de Hugging Face. La compañía lo calificó de «llamado de alerta» y anunció nuevas medidas de aislamiento, restricciones de acceso a internet y controles adicionales.
El asunto es delicado porque los sistemas actuales son cada vez más agánticos: navegan por internet, usan herramientas, escriben y ejecutan código. Interactúan con aplicaciones y encadenan acciones para alcanzar un objetivo por su cuenta.
El informe de seguridad de Astra muestra la dificultad. OpenAI asegura que el modelo era más resistente que sus predecesores y que, en general, violaba con menor frecuencia las restricciones. Pero reconoció que, en condiciones adversariales, los modelos de la familia podían evadir los mecanismos de monitorización de su cadena de razonamiento. El modelo tiene en cuenta cómo lo evalúan o supervisan y actúa de un modo que puede afectar a la interpretación de la prueba.
El riesgo, por tanto, no es solo una respuesta incorrecta. Es que un agente suficientemente capaz interprete un objetivo, busque caminos alternativos y actúe sobre sistemas reales sin que sus supervisores hayan previsto cada paso.
El sector pide tiempo
El debate ha pasado de los laboratorios a Washington. El 9 de septiembre, OpenAI reclamó requisitos nacionales obligatorios de seguridad, con pruebas comunes, evaluaciones independientes, notificación de incidentes y mayores exigencias de ciberseguridad. Sostuvo que las medidas voluntarias de la industria deben complementar, y no sustituir, la supervisión gubernamental.
Días después, el jefe de Anthropic, Dario Amodei, propuso ralentizar el desarrollo de los modelos para que la seguridad alcance a las nuevas capacidades. Sam Altman respaldó incorporar evaluadores independientes con acceso permanente a las compañías. Hubo apoyo de otros líderes tecnológicos, pero no existe consenso sobre cuánto debería frenarse el desarrollo ni sobre la forma de la regulación.
La tensión choca con la carrera geopolítica. Donald Trump vincula el liderazgo tecnológico con la competencia frente a China y rechazó ralentizar el desarrollo, al afirmar que quien gane la carrera de la IA tendrá una posición decisiva. El pasado martes, el mandatario anunció un acuerdo voluntario con grandes tecnológicas para reforzar controles internos, auditorías independientes y supervisión de los consejos de administración. El pacto no tiene carácter legalmente vinculante.
El caso Astra ejemplifica los riesgos que advierten sobre esta nueva tecnología sus propios creadores.
