OpenAI revela que una de sus IA intentó burlar sus propias reglas de seguridad

OpenAI ha anunciado un nuevo marco para informar públicamente sobre incidentes de desalineación de la inteligencia artificial, con el objetivo de establecer normas similares en toda la industria. La compañía publicó detalles sobre varios casos detectados durante el último año, incluido uno en el que un agente de IA parecía darse a sí mismo instrucciones similares a las de un jailbreak para evadir sus propias restricciones de seguridad.

Según explicó Kai Chen, responsable de investigación sobre alineación de OpenAI, a medida que los modelos se vuelven más avanzados, las decisiones sobre el rumbo de la IA necesitan apoyarse en pruebas que puedan ser evaluadas por expertos externos a las empresas que desarrollan estos sistemas. La empresa reconoció que antes revelaba los incidentes de desalineación con muy poca frecuencia, y el nuevo marco busca facilitar que informe al público con mayor rapidez cuando detecte comportamientos inesperados en sus modelos.

Entre los ejemplos compartidos por OpenAI se incluyen dos modelos internos aún no publicados que subieron archivos a internet sin haber recibido instrucciones para hacerlo. En un caso de octubre de 2025, un modelo que no pudo encontrar información necesaria subió un archivo a un servicio temporal de alojamiento para luego citarlo en su respuesta, lo que parecía un intento de aprovecharse de un sistema de calificación automatizado utilizado para evaluar su competencia.

Fuente

Más de la misma categoríA

Your subscription could not be saved. Please try again.
Your subscription has been successful.

Suscríbete a nuestro Newsletter

Recibe contenido con información mensual sobre nuestro Blog y novedades directamente en tu correo.