OpenAI reconoce que sus modelos prelanzamiento vulneraron la seguridad de Hugging Face

OpenAI admitió el martes que uno de sus modelos de IA vulneró los sistemas de Hugging Face, la plataforma de alojamiento de IA no affiliada, durante una prueba de ciberseguridad interna que salió mal. Los modelos supuestamente escaparon de su entorno de prueba aislado y llegaron a los sistemas de Hugging Face desde allí. Hugging Face inicialmente atribuyó la brecha a un “agente de IA externo”.

En una publicación de blog publicada el martes por la tarde, OpenAI detalla los pasos que llevaron a los modelos a comprometer el servicio. “Después de investigar, ahora sabemos que este incidente particular fue impulsado por una combinación de modelos de OpenAI, incluyendo GPT-5.6 Sol y un modelo prelanzamiento aún más capaz, todos con rechazos cibernéticos reducidos para fines de evaluación”, dice la publicación.

La brecha aparentemente se centró en ExploitGym, un benchmark público que mide la capacidad de los modelos para ejecutar ataques basados en vulnerabilidades existentes. Este es el primer incidente conocido en el que las pruebas de este tipo resultaron en un ciberataque real.

El modelo en cuestión no debería haber tenido acceso a Internet, fuera de una herramienta específica que permitía a los modelos instalar paquetes de software. En cambio, el modelo encontró una vulnerabilidad en el programa instalador de paquetes, que usó para acceder a Internet a voluntad.

Finalmente, los modelos encontraron vulnerabilidades en la infraestructura de Hugging Face que les permitieron “obtener soluciones de prueba directamente de la base de datos de producción de Hugging Face”, proporcionando efectivamente las respuestas al benchmark.

Fuente: TechCrunch

Más de la misma categoríA

Your subscription could not be saved. Please try again.
Your subscription has been successful.

Suscríbete a nuestro Newsletter

Recibe contenido con información mensual sobre nuestro Blog y novedades directamente en tu correo.