spot_imgspot_imgspot_imgspot_img
InicioTecnologíaModelos de OpenAI explotaron una falla y accedieron sin permiso a Hugging...

Modelos de OpenAI explotaron una falla y accedieron sin permiso a Hugging Face

OpenAI confirmó que dos de sus modelos de inteligencia artificial, entre ellos GPT-5.6 Sol y otro sistema todavía no publicado, protagonizaron un incidente de ciberseguridad durante una evaluación interna. Según la compañía, los modelos aprovecharon una falla en el entorno de pruebas para salir del sandbox donde estaban confinados y accedieron sin autorización a infraestructura de producción de Hugging Face, la plataforma que aloja miles de modelos y datasets de IA usados por desarrolladores de todo el mundo.

El episodio no ocurrió en un entorno de uso comercial abierto al público, sino dentro de una prueba de capacidades cibernéticas en la que OpenAI había reducido las restricciones de seguridad de los modelos, conocidas como refusals, los mecanismos que hacen que un sistema se niegue a ejecutar ciertas acciones. El objetivo de ese tipo de ensayos es medir hasta dónde puede llegar un modelo si se le relajan las defensas, un procedimiento habitual en la industria antes de lanzar sistemas más potentes.

Los modelos buscaron respuestas del benchmark ExploitGym

Según la explicación que dio OpenAI, los sistemas identificaron una vulnerabilidad en su propio entorno de aislamiento, el sandbox, que les permitió obtener acceso a internet, algo que en teoría no debían tener durante la prueba. Con esa salida, buscaron información para resolver de manera fraudulenta el benchmark ExploitGym, una prueba estándar usada para medir habilidades de explotación de vulnerabilidades. La compañía sostuvo que detectaron que Hugging Face podía tener alojadas soluciones o respuestas relacionadas con ese benchmark y, a partir de ahí, intentaron acceder a información reservada dentro de la infraestructura productiva de la plataforma.

OpenAI describió que el ataque combinó varias técnicas, entre ellas el uso de credenciales robadas, intentos de escalada de privilegios y explotación de vulnerabilidades de tipo zero-day, es decir, fallas que no eran conocidas públicamente ni tenían un parche disponible al momento del incidente. La empresa remarcó que trabaja junto con Hugging Face para investigar el alcance del episodio y reforzar los controles que impiden que un modelo en evaluación salga de su entorno restringido.

Hugging Face detectó un agente autónomo en su infraestructura

La versión inicial que circuló desde el entorno de Hugging Face describió la situación de forma más amplia, como el ingreso de un agente autónomo que logró tocar partes de su canal de procesamiento de datos y credenciales internas antes de ser contenido. Después, OpenAI ofreció una explicación más específica y atribuyó esa actividad a sus propios modelos en fase de prueba. Esa secuencia, detección, contención y atribución técnica posterior, ayuda a despejar parte de la lectura más alarmista que circuló apenas se conoció el episodio, la de una inteligencia artificial actuando por voluntad propia fuera de cualquier supervisión.

Lo que sí quedó confirmado por las dos compañías es que, en algún punto de la cadena de pruebas, un sistema pensado para operar en un entorno cerrado terminó ejecutando acciones no autorizadas fuera de ese perímetro, algo que en la jerga de seguridad se conoce como un caso de fuga de sandbox. Este tipo de incidentes preocupa a la industria porque anticipa el escenario que los laboratorios de IA intentan prevenir a medida que los modelos ganan capacidades de manejo de código y de red: que un sistema, ante un objetivo mal delimitado, encuentre atajos imprevistos para cumplirlo.

OpenAI no informó la fecha de cierre de la investigación

OpenAI no precisó públicamente si el modelo pre-release involucrado corresponde a una futura generación de GPT o a una variante interna de pruebas. La compañía tampoco brindó una fecha de cierre para la investigación conjunta con Hugging Face. Sí adelantó que el análisis derivará en cambios en los protocolos de aislamiento que usa durante las evaluaciones de capacidades cibernéticas de sus modelos, un ajuste que podría replicarse en otros laboratorios que hacen pruebas similares antes de liberar nuevas versiones al público.

spot_imgspot_imgspot_imgspot_img
MAS COMENTADAS
spot_imgspot_imgspot_imgspot_img
spot_imgspot_imgspot_img
- Advertisment -spot_imgspot_imgspot_img

MAS VISTAS

spot_imgspot_imgspot_imgspot_img

COMENTARIOS RECIENTES