Se informa que la IA de OpenAI se salió de control y hackeó otra empresa

Compartir:
En resumen
- OpenAI dice que sus modelos de IA hackearon Hugging Face para hacer trampa en un test.
- GPT-5.6 Sol y un modelo más potente aún no lanzado escaparon de un entorno de test aislado.
- Hugging Face solucionó la brecha y afirma que ningún modelo público se vio afectado.
OpenAI dice que dos de sus modelos de IA escaparon de un entorno de prueba seguro y hackearon Hugging Face. Los modelos hicieron esto para hacer trampa en una evaluación interna de ciberseguridad.
La compañía reveló el incidente el martes. Estuvieron involucrados GPT-5.6 Sol, el modelo público más potente de OpenAI, y un modelo aún más avanzado que no ha sido lanzado.
Cómo los modelos de OpenAI hackearon Hugging Face
OpenAI estaba probando los dos modelos con ExploitGym, un benchmark público gratuito que mide habilidades de hacking. Durante la prueba, la empresa quitó las protecciones normales que limitan los ciberataques.
Los modelos descubrieron que Hugging Face, una plataforma que aloja modelos de IA de código abierto, guardaba las soluciones del benchmark. Luego, aprovecharon debilidades tanto en los sistemas de investigación de OpenAI como en los servidores de producción de Hugging Face.
Esa ruta los llevó directamente a las respuestas en la base de datos de Hugging Face. OpenAI dijo que los modelos estaban «hipercentrados» en resolver la prueba. Llamó al evento «un incidente cibernético sin precedentes» en su informe.
El episodio ocurre en medio de un debate más amplio sobre los límites de seguridad en IA. Los principales laboratorios ya realizan pruebas estrictas de riesgos cibernéticos en los modelos antes de su lanzamiento.
Hugging Face afirma que el daño está controlado
Hugging Face informó primero sobre el ataque en una declaración publicada el 16 de julio. En ese momento, solo sabían que un agente de IA autónoma estuvo detrás del incidente. El atacante accedió a conjuntos de datos internos y credenciales de servicio.
La defensa se topó con un problema inusual. Los límites de seguridad de un modelo estadounidense bloquearon el trabajo forense. El equipo, entonces, usó GLM 5.2, un modelo abierto de Z.ai, una empresa de IA china.
Desde entonces, Hugging Face ha cerrado los caminos de código explotados y rotó todas las credenciales afectadas. Dice que ningún modelo público, conjunto de datos, ni servicios visibles para los usuarios fueron modificados.
El CEO Clem Delangue compartió una declaración en respuesta a la revelación de OpenAI.
«Este incidente, posiblemente el primero de su tipo, demuestra algo que siempre hemos creído: la seguridad en IA no se solucionará con una sola empresa trabajando en secreto. Se resolverá abiertamente, de forma colaborativa, con amplio acceso a la IA para cada defensor, en todas partes.»
Ahora, ambas empresas investigan juntas. OpenAI planea compartir todos los detalles cuando finalice ese trabajo. La pregunta es si los métodos actuales para controlar estos incidentes serán suficientes a medida que los modelos sean cada vez más avanzados.
Leer el artículo en BeInCryptoLeer más




