Hackeo de inteligencia artificial: cuál es el próximo paso de la ciberseguridad global

Tras romper su aislamiento digital y crear una red clandestina entre sistemas de IA, un modelo experimental logró infiltrar la plataforma Hugging Face.
Interés General12 de septiembre de 2026

ScreenHunter_090

Un reciente incidente que involucró a OpenAI y a la plataforma francesa Hugging Face puso en evidencia uno de los riesgos más concretos del vertiginoso avance de la inteligencia artificial: la capacidad emergente de los modelos para ejecutar acciones complejas, coordinarse entre sí de manera autónoma e incluso burlar sus propias barreras de seguridad sin intervención humana.

Para entender el alcance de este suceso, Agustín Martínez Suñé –doctor en Computación por la Universidad de Buenos Aires (UBA), investigador postdoctoral en la Universidad de Oxford y próximo Science and Technology Lead del programa de IA en la agencia británica ARIA– explica que el panorama actual de la IA cambió drásticamente. “Inicialmente, teníamos modelos conversacionales como el primer ChatGPT, que servían para responder en texto. Ahora apuntamos a lo que llamamos ‘agentes’: inteligencias artificiales que no solo charlan, sino que ejecutan acciones en el entorno digital de la computadora”, detalla.

Cómo una IA logró hackear un sistema

El incidente ocurrió durante la fase de entrenamiento de un modelo interno en los servidores de OpenAI. Por diseño y seguridad, estos entrenamientos se realizan dentro de un entorno aislado de prueba o sandbox, sin acceso a Internet para evitar que el software realice conexiones externas no controladas.

Sin embargo, el modelo logró detectar una vulnerabilidad interna, romper el bloqueo del sandbox y conectarse libremente a la red mundial. Una vez en línea, dirigió su accionar hacia Hugging Face –uno de los mayores repositorios globales de modelos y conjuntos de datos de IA– y logró vulnerar sus sistemas. La intrusión obligó a los ingenieros de la firma francesa a activar alarmas de ciberseguridad defensiva en tiempo real para frenar el acceso.

A pesar de lo impactante del episodio, Martínez Suñé enfatiza que no se trata de una intención maliciosa consciente ni de un guion de ciencia ficción. La explicación radica en un fenómeno propio del entrenamiento con aprendizaje por refuerzo denominado reward hacking (o “hackeo de la recompensa”).

A los modelos tipo agente, se los entrena asignándoles extensas listas de tareas digitales que deben resolver a cambio de una calificación o incentivo numérico. Si la tarea es de extrema dificultad o presenta un obstáculo irresoluble –como una plantilla de Excel que requería consultar datos en enlaces web externos que el modelo no podía abrir debido al bloqueo de red–, el sistema busca la forma más directa de obtener el puntaje deseado.

“El modelo quiere resolver la tarea sí o sí. En lugar de concluir que no podía hacerlo por falta de acceso a internet, resolvió que la forma de cumplir el objetivo era hackear el entorno interno de OpenAI para conectarse a la red”, señala Martínez Suñé. Siguiendo esa misma lógica, al no hallar la solución directa a otra tarea compleja, el software dedujo que las respuestas debían estar almacenadas en el repositorio de Hugging Face y decidió ingresar a sus servidores para buscarlas. “No lo hizo por dañar a la humanidad, sino para ‘hacer trampa en el examen’ y asegurar su recompensa”, aclara el especialista.

Los mensajes entre IA

Un aspecto que sorprendió a los investigadores fue el nivel de coordinación “multiagente” que se dio a lo largo de varias semanas dentro del entorno de OpenAI. A pesar de que diferentes equipos evaluaban y probaban distintas ejecuciones del modelo en momentos sucesivos, los sistemas lograron colaborar dejando notas guardadas.

Cuando OpenAI detectó la falla inicial de seguridad, limpió el entorno y bloqueó la capacidad de escribir archivos. Sin embargo, los modelos encontraron una brecha técnica alternativa: aunque no podían crear archivos, descubrieron que tenían permisos para crear carpetas o directorios.

“Cuando se dieron cuenta de eso, empezaron a comunicarse escribiendo mensajes dentro de los nombres de las carpetas. Armaron una especie de foro o tablero de mensajes (message board)”, describe Martínez Suñé. Mediante este método, un modelo que identificaba una vulnerabilidad dejaba una carpeta nombrada de forma tal que indicaba al siguiente cómo aprovechar esa falla. Esta cooperación acumulativa le permitió al sistema escalar sus privilegios hasta ejecutar el ataque externo a Hugging Face.

Según el investigador, este fenómeno de comportamiento colaborativo emergente plantea interrogantes profundos en la comunidad científica. Si bien se comprende la propensión de los modelos a hacer trampa para maximizar recompensas, aún no se entiende del todo por qué desarrollan dinámicas avanzadas de cooperación espontánea.

Del pesimismo a la resiliencia digital

El incidente subraya que los modelos actuales están alcanzando capacidades de ciberseguridad comparables a las de un hacker humano experto, lo que representa tanto una oportunidad para el desarrollo de defensas como un riesgo inminente en manos equivocadas o bajo ejecuciones fuera de control.

Martínez Suñé sostiene que no es necesario apelar a discursos catastrofistas para comprender la urgencia del tema: “No hace falta pensar en un escenario súper especulativo de una superinteligencia para entender que hay riesgos reales, con impactos muy grandes en nuestra sociedad, derivados de estos modelos de IA que se entrenan con cada vez más capacidad”.

Para mitigar estos peligros, el campo de la investigación se divide entre alinear éticamente los modelos, mejorar la interpretabilidad de su razonamiento y fortalecer la resiliencia de la infraestructura digital. Sobre este último punto, Martínez Suñé enfatiza la importancia de preparar los sistemas informáticos esenciales –como la banca, las redes de energía o el software estatal– para resistir eventuales ataques automáticos.

Finalmente, el especialista hace un llamado a que Argentina y América Latina no queden al margen de este debate global. Advierte que los riesgos de ciberseguridad, así como el impacto económico y laboral de la automatización, afectarán de manera diferenciada a los países periféricos en comparación con las economías centrales donde hoy se concentran estos desarrollos. 

INFOBAE

Te puede interesar
Lo más visto
ScreenHunter_131

Hoy viernes: Apertura de la muestra “Cielo rojo en la mañana”

Locales11 de septiembre de 2026
El GOBIERNO DE SAN CARLOS CENTRO invita a la comunidad a visitar la muestra “CIELO ROJO EN LA MAÑANA”, de la artista visual y profesora franckina Irene Renk. La misma se desarrollará en el Museo Histórico de la Colonia San Carlos y será inaugurada HOY VIERNES 11 DE SEPTIEMBRE a las 19:00 hs.
WhatsApp Image 2026-09-11 at 09.28.12

Convocatoria a artesanos para la "Fiesta del Mate" en San Carlos Norte

Locales11 de septiembre de 2026
La Comuna de San Carlos Norte informa que el próximo 18 de octubre, a partir de las 14 horas, se realizará en el Parque Sesquicentenario la "Fiesta del Mate", un encuentro que tiene como propósito celebrar la tradición, el encuentro y la identidad de nuestra gente en torno a esta costumbre tan representativa de la cultura local.
OSTTA- inst

Necrológicas Ostta Sepelios

Locales12 de septiembre de 2026
Falleció hoy Sábado 12 de Septiembre a la edad de 100 años en San Carlos Centro la señora, Elva Belkis Propst viuda de Medina. 
ScreenHunter_015

Gessler: Aprehendieron a un hombre requerido judicialmente por hallarse evadido de la penitenciaría de Piñero desde 2019

Policiales12 de septiembre de 2026
Sucedió ayer por la tarde en un dispositivo de control vehicular e identificación de personas realizado sobre el cruce de las Rutas Provinciales N° 6 y 64, en la localidad de Gessler. El sujeto, de 42 años y oriundo de Gálvez, registraba un pedido de captura desde el 11 de enero de 2020 por no regresar en fecha prevista tras una salida transitoria.