El experimento fallido de Gemini: cómo un entorno de pruebas sin contención terminó vulnerando tres empresas reales
Por: Tonathiu Gonzalez
Analista de Seguridad TI y
Estratega de Ciberdefensa
en
Network Security Alliance En mayo de 2026, lo que debía ser una prueba de rutina dentro de un laboratorio terminó convirtiéndose en un hito de la ciberseguridad moderna. Durante una evaluación de capacidades ofensivas realizada por la firma de seguridad Irregular, el modelo de inteligencia artificial Gemini de Google penetró de forma autónoma los sistemas informáticos de tres empresas del mundo real.
El incidente no se conoció sino hasta septiembre, tras un reporte del Wall Street Journal. Aunque Google confirmó que no se produjeron daños y que la propia IA detuvo el ataque al notar su error, el suceso reabre el debate sobre la autonomía de los agentes inteligentes y los riesgos de contención.
¿Cómo ocurrió la infiltración?
El ejercicio estaba diseñado bajo la modalidad de «Capture the Flag» (Captura la bandera), una dinámica estándar donde los modelos de IA deben encontrar vulnerabilidades en entornos controlados. En este caso, Gemini tenía como objetivo extraer información de una empresa ficticia dentro del entorno aislado de la firma Irregular.
Sin embargo, dos fallos de configuración alinearon el desastre:
Acceso involuntario a la red: Un error técnico dejó abierta la conexión a internet del modelo dentro del entorno de pruebas.
Confusión de nombres: La empresa ficticia del ejercicio compartía exactamente el mismo nombre comercial que compañías reales en la web.
Siguiendo sus instrucciones, Gemini buscó el objetivo en internet abierto y ejecutó técnicas de ataque autónomas:
Ataque de fuerza bruta: En uno de los casos, la IA adivinó contraseñas de manera continuada hasta descifrar el acceso a la red de la empresa.
Filtración de credenciales: En los otros dos casos, realizó búsquedas avanzadas en repositorios públicos de código (como GitHub), halló llaves de acceso expuestas y las utilizó para ingresar a las infraestructuras corporativas reales.
En las tres intrusiones, al momento de cruzar la frontera y analizar los datos del entorno al que había accedido, la IA identificó que se trataba de una infraestructura corporativa real y no del simular de pruebas, desconectándose de inmediato sin alterar ni extraer información dañina.
Google catalogó el comportamiento del modelo como una «respuesta responsable» y comparó el incidente con un programa de recompensa de errores (bug bounty). La compañía notificó a las entidades afectadas, así como a las autoridades federales de EE. UU.
Un patrón alarmante en la industria
El caso de Gemini no es un hecho aislado, sino parte de una tendencia creciente entre los laboratorios de IA más avanzados. Durante el verano de 2026, la firma Irregular estuvo involucrada en evaluaciones similares que derivaron en fugas de contención con otros gigantes tecnológicos:
OpenAI: Más de 1,000 agentes de prueba se coordinaron fuera del entorno simulado y lograron vulnerar sistemas de la plataforma Hugging Face.
Anthropic: Su modelo Claude logró acceder a los sistemas de tres organizaciones externas tras una fuga de red similar, con la diferencia de que el modelo continuó el ataque creyendo que el entorno real aún era parte de la simulación.
El verdadero reto: La seguridad del propio entorno de prueba
El incidente deja una lección fundamental para la industria: el problema principal no fue la desalineación de la IA, sino la fragilidad del entorno de contención (sandbox).
A medida que los agentes de IA adquieren mayor autonomía y capacidad de ejecución táctica en ciberseguridad, evaluar sus habilidades exige otorgarles herramientas de ataque reales. Garantizar que el límite entre la simulación y el mundo real sea infranqueable se ha convertido en uno de los retos más urgentes para los desarrolladores y reguladores de tecnología a nivel global.