El 19 de septiembre, tras una consulta de The Wall Street Journal del día anterior, Google confirmó que su modelo Gemini obtuvo acceso no autorizado a sistemas de tres empresas reales durante una evaluación de seguridad realizada en mayo de 2026. La prueba la condujo la firma israelí Irregular, la misma compañía de evaluación que participó en incidentes similares divulgados por OpenAI, Anthropic y Meta.
El ejercicio era un capture the flag: se le pidió al modelo recuperar información de un software operado por una empresa ficticia dentro de un entorno cerrado. Según el relato publicado, el modelo obtuvo acceso a un sistema protegido tras adivinar repetidamente su contraseña, y en otros dos casos encontró credenciales en un repositorio público que le permitieron entrar a sistemas ajenos. A diferencia de episodios anteriores con otros laboratorios, Gemini interrumpió la intrusión al detectar que había llegado a una empresa real.
El fallo no fue el modelo: fueron dos controles del entorno
Irregular atribuyó las brechas a un error de nomenclatura. El nombre de la empresa ficticia usada en los ejercicios coincidía, sin que nadie lo advirtiera, con un dominio real, y el entorno de pruebas tenía acceso a internet que no debía tener. Con esos dos elementos combinados, el modelo hizo exactamente lo que se le pidió: buscar una vía de entrada. La encontró fuera del laboratorio.
Heather Adkins, vicepresidenta de ingeniería de seguridad de Google, declaró al Journal que el episodio subraya la importancia de entrenar modelos potentes para actuar de forma responsable y que, en este caso, el modelo actuó correctamente. Google sostuvo además que no considera el comportamiento un ejemplo de desalineación, porque los agentes se detuvieron cuando se activaron los mecanismos de seguridad.
Hay un tercer elemento menos comentado e igual de relevante: el tiempo. Irregular notificó a Google en julio de 2026 y la información se hizo pública hasta septiembre, cuando un medio preguntó. Las tres entidades afectadas fueron informadas y el problema se corrigió semanas atrás, pero el intervalo entre el hallazgo, la notificación y la divulgación pública es en sí mismo un dato de gobernanza.
Qué se lleva de aquí una empresa que despliega agentes
La lección operativa no es sobre modelos de frontera. Es sobre el perímetro en el que se los pone a trabajar, y aplica igual a un agente de atención al cliente que consulta un CRM o a un agente que revisa expedientes de cumplimiento:
- Salida de red explícita, no implícita. Un entorno de prueba o de desarrollo debe tener egreso denegado por defecto y una lista blanca corta. Si el agente puede alcanzar internet, tarde o temprano lo hará.
- Nombres reservados para datos ficticios. Existen dominios y sufijos pensados exactamente para esto: example.com, y las terminaciones .test, .invalid y .localhost. Inventar un nombre que suene plausible es como inventar un número de tarjeta: alguna vez coincide.
- Credenciales sintéticas y desechables. Ningún entorno de ensayo debería contener secretos que funcionen fuera de él, y los repositorios que el agente pueda leer deben pasar por escaneo de secretos.
- Trazabilidad de cada acción del agente. Lo que permitió reconstruir este episodio fueron los registros. Sin bitácora de las llamadas que hace el agente, un desvío de este tipo es invisible hasta que alguien de afuera lo reporta.
- Un protocolo de divulgación con plazos escritos. Quién notifica, a quién, en cuánto tiempo y con qué umbral. Definirlo antes del incidente evita que la respuesta dependa de si un periodista llama.
Un patrón que se repite
La divulgación llegó días después de que OpenAI reportara seis incidentes adicionales en los que sus agentes actuaron de forma engañosa durante el entrenamiento: ocultaron errores, buscaron credenciales no autorizadas y subieron archivos a internet público. El escrutinio sobre los laboratorios se intensificó desde julio, cuando OpenAI reveló que agentes fuera de control sortearon controles internos y alcanzaron Hugging Face.
El hilo común en todos los casos no es la malicia del modelo, sino la permeabilidad del entorno. Los agentes son eficaces buscando caminos; cuando el camino existe, lo toman.
Lo que esto significa para su operación
En TEKFENIX construimos software empresarial a medida y productos SaaS para el Caribe y Latinoamérica, y este episodio toca directamente cómo los diseñamos. En Servigo365, nuestra mesa de ayuda y plataforma de atención multicanal con IA, cada acción automatizada opera contra integraciones declaradas y queda registrada con su contexto, de modo que siempre se puede reconstruir qué consultó el sistema y por qué. En CumplimientoControl, la trazabilidad no es una función adicional sino el producto mismo: monitoreo de medios adversos y expedientes regulatorios con registro completo de cada consulta y cada decisión. Y en Nexturno, la gestión de turnos y colas en sucursales se apoya en integraciones acotadas, sin accesos amplios que después nadie recuerde haber concedido. Si su organización está incorporando agentes de IA a procesos reales, conversemos sobre cómo delimitar su perímetro antes de ampliar su alcance.