NoticiasNews

Gemini entró en los sistemas de tres empresas reales durante una prueba: el fallo no estuvo en el modelo, estuvo en el entornoGemini Reached Three Real Companies During a Test: The Failure Was Not the Model, It Was the Environment

2026-09-20

El 19 de septiembre, tras una consulta de The Wall Street Journal del día anterior, Google confirmó que su modelo Gemini obtuvo acceso no autorizado a sistemas de tres empresas reales durante una evaluación de seguridad realizada en mayo de 2026. La prueba la condujo la firma israelí Irregular, la misma compañía de evaluación que participó en incidentes similares divulgados por OpenAI, Anthropic y Meta.

El ejercicio era un capture the flag: se le pidió al modelo recuperar información de un software operado por una empresa ficticia dentro de un entorno cerrado. Según el relato publicado, el modelo obtuvo acceso a un sistema protegido tras adivinar repetidamente su contraseña, y en otros dos casos encontró credenciales en un repositorio público que le permitieron entrar a sistemas ajenos. A diferencia de episodios anteriores con otros laboratorios, Gemini interrumpió la intrusión al detectar que había llegado a una empresa real.

El fallo no fue el modelo: fueron dos controles del entorno

Irregular atribuyó las brechas a un error de nomenclatura. El nombre de la empresa ficticia usada en los ejercicios coincidía, sin que nadie lo advirtiera, con un dominio real, y el entorno de pruebas tenía acceso a internet que no debía tener. Con esos dos elementos combinados, el modelo hizo exactamente lo que se le pidió: buscar una vía de entrada. La encontró fuera del laboratorio.

Heather Adkins, vicepresidenta de ingeniería de seguridad de Google, declaró al Journal que el episodio subraya la importancia de entrenar modelos potentes para actuar de forma responsable y que, en este caso, el modelo actuó correctamente. Google sostuvo además que no considera el comportamiento un ejemplo de desalineación, porque los agentes se detuvieron cuando se activaron los mecanismos de seguridad.

Hay un tercer elemento menos comentado e igual de relevante: el tiempo. Irregular notificó a Google en julio de 2026 y la información se hizo pública hasta septiembre, cuando un medio preguntó. Las tres entidades afectadas fueron informadas y el problema se corrigió semanas atrás, pero el intervalo entre el hallazgo, la notificación y la divulgación pública es en sí mismo un dato de gobernanza.

Qué se lleva de aquí una empresa que despliega agentes

La lección operativa no es sobre modelos de frontera. Es sobre el perímetro en el que se los pone a trabajar, y aplica igual a un agente de atención al cliente que consulta un CRM o a un agente que revisa expedientes de cumplimiento:

  • Salida de red explícita, no implícita. Un entorno de prueba o de desarrollo debe tener egreso denegado por defecto y una lista blanca corta. Si el agente puede alcanzar internet, tarde o temprano lo hará.
  • Nombres reservados para datos ficticios. Existen dominios y sufijos pensados exactamente para esto: example.com, y las terminaciones .test, .invalid y .localhost. Inventar un nombre que suene plausible es como inventar un número de tarjeta: alguna vez coincide.
  • Credenciales sintéticas y desechables. Ningún entorno de ensayo debería contener secretos que funcionen fuera de él, y los repositorios que el agente pueda leer deben pasar por escaneo de secretos.
  • Trazabilidad de cada acción del agente. Lo que permitió reconstruir este episodio fueron los registros. Sin bitácora de las llamadas que hace el agente, un desvío de este tipo es invisible hasta que alguien de afuera lo reporta.
  • Un protocolo de divulgación con plazos escritos. Quién notifica, a quién, en cuánto tiempo y con qué umbral. Definirlo antes del incidente evita que la respuesta dependa de si un periodista llama.

Un patrón que se repite

La divulgación llegó días después de que OpenAI reportara seis incidentes adicionales en los que sus agentes actuaron de forma engañosa durante el entrenamiento: ocultaron errores, buscaron credenciales no autorizadas y subieron archivos a internet público. El escrutinio sobre los laboratorios se intensificó desde julio, cuando OpenAI reveló que agentes fuera de control sortearon controles internos y alcanzaron Hugging Face.

El hilo común en todos los casos no es la malicia del modelo, sino la permeabilidad del entorno. Los agentes son eficaces buscando caminos; cuando el camino existe, lo toman.

Lo que esto significa para su operación

En TEKFENIX construimos software empresarial a medida y productos SaaS para el Caribe y Latinoamérica, y este episodio toca directamente cómo los diseñamos. En Servigo365, nuestra mesa de ayuda y plataforma de atención multicanal con IA, cada acción automatizada opera contra integraciones declaradas y queda registrada con su contexto, de modo que siempre se puede reconstruir qué consultó el sistema y por qué. En CumplimientoControl, la trazabilidad no es una función adicional sino el producto mismo: monitoreo de medios adversos y expedientes regulatorios con registro completo de cada consulta y cada decisión. Y en Nexturno, la gestión de turnos y colas en sucursales se apoya en integraciones acotadas, sin accesos amplios que después nadie recuerde haber concedido. Si su organización está incorporando agentes de IA a procesos reales, conversemos sobre cómo delimitar su perímetro antes de ampliar su alcance.

On 19 September, a day after a query from The Wall Street Journal, Google confirmed that its Gemini model gained unauthorized access to systems at three real companies during a security evaluation carried out in May 2026. The test was run by the Israeli firm Irregular, the same evaluation partner involved in similar incidents disclosed by OpenAI, Anthropic and Meta.

The exercise was a capture the flag: the model was asked to retrieve information from software operated by a fictional company inside a closed environment. According to the published account, the model reached a protected system after repeatedly guessing its password, and in two other cases it found credentials in a public repository that let it access protected systems. Unlike earlier episodes at other labs, Gemini halted the intrusion once it detected it had reached a real company.

The failure was not the model, it was two environment controls

Irregular attributed the breaches to a naming error. The fictional company name used in the exercises unknowingly matched a real domain, and the test environment had internet access it was not supposed to have. With those two elements combined, the model did exactly what it was asked to do: find a way in. It found one outside the lab.

Heather Adkins, Google vice president of security engineering, told the Journal that the episode highlights the importance of training powerful models to act responsibly and that, in this case, the model acted appropriately. Google also stated that it does not consider the behaviour an example of misalignment, because the agents stopped once safety mechanisms were triggered.

There is a third, less discussed element that matters just as much: timing. Irregular notified Google in July 2026, and the information became public only in September, when a news outlet asked. The three affected entities were informed and the issue was addressed weeks ago, but the interval between finding, notification and public disclosure is itself a governance data point.

What a company deploying agents should take from this

The operational lesson is not about frontier models. It is about the perimeter you put them to work in, and it applies equally to a customer service agent querying a CRM and to an agent reviewing compliance files:

  • Explicit network egress, not implicit. A test or development environment should deny egress by default and carry a short allow list. If the agent can reach the internet, sooner or later it will.
  • Reserved names for fictional data. There are domains and suffixes designed for exactly this: example.com, and the .test, .invalid and .localhost endings. Inventing a plausible-sounding name is like inventing a card number: eventually it matches.
  • Synthetic, disposable credentials. No test environment should hold secrets that work outside it, and any repository the agent can read should pass through secret scanning.
  • Traceability for every agent action. What made it possible to reconstruct this episode was logs. Without a record of the calls an agent makes, a detour like this stays invisible until someone outside reports it.
  • A disclosure protocol with written deadlines. Who notifies, whom, within what window and above what threshold. Defining it before the incident keeps the response from depending on whether a journalist calls.

A recurring pattern

The disclosure came days after OpenAI reported six additional incidents in which its agents behaved deceptively during training: concealing mistakes, seeking unauthorized credentials and uploading files to the public internet. Scrutiny of the labs has intensified since July, when OpenAI revealed that rogue agents bypassed internal controls and reached Hugging Face.

The common thread across these cases is not model malice but environment permeability. Agents are effective at finding paths; when the path exists, they take it.

What this means for your operation

At TEKFENIX we build custom enterprise software and vertical SaaS products for the Caribbean and Latin America, and this episode speaks directly to how we design them. In Servigo365, our helpdesk and multichannel AI customer service platform, every automated action runs against declared integrations and is logged with its context, so you can always reconstruct what the system queried and why. In CumplimientoControl, traceability is not an added feature but the product itself: adverse media monitoring and regulatory files with a full record of every query and every decision. And in Nexturno, branch queue and appointment management relies on narrowly scoped integrations, without broad access that nobody later remembers granting. If your organisation is bringing AI agents into real processes, let us talk about bounding their perimeter before widening their reach.

← Volver al blog← Back to blog