NoticiasNews

Google lanza Gemini 3.7 Flash a mitad de precio: la economia de los agentes de IA en atencion al cliente acaba de cambiarGoogle Launches Gemini 3.7 Flash at Half Price: The Economics of AI Customer Service Agents Just Changed

2026-08-17

El 13 de agosto de 2026, Google lanzo Gemini 3.7 Flash con un mensaje dirigido explicitamente a las cargas de trabajo agenticas y de codigo. El modelo se ofrece a 0.75 dolares por millon de tokens de entrada y 3.75 dolares por millon de tokens de salida, la mitad de la tarifa de lanzamiento de Gemini 3.6 Flash. En rendimiento, la mejora mas llamativa esta en la prueba DeepSWE v1.1, donde salto de 49% a 65.3% en identificacion y resolucion de problemas de codigo.

Hay un matiz importante que conviene no pasar por alto: se trata de una tarifa introductoria que expira el 31 de diciembre de 2026. A partir del 1 de enero de 2027, el precio de entrada sube a 1.50 dolares y el de salida a 7.50. Ademas, Google recorto simultaneamente el precio de 3.6 Flash a la misma tarifa, de modo que la comparacion de "mitad de precio" es contra el precio original de lanzamiento, no contra lo que se paga hoy por la generacion anterior.

Por que el precio por token es una metrica engañosa para atencion al cliente

Es tentador leer una rebaja de precio como una invitacion automatica a automatizar mas. Pero en un contexto de mesa de ayuda o atencion al cliente, el costo del modelo rara vez es la partida dominante. La estructura real de costos incluye:

  • El costo de integracion con los sistemas donde vive la informacion del cliente, que no baja porque baje el token.
  • El costo de las conversaciones que el agente de IA no resuelve y termina escalando a una persona, que se pagan dos veces.
  • El costo de mantener actualizada la base de conocimiento que alimenta al agente.
  • El costo reputacional de una respuesta incorrecta entregada con confianza.
  • El costo de auditoria cuando hay que reconstruir que le dijo el sistema a un cliente y con base en que.

Dicho de otro modo: un modelo mas barato hace que sea mas economico equivocarse mas veces, no que sea mas facil acertar.

Donde si cambia el calculo

La rebaja tiene efectos reales en escenarios concretos. El primero es el de volumenes altos de consultas repetitivas y de bajo riesgo, donde el margen entre el costo de atender con IA y el de atender con una persona era demasiado estrecho para justificar el proyecto. El segundo es el de operaciones que estaban limitando el contexto que enviaban al modelo por razones de costo y ahora pueden pasarle el historial completo del cliente, lo cual suele mejorar mas la calidad de la respuesta que cualquier ajuste de prompt.

El tercero, menos obvio, es la viabilidad de arquitecturas de doble modelo, donde un modelo economico procesa y clasifica el grueso del volumen y solo escala a un modelo mas capaz cuando detecta complejidad. Con precios mas bajos en la capa base, ese diseno se vuelve accesible para operaciones medianas.

La pregunta que deberia hacerse una empresa dominicana o caribena

Antes de reaccionar a una noticia de precios, conviene invertir el orden del analisis. La pregunta util no es que modelo usar, sino que porcentaje de las consultas que recibe hoy su operacion podrian resolverse con la informacion que ya existe en sus sistemas. Si esa informacion esta fragmentada entre correos, WhatsApp, llamadas sin registrar y hojas de calculo, ningun modelo, por barato que sea, va a resolverlo.

La ventaja competitiva no esta en adoptar el modelo mas nuevo, sino en tener la operacion suficientemente ordenada como para que cambiar de modelo sea una decision de configuracion y no un rediseno completo.

En TEKFENIX construimos Servigo365 con esa premisa: una mesa de ayuda multicanal que centraliza las conversaciones con clientes, mantiene el historial completo y trazable, y permite incorporar asistencia con IA sobre una base de datos ordenada en lugar de sobre el caos. Complementado con Nexturno para la gestion de turnos presenciales y CumplimientoControl para los sectores regulados, ayudamos a que las empresas de la region aprovechen las caidas de precio de la IA desde una posicion de orden operativo, no de improvisacion.

On August 13, 2026, Google launched Gemini 3.7 Flash with a message aimed explicitly at agentic and coding workloads. The model is offered at $0.75 per million input tokens and $3.75 per million output tokens, half the launch rate of Gemini 3.6 Flash. On performance, the most striking gain is on the DeepSWE v1.1 benchmark, where it jumped from 49% to 65.3% on identifying and resolving code issues.

An important nuance should not be overlooked: this is an introductory rate expiring December 31, 2026. From January 1, 2027, input pricing rises to $1.50 and output to $7.50. Google also simultaneously cut 3.6 Flash to the same rate, so the "half price" comparison is against the original launch price, not against what is paid today for the previous generation.

Why price per token is a misleading metric for customer service

It is tempting to read a price cut as an automatic invitation to automate more. But in a helpdesk or customer service context, model cost is rarely the dominant line item. The real cost structure includes:

  • Integration cost with the systems where customer information lives, which does not fall because tokens do.
  • The cost of conversations the AI agent fails to resolve and escalates to a person, which are paid twice.
  • The cost of keeping the knowledge base feeding the agent up to date.
  • The reputational cost of an incorrect answer delivered confidently.
  • The audit cost when you must reconstruct what the system told a customer and on what basis.

Put differently: a cheaper model makes it more economical to be wrong more often, not easier to be right.

Where the calculation does change

The price cut has real effects in specific scenarios. The first is high volumes of repetitive, low-risk queries where the margin between AI handling cost and human handling cost was too narrow to justify the project. The second is operations that were limiting the context sent to the model for cost reasons and can now pass the full customer history, which usually improves answer quality more than any prompt tuning.

The third, less obvious, is the viability of dual-model architectures, where an economical model processes and classifies the bulk of volume and only escalates to a more capable model when it detects complexity. With lower base-layer pricing, that design becomes accessible to mid-sized operations.

The question a Dominican or Caribbean company should ask

Before reacting to pricing news, it is worth inverting the order of analysis. The useful question is not which model to use, but what percentage of the queries your operation receives today could be resolved with information that already exists in your systems. If that information is fragmented across emails, WhatsApp, unlogged calls and spreadsheets, no model, however cheap, will fix it.

Competitive advantage lies not in adopting the newest model, but in having an operation orderly enough that switching models is a configuration decision rather than a full redesign.

At TEKFENIX we built Servigo365 on that premise: a multichannel helpdesk that centralizes customer conversations, maintains complete and traceable history, and allows AI assistance to be layered onto organized data rather than onto chaos. Complemented by Nexturno for in-branch queue management and CumplimientoControl for regulated sectors, we help companies in the region take advantage of falling AI prices from a position of operational order rather than improvisation.

← Volver al blog← Back to blog