El 13 de agosto de 2026, Google lanzo Gemini 3.7 Flash con un mensaje dirigido explicitamente a las cargas de trabajo agenticas y de codigo. El modelo se ofrece a 0.75 dolares por millon de tokens de entrada y 3.75 dolares por millon de tokens de salida, la mitad de la tarifa de lanzamiento de Gemini 3.6 Flash. En rendimiento, la mejora mas llamativa esta en la prueba DeepSWE v1.1, donde salto de 49% a 65.3% en identificacion y resolucion de problemas de codigo.
Hay un matiz importante que conviene no pasar por alto: se trata de una tarifa introductoria que expira el 31 de diciembre de 2026. A partir del 1 de enero de 2027, el precio de entrada sube a 1.50 dolares y el de salida a 7.50. Ademas, Google recorto simultaneamente el precio de 3.6 Flash a la misma tarifa, de modo que la comparacion de "mitad de precio" es contra el precio original de lanzamiento, no contra lo que se paga hoy por la generacion anterior.
Por que el precio por token es una metrica engañosa para atencion al cliente
Es tentador leer una rebaja de precio como una invitacion automatica a automatizar mas. Pero en un contexto de mesa de ayuda o atencion al cliente, el costo del modelo rara vez es la partida dominante. La estructura real de costos incluye:
- El costo de integracion con los sistemas donde vive la informacion del cliente, que no baja porque baje el token.
- El costo de las conversaciones que el agente de IA no resuelve y termina escalando a una persona, que se pagan dos veces.
- El costo de mantener actualizada la base de conocimiento que alimenta al agente.
- El costo reputacional de una respuesta incorrecta entregada con confianza.
- El costo de auditoria cuando hay que reconstruir que le dijo el sistema a un cliente y con base en que.
Dicho de otro modo: un modelo mas barato hace que sea mas economico equivocarse mas veces, no que sea mas facil acertar.
Donde si cambia el calculo
La rebaja tiene efectos reales en escenarios concretos. El primero es el de volumenes altos de consultas repetitivas y de bajo riesgo, donde el margen entre el costo de atender con IA y el de atender con una persona era demasiado estrecho para justificar el proyecto. El segundo es el de operaciones que estaban limitando el contexto que enviaban al modelo por razones de costo y ahora pueden pasarle el historial completo del cliente, lo cual suele mejorar mas la calidad de la respuesta que cualquier ajuste de prompt.
El tercero, menos obvio, es la viabilidad de arquitecturas de doble modelo, donde un modelo economico procesa y clasifica el grueso del volumen y solo escala a un modelo mas capaz cuando detecta complejidad. Con precios mas bajos en la capa base, ese diseno se vuelve accesible para operaciones medianas.
La pregunta que deberia hacerse una empresa dominicana o caribena
Antes de reaccionar a una noticia de precios, conviene invertir el orden del analisis. La pregunta util no es que modelo usar, sino que porcentaje de las consultas que recibe hoy su operacion podrian resolverse con la informacion que ya existe en sus sistemas. Si esa informacion esta fragmentada entre correos, WhatsApp, llamadas sin registrar y hojas de calculo, ningun modelo, por barato que sea, va a resolverlo.
La ventaja competitiva no esta en adoptar el modelo mas nuevo, sino en tener la operacion suficientemente ordenada como para que cambiar de modelo sea una decision de configuracion y no un rediseno completo.
En TEKFENIX construimos Servigo365 con esa premisa: una mesa de ayuda multicanal que centraliza las conversaciones con clientes, mantiene el historial completo y trazable, y permite incorporar asistencia con IA sobre una base de datos ordenada en lugar de sobre el caos. Complementado con Nexturno para la gestion de turnos presenciales y CumplimientoControl para los sectores regulados, ayudamos a que las empresas de la region aprovechen las caidas de precio de la IA desde una posicion de orden operativo, no de improvisacion.