NoticiasNews

OpenAI empieza a cobrar solo cuando el agente acierta, y con eso convierte a los evals en infraestructura de facturaciónOpenAI Starts Charging Only When the Agent Gets It Right, Turning Evals Into Billing Infrastructure

2026-09-01

Hasta ahora, las empresas de IA han cobrado por los tokens consumidos, sin importar si el modelo entregó exactamente lo que el cliente necesitaba o falló por completo. El 31 de agosto de 2026 se reportó que OpenAI está experimentando con un enfoque distinto: permitir que el cliente pague solo cuando la IA hace bien el trabajo.

Según lo reportado originalmente por The Information, la compañía ya comenzó a probar ese esquema con algunos clientes empresariales, facturando en función de resultados exitosos en lugar del cómputo consumido en el camino.

Los evals pasan de ser control de calidad a ser el medidor

Los desarrolladores ya usan evals para detectar problemas en modelos y agentes: las herramientas alojadas de OpenAI, por ejemplo, pueden comparar respuestas contra resultados esperados y calificar el desempeño de un modelo en una tarea determinada. Plataformas como Braintrust agregan visibilidad sobre lo que ocurre durante la corrida de un agente: registran llamadas al modelo, recuperaciones y llamadas a herramientas dentro de una traza, y luego puntúan la ejecución según factores como cumplimiento de la tarea, exactitud factual y uso correcto de herramientas.

El cambio conceptual es grande: un instrumento que existía para mejorar la calidad ahora determina cuánto se paga. Y ahí aparecen los bordes.

El problema de los evals semánticos

Los evals semánticos son distintos porque requieren un juicio, no un aprobado/reprobado. Un LLM actuando como juez puede ayudar a comparar dos versiones de un agente, pero usar ese juicio para disparar un cobro es otra cosa:

  • Un falso positivo deja al cliente pagando por trabajo no terminado.
  • Un falso negativo deja al proveedor absorbiendo el costo de una corrida exitosa.

Y hay un conflicto estructural más incómodo: cuando la empresa de IA ejecuta el agente y además fija los criterios de éxito, está calificando su propio trabajo y luego facturando el resultado.

Lo que esto significa para una empresa que compra software

La tendencia va más allá de OpenAI. Los proveedores de tecnología empresarial se están moviendo hacia precios por resultado, y esperan cobrar más, no menos, a medida que los clientes trasladan trabajo a los agentes. El beneficio que argumentan es predictibilidad presupuestaria. Pero no existe una estructura universal para estos modelos: algunos ajustan sus servicios para rastrear directamente el output, otros añaden garantías sobre esquemas por usuario que mantienen.

Cuatro cosas que conviene negociar antes de firmar:

  • La definición de éxito debe estar en el contrato, no en la documentación del producto ni en un panel que el proveedor puede cambiar unilateralmente.
  • Acceso a las trazas. Si se le factura por resultado, debería poder ver la evidencia de cada corrida facturada: qué se pidió, qué se ejecutó, cómo se puntuó.
  • Un mecanismo de disputa. Qué ocurre cuando usted considera que la tarea no se completó y el eval dice que sí.
  • Evaluación independiente. Idealmente, el criterio de éxito debería poder verificarse con instrumentación propia y no exclusivamente con la del proveedor.

El fondo del asunto: el software se está vendiendo por trabajo hecho

Durante dos décadas el SaaS se vendió por usuario y por mes. La lógica era simple porque el valor estaba en el acceso a la herramienta. Cuando el valor pasa a estar en el trabajo que el sistema ejecuta por sí solo, cobrar por asiento deja de tener sentido, y aparece la necesidad de medir producto entregado. Es un cambio sano en principio; el riesgo está en que la medición quede en manos de una sola parte.

En TEKFENIX nos tomamos esta discusión en serio porque toca directamente lo que construimos. En Servigo365, la resolución de un caso queda registrada con su trazabilidad completa —qué se pidió, qué se hizo, con qué sistemas se interactuó y cómo terminó—, de manera que la organización pueda medir por sí misma qué se resolvió y qué no, sin depender de la definición de éxito de nadie más. Cuando el mercado empieza a facturar por resultados, tener su propia evidencia deja de ser una buena práctica y se vuelve poder de negociación.

Until now, AI companies have charged for the tokens consumed, whether or not the model delivered exactly what the customer needed or missed entirely. On August 31, 2026, it was reported that OpenAI is experimenting with a different approach: letting customers pay only when the AI gets the job done right.

As first reported by The Information, the company has already started testing that approach with some enterprise customers, billing based on successful outcomes rather than the compute consumed along the way.

Evals Move From Quality Control to Meter

Developers already use evals to catch problems with models and agents: OpenAI’s hosted tools, for instance, can check responses against expected results and grade a model’s performance on a given task. Platforms like Braintrust add visibility into what happens during an agent run: they record model calls, retrievals and tool calls within a trace, then score the run for things like task completion, factual accuracy and correct tool use.

The conceptual shift is large: an instrument that existed to improve quality now determines how much is paid. And that is where the edges appear.

The Semantic Eval Problem

Semantic evals are different because they require a judgment rather than a pass/fail. An LLM-as-a-judge can help compare two versions of an agent, but using that judgment to trigger a charge is another matter:

  • A false positive leaves the customer paying for unfinished work.
  • A false negative leaves the vendor absorbing the cost of a successful run.

And there is a more uncomfortable structural conflict: when the AI company runs the agent and also sets the criteria for success, it is grading its own work and then billing the customer for the result.

What This Means for a Company Buying Software

The trend goes beyond OpenAI. Enterprise tech vendors are shifting to outcome-based pricing, and they expect to be paid more, not less, as customers hand work over to agents. The benefit they argue is budget predictability. But there is no universal structure for these models: some tailor services to directly track output, others add guarantees to per-seat frameworks they keep.

Four things worth negotiating before signing:

  • The definition of success belongs in the contract, not in product documentation or a dashboard the vendor can change unilaterally.
  • Access to traces. If you are billed by outcome, you should be able to see the evidence for every billed run: what was asked, what executed, how it was scored.
  • A dispute mechanism. What happens when you believe the task was not completed and the eval says it was.
  • Independent evaluation. Ideally the success criterion should be verifiable with your own instrumentation, not solely the vendor’s.

The Bigger Picture: Software Is Being Sold by Work Done

For two decades SaaS sold per user, per month. The logic was simple because the value was access to the tool. When value shifts to the work the system executes on its own, per-seat pricing stops making sense and the need to measure delivered output appears. That is a healthy change in principle; the risk is that measurement ends up in one party’s hands.

At TEKFENIX we take this discussion seriously because it touches directly what we build. In Servigo365, case resolution is logged with full traceability — what was requested, what was done, which systems were touched and how it ended — so an organization can measure for itself what was resolved and what was not, without depending on anyone else’s definition of success. When the market starts billing by outcomes, holding your own evidence stops being good practice and becomes negotiating power.

← Volver al blog← Back to blog