← Todos los posts
5 de julio de 20265 min de lecturaThe AIFlow Team

Notas de campo: cuando el agente cuesta más que el desarrollador de software

Una tarea agéntica dispara de 5 a 30 llamadas de modelo. Sin seguimiento por tarea, el costo se convierte en un número que solo descubres en la factura.

costfinopsobservabilityagentstokens
Notas de campo: cuando el agente cuesta más que el desarrollador de software
Escucha este artículo

La semana pasada Gartner soltó una predicción que circuló rápido por nuestros canales: para 2028, el gasto en agentes de codificación por IA superaría el salario promedio de un desarrollador (Gartner, 24/06/2026). El número que más nos llamó la atención no fue el de 2028, sino el de hoy: casi una cuarta parte de los líderes de tecnología ya gasta entre US$ 200 y US$ 500 por desarrollador al mes solo en tokens de codificación, y 6% ya supera los US$ 2.000 por desarrollador al mes.

Lo leemos como un problema de ingeniería, no de compras. Y tiene una causa técnica precisa que el propio Gartner señala: una sola tarea agéntica puede disparar de 5 a 30 llamadas de modelo. Multiplica eso por reprocesamientos, contexto reinyectado en cada paso y herramientas que devuelven payloads inflados, y el costo por tarea se convierte en una variable que nadie está midiendo en el lugar correcto.

El costo unitario bajó, la factura subió

Vale la pena separar dos cosas que suelen confundirse. El precio por token se desplomó, algo así como 10× al año durante tres años, con caídas de cerca del 80% entre 2025 y 2026 en varios proveedores (Vantage, DigitalApplied). Aun así, las facturas suben, porque el volumen corre más rápido que la curva de precio. El gasto en API de modelos prácticamente se duplicó entre finales de 2024 y mediados de 2025.

La lectura de FinOps madura ya lo refleja: 98% de los equipos de FinOps hoy gestionan gasto en IA, frente al 63% en 2025 y al 31% en 2024 (FinOps Foundation, State of FinOps 2026). La gestión de costo de IA es la competencia más buscada en esos equipos. Es decir: dejó de ser una preocupación emergente y se volvió una disciplina del día a día, pero la instrumentación en los pipelines aún no acompaña.

El costo por token es una métrica de entrada, no de resultado

El error clásico es optimizar el número equivocado. El costo por millón de tokens (CPM) es útil, pero es una métrica de insumo. Si reduces el CPM enrutando todo hacia un modelo barato y, con ello, la tasa de reintento sube y la tasa de finalización de tarea baja, recortaste la cuenta de tokens y aumentaste el costo por resultado de negocio. La métrica que importa es costo por tarea completada con éxito, y solo existe si atribuyes costo a nivel de tarea, agente, prompt y tenant.

Aquí es donde separamos la observabilidad de costo de la observabilidad de performance, y por qué, en IA, son inseparables. No entiendes por qué saltó el costo sin saber qué estaba haciendo el sistema en ese salto. En la práctica, esto exige que FinOps e ingeniería compartan la misma infraestructura de trazas, no reportes separados.

Qué instrumentamos antes de poner un agente en producción

En la forma en que trabajamos en AIFlow, el costo es una señal de primera clase en el eval y en la traza, no un reporte de fin de mes. Un guion concreto:

Atribución granular por defecto. Cada llamada lleva etiquetas de tarea, agente, prompt, modelo y tenant. Sin esto es imposible distinguir una carga de producción de alto valor de un experimento en bucle infinito consumiendo presupuesto.

Costo dentro de la traza, junto al paso. Cada nodo del flujo agéntico registra tokens de entrada/salida, latencia y costo. Cuando una tarea dispara 30 llamadas en vez de 5, eso aparece en la traza, no en la factura tres semanas después.

Enrutamiento como decisión medida. Una capa de enrutamiento que manda ~80% del tráfico rutinario a modelos económicos y reserva los modelos de frontera para razonamiento de alto riesgo recorta del 60% al 90% del gasto sin degradar la calidad percibida de la mayoría (Pristren). Pero el enrutamiento solo es seguro si tienes un eval acoplado que mida si la calidad cayó junto con el costo.

Caché de prompt como palanca de blended price. Reutilizar contexto ya procesado reduce el costo de token de entrada en cerca del 90%, lo que baja el precio efectivo sin depender de un recorte oficial de tabla.

Presupuesto con alerta al 80% y detección de anomalías. Una alerta al 80% del presupuesto te da una o dos semanas para investigar antes del siguiente ciclo. La anomalía de costo por tarea suele ser la primera señal de un agente entrando en bucle o de una herramienta devolviendo un payload inflado.

RBAC y límites por tenant. La gobernanza de acceso no es solo seguridad, es contención de costo. Quién puede invocar qué modelos, con qué techo de gasto, con human-in-the-loop en tareas caras.

El punto práctico

La predicción de Gartner no es sobre 2028; es sobre la instrumentación que falta hoy. El gasto mundial en IA llegaría a US$ 2,52 billones en 2026, un alza del 44% año contra año (Gartner, 15/01/2026), y el desperdicio de nube volvió a subir por primera vez en cinco años, hasta el 29% del gasto de IaaS/PaaS, justamente porque las cargas de IA hacen que la previsión de costo sea estructuralmente más difícil.

Tratamos esto como cualquier otro requisito de producción: si no está en la traza y en el eval, no existe. El costo por tarea es un número que diseñas desde que dibujas el flujo, no un susto a fin de mes.

Fuentes