El ROI de AI no es el precio por token: mide el coste por tarea aceptada

Una scorecard practica para medir resultados aceptados, tiempo de revision, coste directo y fallos antes de escalar un flujo de AI.

Última actualización

Articulo publico de OpenAI sobre el scorecard de IA y el coste por tarea aceptada analizado en este articulo

Contar mensajes, seats o tokens describe uso, no trabajo util. La scorecard de OpenAI publicada en julio de 2026 propone mirar useful work, coste por tarea exitosa y fiabilidad. Es un marco del proveedor, no una norma universal, pero corrige una medicion comunmente enganosa.

Define aceptacion antes de ejecutar

Una respuesta de soporte se acepta cuando respeta la politica vigente, usa datos correctos, requiere poca edicion y llega dentro del SLA. Un cambio de codigo se acepta cuando pasa tests, cumple reglas del repositorio y no crea un incidente. "Genero texto" no es exito.

Usa 20 a 50 tareas fijas con casos normales, limites y casos que deben escalarse. Para cada intento guarda aceptado/rechazado, minutos de revision, coste directo, razon de fallo y reutilizacion posterior.

Coste por tarea aceptada = (coste AI directo + revision + recuperacion de fallos) / tareas aceptadas

El objetivo es no confundir tokens baratos con trabajo barato. Un flujo de 0,08 USD con seis minutos de revision puede perder contra uno mas caro con alta aceptacion y un minuto de control.

Corrige la capa que falla

Separa fallo de input, ejecucion, aceptacion y economia. Si falta la politica o el dato actual, cambiar el prompt no resuelve nada. Si el resultado es bueno pero el reviewer tarda demasiado, el problema es de diseno de workflow. Context Engineering sirve para ubicar esas causas.

Para agencias, soporte bilingue y equipos remotos de Espana y Latinoamerica, incluye en el coste la revision humana, husos horarios, fuentes locales y traspasos a clientes; no solo el precio en dolares del modelo.

Fija tambien una stop rule: pass rate insuficiente, revision sobre la linea manual, error grave, coste creciendo mas rapido que output aceptado o causa de fallo desconocida. Los primeros retornos suelen aparecer en clasificacion, investigacion con fuentes permitidas, borradores revisables y controles estructurados, no en mandatos abiertos como "haz toda la estrategia".

Escala trabajo aceptado y repetible, no entusiasmo por una demo.

Lecturas relacionadas: AI Tool Ideas, Context Engineering, Tools.