El ROI de un proyecto de IA se calcula sobre un flujo de trabajo, no sobre licencias
Cuando alguien escribe «cómo medir el ROI de un proyecto de IA en mi empresa», casi siempre busca un número que pueda llevar a la junta. Ese número existe. Pero solo sale de un flujo de trabajo concreto.
Un flujo es una tarea que se repite, con línea base sin IA, con el tiempo de revisión humana contado y con el costo total sumado.
Y ojo con el límite principal: una hora liberada no es dinero realizado. Puede volverse gasto evitado o producción adicional, pero eso se comprueba.
Lo mismo pasa con el retorno que presume otra empresa. Depende de supuestos que no son los tuyos. Te sirve para copiar el método, no como pronóstico.
La guía de OpenAI del 16 de septiembre de 2026 va por ahí y es mi base. Lo demás es lectura mía, y te voy marcando qué es dato, qué es inferencia y qué es opinión.
En cifras
Que el equipo use la herramienta no prueba que haya retorno
Tener la grabadora no demuestra que grabaste una buena mezcla en cassette. Con la IA pasa igual: cuántos usuarios entraron o cuánto se gastó en consumo te dice que la herramienta se usa. No te dice que el trabajo mejoró.
OpenAI separa dos tipos de dato. Los de uso y gasto sirven para ubicar en qué actividades se usa la IA.
Los resultados de negocio exigen comparar contra una línea base. Son preguntas distintas, y la segunda es la que defiende un presupuesto.
La distancia entre una y otra aparece en la encuesta de McKinsey del 5 de noviembre de 2025. 88% de los participantes reportó uso regular de IA en al menos una función, pero solo 39% atribuyó a la IA algún impacto en el EBIT de toda la empresa.
Son respuestas autorreportadas, no una medición causal. Aun así, dejan ver que adoptar y demostrar valor financiero son pasos separados.
Si hoy tu evidencia es «ya lo usan», todavía no tienes un ROI. Tienes un punto de partida.
¿Qué cuenta como beneficio y qué cuenta como costo?
La fórmula es sencilla:
ROI = (beneficios económicos atribuibles menos costos totales) ÷ costos totales × 100
Lo difícil es defender cada entrada. Empecemos por el beneficio.
Horas liberadas no son pesos ahorrados
Calcula las horas netas recuperadas así: volumen comparable de tareas por la diferencia de tiempo total por tarea. Cuenta la búsqueda, las instrucciones, la verificación, la edición y el retrabajo.
OpenAI pide incluir el tiempo de revisar y corregir. Si mides solo lo que tarda la primera respuesta de la IA, el ahorro sale inflado.
Luego viene la pregunta incómoda: ¿qué pasó con esas horas?
| Qué pasó con las horas | Qué tienes |
|---|---|
| Redujeron un gasto | Un ahorro verificable |
| Permitieron atender más trabajo | Capacidad aprovechada |
| Nadie sabe en qué se usaron | Tiempo libre, no retorno |
Si atribuyes ingresos, usa el margen de contribución de las ventas adicionales, no la venta completa.
Un ejemplo hipotético, no un resultado esperable: el ejemplo anual de OpenAI aplica un porcentaje supuesto de aprovechamiento y advierte que todas sus cifras son hipotéticas. Tómalo como ejemplo de método.
El costo completo
Del lado del costo, suma licencias o consumo, configuración, integraciones, capacitación, supervisión, mantenimiento y el tiempo de quienes revisan o corrigen.
Usa el mismo horizonte para costos y beneficios, por ejemplo el periodo del piloto.
Y cuenta lo que sale caro cuando se automatiza sin entender el proceso real, un patrón que analicé en las empresas que recontratan después de despedir por IA.
¿Qué hago si alguien me dice que el piloto ya funcionó?
Pregunta contra qué se comparó. Un piloto sin grupo de referencia ni línea base es una impresión, y las impresiones suelen ser optimistas.
El estudio de campo de NBER, de Brynjolfsson, Li y Raymond, analizó la introducción escalonada de un asistente entre 5,179 agentes de atención al cliente.
Encontró 14% más incidencias resueltas por hora en promedio y 34% entre agentes novatos o de menor habilidad, con poco efecto en los más experimentados.
Alcance del estudio: es un solo contexto, de 2023, y no sirve como ROI para otros equipos. Sí enseña que el promedio esconde diferencias que cambian la decisión.
Lleva tres preguntas a esa conversación:
- ¿Se comparó con tareas equivalentes, en un grupo que usa IA y otro que no, o al menos en periodos comparables?
- ¿Hubo cambios simultáneos, como más demanda, otro personal o tareas más simples?
- ¿Funciona igual para todos los perfiles o solo para algunos?
El marco AI RMF 1.0 del NIST, de 2023, recomienda probar el desempeño en condiciones parecidas a las de uso real y vigilarlo después del despliegue.
También pide considerar alternativas viables sin IA. Eso incomoda, pero a veces una plantilla o una capacitación resuelve el mismo problema.
Una medición honesta cabe en una hoja de cálculo con fecha de revisión
No necesitas una plataforma para empezar. Necesitas una hoja con estas columnas:
| Flujo y responsable | Periodo | Volumen | Tiempo total por tarea (antes/después) | Aceptación y errores (antes/después) | Horas netas liberadas | Beneficio efectivamente realizado | Costos iniciales y recurrentes | ROI | Supuestos | Fecha de revisión |
|---|---|---|---|---|---|---|---|---|---|---|
Llénala por flujo, no por empresa. En «supuestos» anota todo lo que estimaste en lugar de medir, porque ahí va a discutir la junta.
Fija la fecha de revisión desde el primer día. Amplía el proyecto solo si el beneficio justificado supera el costo y la calidad y el riesgo son aceptables. Si no, ajusta el proceso o prueba otra solución.
Mi lectura es que esta plantilla va a seguir sirviendo aunque cambien las herramientas, porque no depende de ningún modelo. Lo que caduca son las pantallas, las métricas de cada producto y los costos de cada empresa.
Si quieres recibir este tipo de criterio antes de que se vuelva tendencia, lo mando todos los días en mi correo diario.


