Medir el valor de la IA en auditoría interna: más allá del tiempo ahorrado

Un Director de Auditoría Interna presenta un dato atractivo: la IA ha ahorrado mil horas de trabajo durante el año. La pregunta incómoda llega después: ¿qué cambió realmente gracias a esas mil horas?
Tal vez se revisaron más contratos, se amplió la cobertura sobre riesgos críticos o los equipos dedicaron más tiempo a discutir causas raíz con la dirección. Pero también es posible que una parte del supuesto ahorro se haya consumido revisando respuestas imprecisas, corrigiendo borradores, resolviendo problemas de acceso o esperando que los auditores aprendieran a utilizar la herramienta.
El tiempo ahorrado es una señal de eficiencia; no es, por sí solo, una medida de valor.
Las Normas Globales de Auditoría Interna ya ofrecen la lógica de fondo. La Norma 10.3 exige que el Director de Auditoría Interna evalúe regularmente la tecnología utilizada y busque oportunidades para mejorar la eficacia y eficiencia de la función. La Norma 12.2 exige objetivos y una metodología de medición del desempeño, considerando las expectativas del consejo y la alta dirección. Sus consideraciones de implementación recomiendan equilibrar resultados relacionados con partes interesadas, cobertura, eficiencia, recursos y aprendizaje.
La IA debería medirse dentro de ese sistema, no con un ROI aislado.
El ahorro de tiempo es una señal, no el resultado
Una tarea que pasa de 60 a 30 minutos parece un éxito. Sin embargo, ese 50% de reducción puede ocultar tres realidades muy distintas.
En la primera, el auditor obtiene un resultado equivalente y utiliza los 30 minutos liberados para revisar más evidencia. En la segunda, el borrador llega más rápido, pero necesita 20 minutos adicionales de corrección y validación. En la tercera, la herramienta reduce el trabajo de un auditor, pero añade costes de licencia, integración, capacitación y controles que superan el beneficio operativo.
Por eso conviene medir tiempo neto, no tiempo bruto. El cálculo debe incluir preparación, interacción con la herramienta, revisión humana, correcciones, reejecución, gestión de excepciones y soporte.
Esta lógica es especialmente importante en trabajos de conocimiento. La investigación sobre la jagged technological frontier muestra que el efecto de la IA varía según la tarea. Para auditoría interna, la implicación es clara: el éxito al resumir una reunión no puede extrapolarse a evaluar evidencia o redactar una conclusión.
Una hora que la IA ahorra no tiene valor hasta que la función decide en qué convertirla.
Un cuadro de mando que evite celebrar falsos éxitos
Una medición útil combina productividad con resultados profesionales. El siguiente marco puede aplicarse por caso de uso y, después, consolidarse a nivel de portafolio.
| Dimensión | Pregunta de gestión | Indicadores de ejemplo | Riesgo de interpretación |
|---|---|---|---|
| Eficiencia | ¿Reduce realmente el esfuerzo o el tiempo de ciclo? | Minutos netos por tarea; horas administrativas eliminadas; reducción del ciclo; coste por ejecución. | Contar ahorro bruto sin revisión, retrabajo o soporte. |
| Cobertura | ¿Permite considerar más riesgo o evidencia? | % de población revisada; documentos analizados; riesgos o entidades cubiertos; frecuencia de monitoreo. | Confundir volumen procesado con profundidad de aseguramiento. |
| Calidad | ¿Mejora o deteriora la solidez del trabajo? | Errores detectados; afirmaciones sin soporte; notas de revisión; retrabajo; consistencia; precisión de extracción o clasificación. | Premiar velocidad aunque aumenten defectos. |
| Insight | ¿Produce conocimiento que cambia una decisión? | Nuevos temas validados; señales de riesgo investigadas; temas transversales escalados; recomendaciones de análisis adoptadas. | Contar ideas generadas aunque nadie las valide o utilice. |
| Adopción | ¿La capacidad se utiliza de forma repetible? | Usuarios activos; frecuencia de uso; penetración por tipo de trabajo; reutilización de prompts o flujos aprobados. | Tratar uso elevado como sinónimo de valor. |
| Esfuerzo de revisión | ¿Cuánto trabajo humano requiere hacer confiable la salida? | Minutos de revisión por salida; tasa de override; distancia de edición; excepciones devueltas al auditor. | Ocultar el coste de control necesario para usar la IA. |
| Riesgo y control | ¿El beneficio se consigue dentro de límites aceptables? | Incidentes; uso de datos no permitido; fallos de trazabilidad; acciones no autorizadas; errores materiales; falsos positivos/negativos. | Compensar un riesgo inaceptable con más productividad. |
| Economía y capacidad | ¿El beneficio supera el coste total y se convierte en capacidad útil? | Licencias, integración y capacitación; gasto externo evitado; capacidad liberada; beneficio realizado frente al esperado. | Convertir horas teóricas en euros aunque no cambie ningún coste ni output. |
No todas las métricas deben llegar al consejo. La función puede operar con un conjunto amplio y presentar pocos indicadores que expliquen si la IA fortalece el mandato y la estrategia.
La regla más importante es no convertir todo en una puntuación única. Un caso de uso que ahorra mucho tiempo pero expone información confidencial, genera conclusiones sin trazabilidad o permite acciones no autorizadas no debería “aprobar” porque su productividad compense el riesgo. Algunos indicadores funcionan como límites mínimos, no como variables intercambiables.
El NIST AI RMF 1.0 refuerza esta disciplina al tratar la medición y el monitoreo del riesgo como actividades continuas. No es un requisito de auditoría interna ni un sustituto de las Normas Globales, pero ofrece una referencia útil para diseñar indicadores de desempeño y riesgo en sistemas de IA que la función utiliza.
El indicador que suele faltar: qué pasó con la capacidad liberada
El ahorro de tiempo se vuelve estratégico solo cuando tiene un destino.
Una función puede capturar capacidad reduciendo horas extras, servicios externos o costes evitables. Puede reinvertirla ampliando cobertura, realizando más análisis, acelerando el seguimiento o dedicando más tiempo a conversaciones con partes interesadas. O puede descubrir que la capacidad fue absorbida por revisión adicional, problemas de integración, controles, formación y retrabajo.
Ese destino debería medirse de forma explícita.
Una métrica práctica es la tasa de conversión de capacidad: porcentaje del ahorro neto estimado que termina convertido en menor coste observable o en trabajo de aseguramiento adicional planificado y realizado. No es una métrica de las Normas; es una forma de evitar que el caso de negocio dependa de horas que existen únicamente en una hoja de cálculo.
Esta pregunta también cambia la conversación con el consejo. En vez de afirmar “la IA ahorró 4.000 horas”, el Director de Auditoría Interna puede explicar que una parte redujo trabajo administrativo, otra permitió cubrir dos procesos adicionales y otra se destinó a revisión y controles. El valor se vuelve auditable porque existe una trazabilidad entre eficiencia y resultado.
Medir por caso de uso antes de medir la función
Los promedios de toda la función esconden demasiado. Un asistente de metodología basado en RAG, un generador de borradores y un agente que solicita evidencia tienen perfiles de riesgo, coste y beneficio muy diferentes.
Cada caso de uso debería empezar con una ficha de medición que responda, como mínimo, a cinco preguntas:
- ¿Cuál es la línea base? Tiempo, volumen, calidad, costes y tasa de error antes de introducir IA.
- ¿Cuál es la unidad de comparación? Por informe, documento, prueba, solicitud de evidencia o trabajo completo.
- ¿Qué resultado debe mantenerse o mejorar? No basta con terminar antes; debe definirse qué significa una salida aceptable.
- ¿Qué revisión humana es necesaria? La validación forma parte del coste operativo del caso de uso.
- ¿Qué riesgo obliga a detener o rediseñar el uso? Incidentes, desviaciones de calidad o pérdida de trazabilidad deben tener umbrales y responsables.
Para pilotos importantes, una comparación controlada es preferible a la percepción. Puede utilizarse una muestra de tareas comparables, medir el desempeño con y sin IA y hacer que la calidad sea evaluada con criterios predefinidos. La telemetría de uso puede mostrar tiempo, frecuencia y excepciones; las revisiones de calidad pueden medir defectos; las encuestas pueden capturar utilidad percibida; y los registros de incidentes completan la visión de riesgo.
La investigación y las experiencias publicadas por The IIA muestran que la IA ya se utiliza en planificación, evaluación de riesgos, ejecución, reporting y calidad. Esa variedad hace todavía más importante evitar una definición universal de “productividad con IA”.
El tablero del DAI debe conectar IA con el desempeño de auditoría
La Norma 12.2 no exige una lista específica de KPI. Exige una metodología que permita evaluar el desempeño, solicitar feedback relevante y promover mejora continua. El propio Performance Measurement Tool del IIA subraya que las medidas deben adaptarse al contexto de cada función.
Para un portafolio de IA, un tablero ejecutivo podría mantener ocho preguntas:
- ¿Cuánta eficiencia neta se ha realizado?
- ¿Cuánta cobertura adicional se ha obtenido?
- ¿La calidad mejoró, se mantuvo o cayó?
- ¿Qué insights validados llegaron a decisiones o conversaciones relevantes?
- ¿La adopción es sostenible y se concentra en casos de uso aprobados?
- ¿Cuánto esfuerzo de revisión necesita la IA para ser confiable?
- ¿Qué incidentes o excepciones de control aparecieron?
- ¿En qué se convirtió la capacidad liberada?
El IIA ha planteado recientemente una decisión similar para las funciones que escalan GenAI: capturar la eficiencia o reinvertirla en mayor aseguramiento y más interacción con las partes interesadas. Esa elección no debería quedar implícita. Debe formar parte del caso de negocio y de la medición.
La mejor medida de IA no será “horas ahorradas”. Será si la función produce más aseguramiento relevante, con igual o mejor calidad, usando su capacidad escasa de forma más inteligente y sin introducir riesgos que contradigan su propio mandato.
Ese es el punto en que una herramienta deja de ser interesante y empieza a crear valor.
Fuentes
- The Institute of Internal Auditors, Normas Globales de Auditoría Interna
- The Institute of Internal Auditors, Performance Measurement Tool
- The Institute of Internal Auditors, Internal Audit Upskilling for Critical AI Capabilities
- The Institute of Internal Auditors, From Pilot to Practice: How Internal Audit Functions Are Scaling GenAI
- NIST, Artificial Intelligence Risk Management Framework (AI RMF 1.0)
- Harvard Business School AI Institute, Navigating the Jagged Technological Frontier