02-9

Poner a un humano a supervisar la IA, por defecto, resta

Fuente externa, verificada a primaria, dic-2024Guillermo VallejoPublicado originalmente en LinkedIn el

Un meta-análisis del MIT con 106 experimentos mide que, de media, la combinación persona + IA rinde peor que el mejor de los dos por separado. No es un argumento contra la supervisión humana. Es un argumento para decidir dónde ponerla.

Hay una frase que se ha instalado en los comités de dirección en los últimos dos años y que nadie discute porque suena a sensatez pura: «tranquilos, siempre habrá un humano en el bucle». Se dice para calmar al consejo, para tranquilizar a legal, para cerrar la diapositiva de riesgos. Y funciona, porque a nadie le parece mal que una persona revise lo que hace la máquina. El problema es que la mejor evidencia empírica disponible dice que, aplicada como dogma universal, esa medida no protege el resultado. Lo empeora.

La cifra que lo sostiene no viene de un post ni de un vendedor. Viene de un meta-análisis pre-registrado del MIT, publicado en Nature Human Behaviour en diciembre de 2024. Vaccaro, Almaatouq y Malone sintetizaron 106 estudios experimentales y 370 tamaños de efecto sobre equipos humano-IA. Fue, según el propio MIT, el primer meta-análisis a gran escala sobre la pregunta, revisado por pares en una de las revistas de comportamiento humano más exigentes del mundo. Y su conclusión central es justo la contraria de la que circula en tantas presentaciones.

El número que incomoda

En el promedio de todos esos estudios, los equipos humano + IA rinden significativamente peor que el mejor de los dos actuando por separado. El tamaño del efecto es Hedges' g = −0,23, con un intervalo de confianza al 95 % que va de −0,39 a −0,07. Traducido para quien no vive de la estadística: el efecto es negativo, pequeño en magnitud pero estadísticamente sólido, y no es un accidente de un par de experimentos raros. Juntar a la persona y a la máquina, por defecto, resta.

Conviene detenerse en lo que esto no dice, porque es donde se cuela la mala interpretación. No dice que la IA sea mejor que las personas. No dice que haya que echar a los humanos de la supervisión. Dice algo más fino y más útil: que la combinación indiscriminada de ambos, sin criterio sobre cuándo tiene sentido, destruye valor en el promedio de los casos medidos.

Y hay un límite del estudio que prefiero poner yo antes de que lo ponga un comentarista: su búsqueda sistemática cubre trabajos publicados entre enero de 2020 y junio de 2023. Es evidencia anterior a la generación actual de modelos, a los copilotos integrados en las herramientas de trabajo y a los agentes.

Los propios autores lo abordan, además, en la dirección que menos me conviene: el año de publicación aparece como moderador estadísticamente significativo del efecto, y ellos hablan de señales potenciales de progreso en los estudios más recientes, posiblemente porque se han empezado a diseñar experimentos pensados para provocar esa sinergia. Así que la lectura honesta del meta-análisis no es «el híbrido siempre resta y siempre restará». Es que la sinergia no aparece por defecto: hay que diseñarla, y en el promedio de los diseños medidos hasta 2023 no se consiguió. Si en tu proceso la combinación suma, es porque alguien se sentó a diseñarla para que sumara. Eso se mide en tu casa; no se presume porque los modelos hayan mejorado. Y el mecanismo que explica por qué el supervisor humano falla se ha medido después, ya en 2026, y sigue apuntando en la misma dirección.

No es cuánta supervisión, es dónde

El paper no se queda en el promedio. Lo descompone, y ahí está lo que un directivo puede llevarse a la práctica el lunes.

Primero, por tipo de tarea. En tareas de creación de contenido, el híbrido tiende a ganar: la estimación es positiva, aunque con pocos estudios y sin llegar a ser estadísticamente significativa por sí sola. En tareas de toma de decisiones ocurre lo contrario, y ahí la pérdida sí es clara y significativa. O sea que el mismo diseño «humano en el bucle» que puede ayudar cuando alguien redacta un borrador es el que daña cuando alguien decide.

Segundo, por brecha de capacidad. Cuando el humano es objetivamente mejor que la IA en esa tarea concreta, el híbrido gana. Cuando la IA es mejor que el humano, el híbrido pierde. Es de sentido común una vez lo ves, y sin embargo casi ninguna política de gobierno de IA lo tiene en cuenta: ponemos al supervisor humano precisamente en los procesos donde la máquina ya lo supera, que es donde ese supervisor solo puede añadir ruido, lentitud y una falsa sensación de control.

La conclusión operativa no es «menos supervisión». Es supervisión con criterio: diseñada en función del tipo de tarea y de quién es mejor en ella, no repartida por igual como una casilla de cumplimiento.

Por qué el humano falla justo cuando más se le necesita

Queda una pregunta incómoda: si el humano está mirando, ¿por qué no corrige el error de la máquina? Aquí entra un working paper de Wharton de principios de 2026 que da el mecanismo. Lo llaman cognitive surrender, rendición cognitiva. En tres experimentos preregistrados, resolviendo problemas de razonamiento (no revisando trabajo ajeno), con 1.372 participantes y 9.593 ensayos, montaron pruebas en las que la IA a veces respondía mal a propósito. En los ensayos en que los participantes consultaron a la IA y esta respondía mal, aceptaron su respuesta el 73,2 % de las veces. Y su confianza subió cuando tenían la IA disponible, aunque aproximadamente la mitad de las respuestas era deliberadamente errónea.

No es que no se den cuenta del error. Es que dejan de mirar. Cuando la máquina responde con fluidez y aplomo, el humano acepta. Y un supervisor que acepta, firma. La supervisión que sobre el papel era la red de seguridad se convierte, en la práctica, en un sello de goma que además añade la autoridad de una firma humana a un error que nadie revisó de verdad.

Ese es el corazón del asunto. Un «humano en el bucle» que no puede o no quiere contradecir a la máquina no es control. Es responsabilidad sin agencia: alguien que responde por una decisión que no tomó y que no revisó.

Y el problema se está agrandando solo

En julio de 2026 OpenAI publicó un informe que, sin proponérselo, dobla la apuesta. Analizaron más de 800.000 mensajes de trabajo de usuarios de ChatGPT en Estados Unidos y compararon cada petición con la ocupación que esa persona declara tener. El 16,8 % de todo lo que la gente pide en el trabajo son tareas históricamente propias de otro oficio; contando solo las peticiones que pertenecen claramente a un oficio concreto, la proporción sube al 43,5 %. Un comercial explorando el dataset que antes mandaba al analista. Alguien de marketing depurando el script que antes pedía a un desarrollador. Hay que tomarlo por lo que es, y los propios autores son honestos con ello: telemetría de OpenAI sobre su propio producto, descriptiva, que mide lo que la gente pide y no si el resultado se usó ni si alguien competente lo revisó. Pero el sentido de la flecha se ve, y el informe cierra con lo que a mí me parece la frase importante de todo esto: que, si ese cambio se consolida, los trabajadores pueden necesitar formación para evaluar trabajo asistido por IA fuera de su especialidad, y las organizaciones tendrán que preparar procesos claros de revisión y responsabilidad.

Ahora junta las dos evidencias. La supervisión humana ya rinde mal cuando se coloca donde la máquina es mejor. Y cada vez más trabajo lo está haciendo, y firmando, alguien que no es del oficio. No es que falten revisores. Es que los estamos poniendo en el sitio equivocado, y encima cada vez más lejos de su competencia.

Lo que esto le pide a un consejo

Un grupo de investigadores de más de una docena de universidades lo formuló en 2026, en un preprint sobre supervisión de la IA, con una idea que debería estar pegada en la sala donde se aprueban estos proyectos. Distinguen tres niveles de supervisión eficaz, cada uno más exigente que el anterior: tomar el relevo cuando la IA falla, detectar sus errores y decidir si corregirlos, y el que llaman Synergy, en el que persona y máquina, juntas, rinden más que cualquiera de las dos por separado. Y advierten, con otros autores, de que una supervisión mal diseñada da al humano la responsabilidad pero no la capacidad real de evitar el daño. Lo llaman sin rodeos illusion of human control, la ilusión del control humano. Un humano que solo recibe el output y le da el visto bueno no está en ninguno de esos tres niveles. No estás gobernando el riesgo. Estás haciendo teatro de cumplimiento.

Hay además una ventana de tiempo que conviene no malinterpretar. El artículo 14 del Reglamento europeo de IA exige supervisión humana en los sistemas de alto riesgo y enumera lo que debe permitir, pero no cómo diseñarla. Las obligaciones que la volvían exigible apuntaban a agosto de 2026, pero el Ómnibus digital las ha diferido al 2 de diciembre de 2027 para los sistemas de alto riesgo del anexo III, y a agosto de 2028 para los del anexo I. Casi año y medio más de margen. Quien lo lea como un aplazamiento del problema llegará a 2027 improvisando contra una fecha. Es, de hecho, la única ventana razonable que vas a tener para diseñar ese control con criterio.

Para una empresa que está en estos meses escribiendo su política de IA, esto cambia la conversación. La pregunta útil deja de ser «¿ponemos un humano a revisar?» y pasa a ser tres preguntas más difíciles. En qué procesos vuestro equipo es de verdad mejor que la máquina, porque solo ahí la supervisión suma. En cuáles la máquina ya es mejor, porque ahí el revisor humano probablemente degrada el resultado y conviene rediseñar el control de otra forma (auditoría por muestreo, límites duros, trazabilidad, apagado), no poniendo a alguien a firmar. Y si vuestra gente, cuando revisa, tiene de verdad el tiempo, el incentivo y la libertad para decir «esto está mal», o solo tiene el botón de aprobar.

Nada de esto es un argumento contra la prudencia. Es un argumento contra confundir prudencia con un procedimiento que da tranquilidad en la reunión y falla en producción. La medida que a todo el mundo le parece la más segura, aplicada sin discriminar, es la que el promedio de 106 estudios señala como destructora de valor.

Así que la pregunta para tu propia casa, y no se contesta con intuición: en el último proceso donde metiste un «humano en el bucle», ¿lo pusiste donde la persona es mejor que la máquina, o lo pusiste donde quedaba bien en la diapositiva de riesgos? Porque si es lo segundo, no estás controlando el sistema. Estás poniéndole una firma.

Fuentes de esta pieza

Hablemos

Versión revisada del artículo publicado en LinkedIn el : hemos corregido algunos datos tras cotejarlos con las fuentes originales.