Resumen de la publicación
Un equipo de la Universidad Fudan midió cómo trabajaron 56 personas con agentes durante el desarrollo de su propio modelo, sobre 769 registros de tareas. Los agentes propusieron más de la mitad de los métodos y las acciones por cada pedido humano pasaron de 11 a 28,5 en cuatro semanas, pero las personas tomaron el 85,5% de las decisiones finales.
Te cuento por qué, para mí, el dato importante no es cuánto hace el agente sino quién decide, qué se le corre al trabajo del dev cuando el agente propone y ejecuta, y qué habilidades entrenaría hoy en un equipo para que ese «decidir» no se vuelva un sello de goma.
Cada vez que sale un número sobre agentes, el titular se escribe solo: «la IA ya hace la mitad del trabajo». Esta semana le tocó a un estudio que circuló con ese recorte.
Lo fui a leer entero porque el recorte me hacía ruido. Y lo que encontré es casi lo contrario de lo que sugiere el titular: más actividad del agente, sí, pero no más autonomía.
Qué midieron (y qué simplifica el titular)
El estudio es parte del paper de Atria Dawn, un modelo agéntico de 744.000 millones de parámetros presentado por un equipo con contacto en la Universidad Fudan (China). Además de los benchmarks del modelo, los autores analizaron cómo se repartió el trabajo entre personas y agentes mientras lo construían.
La base son 769 registros de tareas de 56 participantes, más los logs de los agentes. Estos son los números que a mí me importan:
- Uso casi total: de 739 tareas con respuesta clara, 713 usaron IA (96,5%).
- Quién propone y quién elige: en decisiones de método y parámetros, el patrón más común fue «la IA propone, la persona elige» (55,4%). Las personas tomaron la decisión final en el 85,5% de los casos y la IA en el 9,2%.
- Objetivos y alcance: la IA propuso apenas el 16,9% de las opciones y las personas eligieron el 93,4% de las veces.
- Trabajo nuevo, no solo más rápido: de 455 tareas completadas con IA, los participantes calificaron 151 (33,2%) como imposibles de hacer sin ella, con el mismo alcance y los mismos recursos.
- Más delegación por pedido: la mediana diaria de acciones del agente por cada instrucción humana pasó de 11 a 28,5 entre el 7 de agosto y el 4 de septiembre.
El titular que circuló (el de «los agentes proponen hasta el 55% de los métodos») mezcla dos cosas. El 55,4% es la proporción del patrón «IA propone, persona elige», no el techo de lo que propone la IA; de hecho, en la conclusión el propio paper dice que la IA propuso el 64,6% de 567 decisiones de método. Sea cual sea el número exacto, la idea es la misma: más de la mitad.
Y hay que decir la letra chica antes de construir nada arriba: es un solo equipo, en un solo proyecto, con datos que en buena parte salen de lo que los participantes declararon o recordaron. Además, es el equipo que vende el modelo. Lo tomo como una foto honesta de un caso, no como una ley del mercado.
Más acciones por pedido no es más autonomía
La frase del paper que más me gustó es casi una aclaración técnica: lo que cambia según el tipo de decisión es quién genera las opciones, no quién elige entre ellas. La IA pasa de proponer el 16,9% de los objetivos a más de la mitad de los métodos, pero su participación en la decisión final se queda entre el 6,1% y el 9,2%.
Lo más interesante está en las 151 tareas que «no se hubieran hecho sin IA». Ahí, donde la dependencia es máxima, las personas eligieron el objetivo final en el 95,4% de los casos, más que en el promedio general.
O sea, depender más del agente no significó darle más autoridad. Significó que el agente hacía más cosas entre una decisión humana y la siguiente.
Vengo viendo esta confusión hace meses en las conversaciones con equipos: se mide cuántas líneas escribió el agente, cuántos PR abrió, cuántas horas «ahorró», y se lee eso como autonomía. Son métricas de actividad, y sirven, pero no te dicen quién está a cargo.
El otro dato que lo confirma es el de los problemas. De 588 tareas con una dificultad registrada, el 76% avanzó gracias a una persona, y la ayuda fue casi siempre de información: agregar contexto o aclarar requisitos (35,2%) y diagnosticar el problema o cambiar el método (34,7%). Tomar el control y hacerlo a mano pasó en el 0,7% de los casos.
El humano no reemplaza al agente cuando algo falla. Le cambia lo que sabe.
El trabajo del dev se corre a decidir y a verificar
Si juntás todo, el perfil del trabajo humano en ese equipo queda bastante claro:
- Definir qué vale la pena hacer: objetivos y alcance siguen siendo casi enteramente humanos.
- Elegir entre opciones que propone otro: el agente arma el menú, la persona elige.
- Dar contexto y diagnosticar: cuando el agente se traba, lo que falta casi nunca es mano de obra, es información.
- Revisar lo que sale: el 56,5% de los resultados principales del agente tuvo revisiones sustanciales, y en el 75,4% de esos casos la corrección la hizo el propio agente después del comentario humano.
Desde mi punto de vista, esto es lo que muchos equipos todavía no terminaron de procesar. Durante veinte años el valor de un dev se midió bastante por cuánto producía; ahora lo que produce el agente es barato, y lo caro es saber si está bien.
Los propios autores lo dicen con una honestidad que me sorprendió. La autoridad quedó en manos de los investigadores, reconocen, pero cada decisión descansa ahora sobre una cadena de trabajo del agente más larga de lo que una persona puede inspeccionar con cuidado.
Y agregan el riesgo de fondo: terminar siendo revisores que solo pueden decir «sí», con una participación humana que funcione como placebo. Esa es exactamente la trampa que describí cuando escribí que el humano en el circuito es teatro si nadie lee el prompt.
El permiso que nadie decidió
Hay un párrafo del paper que pasó bastante desapercibido y que para mí vale más que todos los porcentajes. Cuentan que muchos de sus investigadores corrían los agentes en modos autónomos (el «yolo mode» de Codex, el modo que salta los permisos de Claude Code) para que las corridas largas no se frenaran esperando aprobaciones.
Y lo resumen en una frase: en la práctica, el límite lo puso la comodidad, no una asignación deliberada de autoridad.
Esto es un equipo que estudia la colaboración entre personas y agentes, que publica que las personas deciden el 85% de las veces, y que al mismo tiempo admite que los permisos de ejecución se abrieron porque era más cómodo. Si les pasa a ellos, te pasa a vos.
Las dos cosas conviven sin contradicción: vos decidís el método, pero el agente ejecuta con permisos que nadie pensó. Y cuando el agente choca contra un límite que no tiene, busca la vuelta. Lo vimos con los modelos que le dejan notas al que viene después, y lo volvimos a ver esta misma semana con agentes que no aceptaron un «no» como respuesta.
Decidir el «qué» no alcanza si el «cómo» corre con las llaves de todo.
Qué entrenaría hoy en un equipo
Si el trabajo se corre a decidir y verificar, las habilidades que hay que entrenar cambian. No digo que programar deje de importar; digo que ya no es lo que separa a un buen equipo de uno mediocre. Estas son las cuatro en las que yo pondría tiempo:
- Criterio para elegir. Si el agente te trae tres enfoques, tenés que poder explicar por qué elegís uno. Pediles a los juniors que escriban esa justificación en el PR, aunque sean dos líneas: es la forma más barata de ver si hubo decisión o solo aceptación.
- Revisión de verdad. Leer un diff de 800 líneas generado en diez minutos es otra disciplina que leer el de un compañero. Hay que entrenar a revisar contra una especificación y contra tests que existían antes del cambio, no contra la sensación de que «se ve bien».
- Dar contexto. El paper muestra que la intervención humana más frecuente es agregar información que el agente no tenía. Escribir buenos requisitos, buenos
READMEy buenas instrucciones de repositorio es trabajo de ingeniería, no burocracia. - Saber cortar. Frenar una corrida que va mal, descartar un resultado que costó horas, decir «esto no lo delegamos». Es la habilidad menos visible y la que más se atrofia cuando todo sale rápido.
Y del lado de la plataforma, una sola regla: los permisos del agente se deciden en una reunión, no en el momento en que la corrida se traba esperando un «sí». Si hoy nadie en tu equipo puede decir con qué permisos corren los agentes, ahí tenés la primera tarea del lunes.
Lo que me llevo de este estudio no es que la IA haga la mitad del trabajo. Es que la parte que sigue siendo nuestra (elegir, verificar, cortar) es justo la que más fácil se nos escurre cuando el agente hace todo lo demás.
En tu equipo, ¿quién decide hoy qué se delega y con qué permisos? Te leo en los comentarios.


