DoorDash construyó un sistema de agentes de IA que audita feature flags (banderas de configuración que activan o desactivan una función sin tocar el código, muy usadas para lanzar funciones de a poco o correr pruebas A/B) y automatiza buena parte de la limpieza de las que ya no sirven para nada.
El sistema procesó 60.000 flags distribuidas en 623 repositorios. En una prueba con 50 candidatas a eliminar, generó pull requests utilizables en 45 casos, a un costo promedio de 4,79 dólares y 13,8 minutos por flag, contra la 1 a 2 horas que le toma a un desarrollador hacerlo a mano.
La misma semana, Alibaba liberó el código de OpenCodeReview, el revisor de código que usa puertas adentro desde hace dos años.
Por qué hay 60.000 flags dando vueltas
La plataforma de experimentación de DoorDash administra esas 60.000 flags y crea unas 2.300 nuevas por mes. La compañía identificó más de 1.000 como obsoletas: sin cambios en 90 días, todavía referenciadas en el código, y ni archivadas ni marcadas para conservar.
Es el problema clásico de la deuda técnica: borrar una flag que puede seguir en uso da miedo, así que nadie lo hace, y la lista crece sola.
Cómo arma el trabajo el sistema multiagente
Un orquestador que corre sobre Claude Sonnet reparte el trabajo entre agentes con Claude Opus, todo montado sobre el Agent Development Kit de Google.
Cada agente trabaja en un worktree de Git aislado (una copia de trabajo separada dentro del mismo repositorio), lo que permite correr hasta cuatro agentes en paralelo sobre un mismo repo sin que se pisen los cambios entre sí.
Para saber si una flag sigue activa de verdad, los agentes consultan datos en vivo de la plataforma de experimentación a través de MCP (Model Context Protocol, un estándar abierto que conecta un modelo de IA con herramientas y fuentes de datos externas sin programar una integración a medida para cada una).
Antes de que un humano vea el cambio, cada propuesta pasa por validación automática: build, tests, cobertura con JaCoCo y análisis estático con Detekt.
El resultado se ordena según la complejidad de la flag:
- Complejidad baja: 100% de éxito en el primer intento.
- Complejidad media: 94% de éxito.
- Complejidad alta: 85% de éxito.
De las 50 flags de la prueba, 31 PRs se pudieron mergear directo, 14 necesitaron una revisión adicional y 5 terminaron en intervención manual completa. El sistema fue aceptado en el track de industria de ICSME 2026.
Alibaba abrió su revisor de código: OpenCodeReview
Alibaba publicó como código abierto (licencia Apache-2.0) a OpenCodeReview, el asistente de revisión de código que usa internamente desde hace dos años en decenas de miles de desarrolladores, y con el que dice haber identificado millones de defectos.
La arquitectura combina un pipeline determinístico (sin IA) para lo que no necesita criterio (elegir qué archivos mirar, agrupar los cambios, aplicar reglas fijas) con un agente de IA reservado para los casos grises, donde el juicio no se puede reducir a una regla.
Ese pipeline detecta de entrada, sin gastar una sola consulta al modelo, problemas conocidos como excepciones de puntero nulo, condiciones de carrera entre hilos, XSS e inyección SQL.
Se integra con GitHub, GitLab, Gerrit y VS Code, corre como servidor MCP y funciona con agentes de código como Claude Code, Codex y Cursor.
En su propio benchmark, AACR-Bench (50 repositorios y 200 pull requests reales en 10 lenguajes, validado por más de 80 ingenieros senior), Alibaba reporta mejor precisión y F1 que Claude Code corriendo el mismo modelo, con un noveno de los tokens.
El límite de esa comparación lo pone el propio benchmark: el recall quedó en 20%, es decir que la herramienta pasó por alto el 80% de los problemas reales del set de prueba. Sirve para filtrar ruido rápido y barato, no para reemplazar una revisión humana completa.
El patrón que funciona, y el que falta en los casos que salen mal
Los dos casos comparten la misma receta: aislar el trabajo de cada agente (worktrees en un caso, pipeline determinístico en el otro), validar automáticamente antes de mostrarle algo a un humano, y dejar la aprobación final en manos de una persona.
Es también el tipo de tarea donde los agentes rinden mejor hoy: deuda técnica repetitiva, con un criterio de éxito que se puede verificar en el momento (compila, pasa los tests, no rompe nada), en un volumen tan alto que ningún equipo la prioriza a mano.
¿Tenés flags o código zombie dando vueltas hace más de 90 días en tus repos? Contanos en los comentarios cómo lo estás atacando.


