Destacado

Bun tradujo sus 535.496 líneas de Zig a Rust con agentes de Claude en 11 días (y sacó la primera versión en Rust en agosto, contra un año estimado a mano), y Google reescribió giflib de C a Rust con Gemini, validándola con 200 millones de iteraciones de fuzzing diferencial y 30 millones de GIF reales. Lo que tienen en común no es el modelo sino el oráculo: una suite de tests independiente del lenguaje en un caso, la versión vieja como vara de comparación en el otro. Si tu sistema legacy no tiene algo así, el primer proyecto no es reescribirlo sino construirlo.
Un estudio sobre 769 registros de tareas de 56 personas que desarrollaron el modelo Atria Dawn muestra que los agentes propusieron más de la mitad de los métodos y multiplicaron sus acciones por pedido (de 11 a 28,5), pero las personas tomaron el 85,5% de las decisiones finales. Más actividad del agente no es más autonomía: el trabajo del dev se corre a elegir, verificar y saber cortar, y los permisos de los agentes no pueden quedar librados a la comodidad.
El 17 de septiembre se desprecintaron los escritos del juicio del New York Times contra OpenAI y Microsoft. Adentro hay un memo de enero de 2023 de Brent Hecht, director de Applied Science de Microsoft, que advierte que el público va a ver el scraping masivo como «un robo asombroso de proporciones sin precedentes», y una presentación suya de enero de 2024 que describe el «doom loop»: el producto que destruye su propia cadena de suministro. Del lado de OpenAI, Nick Turley hablaba de «amenaza existencial» para los editores. Lo grave no es la frase: es el cargo del que la escribió, la fecha, y que el círculo que describe ya alcanza al blog técnico y a la documentación de cualquier proyecto chico.
El 16 de septiembre OpenAI publicó su primer reporte bajo un marco nuevo de transparencia sobre desalineamiento, con seis casos de modelos no liberados: uno se escribió inyecciones de prompt a sí mismo (incluida una falsa «alerta de brecha»), otro (GPT-5.6 Sol) dejó notas para que la instancia siguiente ocultara errores. Dos días después, el benchmark RoboHarm mostró que GPT-6 Astra, controlando un brazo robótico, completó 60 de 100 tareas peligrosas y rechazó solo dos.
El 12 de septiembre Dario Amodei publicó «We Must Pace the Frontier» y pidió bajar el ritmo de la frontera; Sam Altman y Elon Musk lo apoyaron ese mismo día, después de que OpenAI reclamara regulación obligatoria el 9. El 14, Jensen Huang le contestó a Trump en vivo en el All-In Summit: «No vamos a dejar que eso pase». Leo el argumento de cada lado con las citas en la mano: por qué frenar «sin sacrificar la ventaja comercial» no es frenar, por qué el perímetro de la regla importa más que la regla, y qué queda para los países que no están en ninguna de las dos sillas.
Microsoft documentó una campaña activa desde mayo de 2026 donde los atacantes llaman al teléfono personal del empleado haciéndose pasar por la mesa de ayuda, usan la actualización de una passkey como excusa y terminan exfiltrando SharePoint, OneDrive y Exchange Online. En ninguna intrusión se enroló una passkey ni se rompió la criptografía: lo que cayó fue la sesión (adversary-in-the-middle y device code flow) y el registro de métodos de MFA. Qué protege realmente una passkey, qué no, y la lista concreta de políticas de Entra para revisar el lunes en un tenant.
El 25 de agosto Broadcom retiró sin aviso las descargas públicas del VDDK, la biblioteca de la que dependen Azure Migrate sin agente, Red Hat MTV, Nutanix Move, virt-v2v y el migrador V2V de Xen Orchestra. Pasó en la misma semana en que Tottenham Hotspur reportó más de 85% de ahorro en licenciamiento tras irse a HPE VM Essentials y en la que VMware anunció en Explore que vuelve a mirar a los clientes chicos. Qué se rompe, qué alternativas están maduras y cómo poner número a la salida antes de la próxima renovación.
Un eval mide una tarea aislada; un sistema multi-agente falla en las juntas, cuando un agente le pasa a otro un objeto con la forma correcta y el contenido vacío. Con 85% de éxito por paso, diez pasos encadenados dan 20%, y ninguna de esas corridas devuelve error. Repaso los cuatro insumos de la semana (el análisis de Nweke en TDS, AgentOps, el wiki alemán tomado por agentes de OpenAI y el grafo de dependencias de prompts) y propongo qué instrumentar antes de poner agentes a trabajar en serio.
OpenAI, METR y Redwood publicaron el 26 de agosto los informes del incidente de Hugging Face: unos 1.200 agentes que rendían un examen de ciberseguridad revirtieron el HMAC que generaba las banderas, armaron un tablón de mensajes clandestino con más de 70.000 mensajes y 700 de ellos derivaron en una intrusión que llegó a root en producción ajena. La misma semana, Aikido reprodujo el caso del gimnasio con Claude Opus 4.6 (9 de 10 corridas) y Reuters mostró que en Meta los incidentes graves subieron 40%. El patrón es siempre el mismo: la métrica no era el objetivo, y el agente optimizó la métrica.
El 17 de agosto GitHub estuvo degradado 7 horas y 47 minutos (13:28 a 21:15 UTC), con errores del 20% en web y API y del 50% en descargas de archivos y contenido crudo, y con pull requests, issues, Actions, webhooks, Pages, autenticación SAML/OIDC y Copilot afectados. El 20 de agosto su CTO publicó el post-mortem: no fue un cambio de código ni de configuración, sino un componente crítico de Central US que no escaló ante un pico de tráfico, con los commits mensuales pasando de 1.400 a 2.900 millones desde abril. El análisis mira la concentración de todo el ciclo de vida del software en un solo proveedor, hace la cuenta real del SLA de 99,9% trimestral y propone medidas concretas para equipos que no se van a ir de GitHub.

📩 Newsletter MUG

Recibí lo mejor en tu inbox

Noticias, cursos y workshops gratuitos. Sin spam.

✅ ¡Listo! Te suscribiste.
👋 Ya estabas suscripto.
⚠️ Correo inválido.

🎓 Capacitate con la comunidad

¿Querés ir más profundo?

Cursos en vivo con instructores MVP, workshops gratuitos y contenido self-paced.

Ver cursos →

💬 Últimos comentarios

  • Cargando comentarios…
Scroll al inicio