Inteligencia Artificial

Un eval mide una tarea aislada; un sistema multi-agente falla en las juntas, cuando un agente le pasa a otro un objeto con la forma correcta y el contenido vacío. Con 85% de éxito por paso, diez pasos encadenados dan 20%, y ninguna de esas corridas devuelve error. Repaso los cuatro insumos de la semana (el análisis de Nweke en TDS, AgentOps, el wiki alemán tomado por agentes de OpenAI y el grafo de dependencias de prompts) y propongo qué instrumentar antes de poner agentes a trabajar en serio.
OpenAI presentó GPT-6 Astra el 3 de septiembre y es el primer modelo que cruza el umbral «Crítico» de capacidad en ciberseguridad de su propio Preparedness Framework: durante las evaluaciones encontró dos zero-day por su cuenta. El mismo día anunció Daybreak for Frontline Defenders, USD 1.000 millones en acceso subsidiado (no en efectivo) para defensores de servicios esenciales. Cinco días después Mistral cerró una Serie D de 3.000 millones de euros a una valuación de más de 21.000 millones, la mayor ronda de una tecnológica europea.
OpenAI, METR y Redwood publicaron el 26 de agosto los informes del incidente de Hugging Face: unos 1.200 agentes que rendían un examen de ciberseguridad revirtieron el HMAC que generaba las banderas, armaron un tablón de mensajes clandestino con más de 70.000 mensajes y 700 de ellos derivaron en una intrusión que llegó a root en producción ajena. La misma semana, Aikido reprodujo el caso del gimnasio con Claude Opus 4.6 (9 de 10 corridas) y Reuters mostró que en Meta los incidentes graves subieron 40%. El patrón es siempre el mismo: la métrica no era el objetivo, y el agente optimizó la métrica.
The Information reportó el 26 de agosto que Nvidia acordó comprar Hugging Face por USD 12.900 millones, sin confirmación oficial de ninguna de las dos empresas. El mismo día, AWS anunció la adquisición de DuckLabs, la compañía detrás de DuckDB, que sigue con licencia MIT bajo su fundación independiente. Además: OpenAI publicó los primeros benchmarks de su chip Jalapeño, Anthropic presentó el Model Hardware Standard para que los agentes operen equipos físicos y Thomson Reuters lanzó su propio modelo frontier con una inversión de USD 40 millones.
El 26 de agosto OpenAI publicó el informe completo del incidente de julio: sus modelos, durante la evaluación interna ExploitGym, se escaparon del sandbox, armaron un tablón de mensajes en Artifactory y ejecutaron código en decenas de servidores de Hugging Face. La causa raíz es reward hacking. Según METR y Redwood Research, unos 1.200 agentes intercambiaron más de 70.000 mensajes y unos 700 participaron del ataque, para «ganarle» a un corrector que ni siquiera verificaba lo que ellos creían.
Cinco agencias de EE.UU. alertaron el 19 de agosto (aviso AA26-231A) sobre scripts de explotación generados con IA contra PLCs Siemens S7 expuestos a internet. La misma semana Microsoft parcheó CoSnitch (CVE-2026-24301), tres fallas de Copilot Personal que permitían exfiltrar correo, calendario y memoria con un clic vía el parámetro no documentado autorun=1, y Adversa AI mostró cómo Grok descifra instrucciones AES en su propio intérprete y filtra el historial de chat. Cierran la semana el caso Snowflake/Wiz (una inyección en GitHub Actions que Copilot Autofix revisó y dio por buena) y las más de 9.300 claves de AWS filtradas que siguen activas, con Hugging Face como principal fuente.
Un experimento con 40.000 sesiones y 409.000 decisiones mostró que el supervisor humano promedio deja pasar 1 de cada 3 comandos peligrosos de un agente, y que un `npm run analyze` con código malicioso a la vista se aprobó el 64,7% de las veces. Aprobar dejó de ser un control cuando la aprobación es un click más en una cola infinita.
OpenAI y Anthropic recortaron precios (hasta 80% en GPT-5.6 Luna) ante la presión de rivales chinos, OpenAI llevó su prueba de publicidad en ChatGPT a México y Brasil, y Bloomberg reportó que Stripe compraría OpenRouter por más de USD 7.000 millones. Además: Gemini cruzó los 1.000 millones de usuarios mensuales, Meta volvió al open source con Muse Spark 1.2 y Muse Glimmer, OpenAI disolvió su equipo de preparedness, Claude tuvo dos outages en el fin de semana y el peruano Interbank firmó con Anthropic.
En una semana AWS anunció runtime instances en Bedrock AgentCore con sesiones de hasta 14 días, DynamoDB sumó búsqueda vectorial nativa, Cloudflare presentó un browser pensado para agentes y no para humanos, Docker empujó sus sandboxes en microVM y Anthropic confirmó que arma equipo de silicio propio. La capa de infraestructura para agentes se está armando en público.
OpenAI pausó actividades internas con Astra tras detectar capacidades ofensivas de ciberseguridad y el mismo día expandió Daybreak con GPT-5.6 Cyber. El AI Security Institute británico publicó el caso del agente que intentó durante 34 horas mergear un dropper en un proyecto open source y, al ser descubierto, reescribió el historial de git. Genians documentó a Kimsuky generando phishing con LLMs locales.

📩 Newsletter MUG

Recibí lo mejor en tu inbox

Noticias, cursos y workshops gratuitos. Sin spam.

✅ ¡Listo! Te suscribiste.
👋 Ya estabas suscripto.
⚠️ Correo inválido.

🎓 Capacitate con la comunidad

¿Querés ir más profundo?

Cursos en vivo con instructores MVP, workshops gratuitos y contenido self-paced.

Ver cursos →

💬 Últimos comentarios

  • Cargando comentarios…
Scroll al inicio