Opinión y Reflexiones

En una semana AWS anunció runtime instances en Bedrock AgentCore con sesiones de hasta 14 días, DynamoDB sumó búsqueda vectorial nativa, Cloudflare presentó un browser pensado para agentes y no para humanos, Docker empujó sus sandboxes en microVM y Anthropic confirmó que arma equipo de silicio propio. La capa de infraestructura para agentes se está armando en público.
Un experimento con 40.000 sesiones y 409.000 decisiones mostró que el supervisor humano promedio deja pasar 1 de cada 3 comandos peligrosos de un agente, y que un `npm run analyze` con código malicioso a la vista se aprobó el 64,7% de las veces. Aprobar dejó de ser un control cuando la aprobación es un click más en una cola infinita.
ChainDrop infectó más de 1.300 paquetes npm que suman 2.000 millones de descargas mensuales, 77 extensiones de Open VSX recolectaban datos de entornos de desarrollo y un feed JSON envenenado creó admins ocultos en sitios WordPress. El ataque dejó de apuntarle a tu código: le apunta a todo lo que tu build descarga y ejecuta sin que nadie lo mire.
Nadella dijo que la empresa que no controla su capa de modelos «esencialmente tercerizó su pensamiento». Con Microsoft lanzando modelos propios, Opus 5 igualando a Fable 5 a mitad de precio y el MCP volviéndose stateless, mantener el harness separado del modelo dejó de ser una opinión de arquitectura.
En doce días modelos de OpenAI encadenaron ocho 0-days de JFrog Artifactory para salir a internet, Claude subió malware a PyPI que 15 sistemas reales ejecutaron, y un actor chino automatizó ataques con DeepSeek y Hermes. La pregunta ya no es si un agente puede atacar, sino quién responde cuando lo hace.
OpenAI reveló su primer «incidente de contención»: un modelo interno de largo horizonte pasó una hora explorando una vulnerabilidad de su sandbox para abrir un PR público en GitHub contra sus instrucciones, y en otro caso partió un token de autenticación en dos fragmentos ofuscados para eludir el escáner de seguridad. Retomo mi artículo de la semana pasada: qué agrega este caso y qué puede hacer un equipo chico.
Un análisis empírico midió que Claude Code consume ~33.000 tokens antes de leer tu primer prompt (contra ~7.000 de OpenCode), y un benchmark mostró 3,7 veces más tokens para el mismo resultado. Por qué el costo por token es una variable de arquitectura, qué es el prompt caching y cómo medir lo que tus agentes gastan de verdad.
wp2shell (CVE-2026-63030 + CVE-2026-60137) es un RCE pre-auth en el core de WordPress, con explotación activa y entrada al KEV de CISA el 21 de julio; parches en 6.9.5/7.0.2/6.8.6. Reflexión en primera persona sobre qué significa administrar WordPress cuando la falla no está en un plugin sino en el corazón del CMS que corre el 40% de la web.
El sandboxing de agentes de IA es necesario pero no alcanza: repasando casos reales de 2026 (Claude Code, Cursor, gobierno mexicano) explico qué capas de validación y monitoreo hacen falta sumar.
Un análisis de CNCF/KubeOps sobre on-prem, nube y soberanía digital, cruzado con el Súper RIGI argentino y la reforma pendiente de la ley de datos personales: la decisión de dónde correr IA es de arquitectura, no de ideología.

📩 Newsletter MUG

Recibí lo mejor en tu inbox

Noticias, cursos y workshops gratuitos. Sin spam.

✅ ¡Listo! Te suscribiste.
👋 Ya estabas suscripto.
⚠️ Correo inválido.

🎓 Capacitate con la comunidad

¿Querés ir más profundo?

Cursos en vivo con instructores MVP, workshops gratuitos y contenido self-paced.

Ver cursos →

💬 Últimos comentarios

  • Cargando comentarios…
Scroll al inicio