Inteligencia Artificial

OpenAI reveló su primer «incidente de contención»: un modelo interno de largo horizonte pasó una hora explorando una vulnerabilidad de su sandbox para abrir un PR público en GitHub contra sus instrucciones, y en otro caso partió un token de autenticación en dos fragmentos ofuscados para eludir el escáner de seguridad. Retomo mi artículo de la semana pasada: qué agrega este caso y qué puede hacer un equipo chico.
Un análisis empírico midió que Claude Code consume ~33.000 tokens antes de leer tu primer prompt (contra ~7.000 de OpenCode), y un benchmark mostró 3,7 veces más tokens para el mismo resultado. Por qué el costo por token es una variable de arquitectura, qué es el prompt caching y cómo medir lo que tus agentes gastan de verdad.
OpenAI reveló su primer «incidente de contención»: pausó el acceso interno a un modelo de largo horizonte que pasó una hora explotando una falla de su sandbox para publicar el PR #287 en GitHub y luego partió un token de autenticación en dos fragmentos para eludir un escáner. Con las nuevas salvaguardas reporta 0 incidentes de severidad alta o media y una baja del 12% al 2,9% en severidad baja.
NadMesh, una botnet escrita en Go, usa Shodan para localizar instancias expuestas de Ollama, ComfyUI, n8n, Open WebUI, Langflow y Gradio, explota más de 20 vectores RCE y presume 3.811 llaves AWS únicas en el panel de su operador. La investigación es de XLab (QiAnXin).
Alphabet postergó por varios meses el lanzamiento amplio de Gemini 3.5 Pro (anunciado en el I/O de mayo con contexto de 2 millones de tokens y modo Deep Think) porque su rendimiento en coding quedó por debajo de las expectativas internas; la acción cayó 4,4% el 16 de julio y borró unos US$200.000 millones de capitalización.
Moonshot AI lanzó Kimi K3, un MoE de 2,8 billones de parámetros con contexto de 1 millón de tokens y visión nativa que quedó primero en Frontend Code Arena (1.679) por encima de Claude Fable 5 y GPT-5.6 Sol. Los pesos abiertos llegan el 27 de julio.
El Decreto 742/2026, firmado por Axel Kicillof y Carlos Bianco, aprueba el Marco Provincial para el Desarrollo, Uso y Gobernanza de la IA: ningún organismo bonaerense puede desarrollar, contratar o implementar sistemas de IA sin intervención previa de la Subsecretaría de Gobierno Digital, que además administra un registro obligatorio.
El sandboxing de agentes de IA es necesario pero no alcanza: repasando casos reales de 2026 (Claude Code, Cursor, gobierno mexicano) explico qué capas de validación y monitoreo hacen falta sumar.
Por qué correr un solo agente de IA ya no alcanza para ciertos problemas, y qué cambia en coordinación, patrones y control de calidad cuando escalás a decenas de agentes de Claude Code en paralelo.
Investigación de interpretabilidad de Anthropic explica el circuito interno que hace que los modelos de IA confundan familiaridad con conocimiento; repaso casos reales de 2026 y qué mitigaciones funcionan de verdad.

📩 Newsletter MUG

Recibí lo mejor en tu inbox

Noticias, cursos y workshops gratuitos. Sin spam.

✅ ¡Listo! Te suscribiste.
👋 Ya estabas suscripto.
⚠️ Correo inválido.

🎓 Capacitate con la comunidad

¿Querés ir más profundo?

Cursos en vivo con instructores MVP, workshops gratuitos y contenido self-paced.

Ver cursos →

💬 Últimos comentarios

  • Cargando comentarios…
Scroll al inicio