Etiqueta: llm

Un análisis empírico midió que Claude Code consume ~33.000 tokens antes de leer tu primer prompt (contra ~7.000 de OpenCode), y un benchmark mostró 3,7 veces más tokens para el mismo resultado. Por qué el costo por token es una variable de arquitectura, qué es el prompt caching y cómo medir lo que tus agentes gastan de verdad.
Alphabet postergó por varios meses el lanzamiento amplio de Gemini 3.5 Pro (anunciado en el I/O de mayo con contexto de 2 millones de tokens y modo Deep Think) porque su rendimiento en coding quedó por debajo de las expectativas internas; la acción cayó 4,4% el 16 de julio y borró unos US$200.000 millones de capitalización.
Moonshot AI lanzó Kimi K3, un MoE de 2,8 billones de parámetros con contexto de 1 millón de tokens y visión nativa que quedó primero en Frontend Code Arena (1.679) por encima de Claude Fable 5 y GPT-5.6 Sol. Los pesos abiertos llegan el 27 de julio.
Investigación de interpretabilidad de Anthropic explica el circuito interno que hace que los modelos de IA confundan familiaridad con conocimiento; repaso casos reales de 2026 y qué mitigaciones funcionan de verdad.
LayerX demostró que precondicionar a un LLM con premisas falsas basta para que ignore su lógica de seguridad y filtre credenciales. Probaron seis navegadores y agentes con IA: cayeron los seis.
La mayoría de las apps de LLM no necesitan un framework de agentes ni autonomía total: necesitan un flujo determinista bien hecho. Cuándo alcanza con tool calling y structured outputs, cuándo conviene un agente de verdad y cómo no sobreingenierizar.

📩 Newsletter MUG

Recibí lo mejor en tu inbox

Noticias, cursos y workshops gratuitos. Sin spam.

✅ ¡Listo! Te suscribiste.
👋 Ya estabas suscripto.
⚠️ Correo inválido.

🎓 Capacitate con la comunidad

¿Querés ir más profundo?

Cursos en vivo con instructores MVP, workshops gratuitos y contenido self-paced.

Ver cursos →

💬 Últimos comentarios

  • Cargando comentarios…
Scroll al inicio