2026-08-13·Análisis
Meta lanzó Muse Glimmer el 10 de agosto: 30B parámetros densos, licencia Apache 2.0, diseñado para agentes locales. Gana a Gemma 4 31B en la mayoría de benchmarks agénticos pero pierde con Qwen 3.6 27B en uso de terminal. Análisis con benchmarks verificados, números de hardware real y casos de uso.
#muse#meta#open-weights
2026-08-09·Análisis
Claude Opus 5 aterriza en Claude Code, Cursor lanza Router, plan India e iPad bajo la sombra de la compra de SpaceX, Windsurf desaparece como marca (ahora Devin Desktop) y OpenAI recorta precios de GPT-5.6 Terra y Luna. Repaso verificado de lo que cambió en cada herramienta entre el 17 de julio y el 9 de agosto de 2026.
#coding-agents#claude#openai
2026-08-07·Análisis
Moonshot AI lanzó Kimi K3 el 16 de julio: 2.8T parámetros MoE, 1M de contexto, $3/$15 por millón de tokens y pesos abiertos. Cuarto en el Intelligence Index (57.1), primero en AutomationBench y Frontend Code Arena. Análisis con benchmarks verificados, pricing real y casos de uso.
#kimi#open-weights#frontier-models
2026-08-05·Review
Claude Opus 5 empata en inteligencia con Fable 5 (61 en el Intelligence Index) a mitad de precio. Lidera Frontier-Bench y GDPval-AA, pero su tasa de alucinación subió 14 puntos. Review con benchmarks verificados, pricing real y casos de uso.
#claude#frontier-models#llm
2026-08-03·Análisis
Doce hilos en 24 horas describen los mismos cuatro fallos de memoria en agentes: resúmenes obsoletos, reconstrucción de contexto, race conditions y relectura de repos. Tres servidores MCP open source salieron esta semana con enfoques opuestos. Análisis de qué falla, por qué, y qué arquitectura resuelve cada modo.
#agentes#memoria#mcp