Radar IA · 22 agosto 2026: Qwen 3.8 domina el debate local, Kimi K3 y GLM-5.3 debutan en AA Intelligence, promo del 75% en Gemini 3.7 Flash
Radar IA · 22 agosto 2026
Modelos
Qwen 3.8 es el tema de la semana en local. Elspotting de la variante 35B-A3B (r/LocalLLaMA, 831 puntos) coincidió con un mensaje de un dev de Qwen pidiendo no esperar a esa versión concreta (1.138 puntos, 444 comentarios): hay más variantes en camino. En paralelo, un usuario que pasó 1M+ de tokens por Qwen 3.8 27B publicó su configuración óptima de llama.cpp para 16 GB de VRAM (73k de contexto para coding agéntico) — guía práctica si trabajas en local.
Kimi K3 y GLM-5.3 debutan en AA Intelligence. Ambos entran directos a 60 puntos (max), por delante de GPT-5.6 Sol y Claude Opus 5 en configuración media. También aparecen en el leaderboard Qwen3.8 2.4T A95B, Solar Open2 250B y EXAONE 2.0 — la ola open-weight sigue subiendo. Eso sí: Claude Opus 5 (max) sigue en el nº1 con 63.
Herramientas
Cursor acelera sus Cloud Agents: arranque 3x más rápido con builds. El changelog añade historial de builds, depuración y agentes más resilientes (snapshot del 17-ago, delta de 29 líneas añadidas). Para equipos que ya trabajan con agentes en la nube, el tiempo de arranque era el principal rozamiento.
Benchmarks y datos
Precios en movimiento (pricing DB, 17-20 ago):
| Modelo | Entrada $/1M | Nota |
|---|---|---|
| Gemini 3.7 Flash | 0,375 | promo −75% (1,875 salida) |
| GLM-5.3 (nuevo) | 1,4 | salida 4,4 |
| Kimi K3 | 2,6 | salida 13 |
| DeepSeek V4 Flash | 0,25 | sube precio |
| Gemma 4 26B | 0,41 | baja |
La promo de Gemini 3.7 Flash lo deja como opción por defecto para cargas de alto volumen; vigila la fecha de fin de promo antes de arquitecturar alrededor.
Tendencias
Escepticismo creciente con el cadence de releases. “The extreme number of updates comes off as janky and unprofessional” (r/ClaudeAI, 2.171 puntos) y “Claude is Losing Me After Being Heavy User Since Release” (852) marcan un tono: la saturación de actualizaciones empieza a costarle usuarios a Anthropic. Dato a vigilar de cara al tráfico de comparativas.
Ojo con el hype local: el post “22GB local models on Pi outperform Claude Code Opus 5 High” (1.162 puntos) se viralizó sin evidencia reproducible. Trátalo como ruido hasta que haya benchmark verificable.
Qué leer esta semana
- MidTool: mid-training data synthesis para tool use agéntico — síntesis de datos en mid-training para agentes que usan herramientas.
- ConceptGuard: benchmark de unlearning sensible al contexto — relevante si trabajas modelos con borrado dirigido de conocimiento.
- Inducing Task Models from Computer-Use Traces — inducir modelos de tarea a partir de trazas de uso de ordenador.
- Config Qwen 3.8 27B en 16GB VRAM — práctica y reproducible.
Próximo radar: 29 de agosto de 2026. RSS para actualizaciones semanales.
Fuentes: paper-digest.db (última colección 21-ago), leaderboard-history.db (20-ago), reddit-research.db (21-ago), competitor-monitor.db (17-ago).