GPT Diffusion

Radar IA · 29 agosto 2026: GLM-5.3-Flash dobla su precio la semana de su debut, Cursor lanza Origin Code Hosting, y los agentes que compilan experiencia

2026-08-29 · editorial

Radar IA · 29 agosto 2026

Modelos

GLM-5.3-Flash debuta fuerte en AA Intelligence… y dobla de precio en la misma semana. Entra en el top-10 con 57 puntos, pero Z.ai ha subido el precio de $0,075/$0,25 a $0,15/$0,50 por millón (input/output) — el doble en menos de siete días desde el lanzamiento. Ojo con las fuentes: OpenRouter todavía lista el precio antiguo, así que desconfía de comparadores desactualizados. Sigue siendo un ratio decente ($0,09 por tarea del Intelligence Index, por debajo de la mediana del mercado: $0,30 entrada / $1,20 salida), pero la narrativa de “inteligencia frontier casi gratis” ya no se sostiene — y a 43,8 tokens/s es de los más lentos de su clase. Frente a Gemini 3.7 Flash en promo del 75% ($0,375/$1,875) sigue saliendo más barato en entrada (2,5x, ya no 5x). Si ruteas volumen, evalúalo contra Qwen3.8-Flash-Next (56 en AA, $0,10/tarea, 89 t/s — el doble de rápido) antes de fijar ningún default. La lección: no arquitectures alrededor de launch pricing. Fuente: Artificial Analysis, 31-ago

El top de AA Intelligence sigue estable; los nuevos entran por abajo. Claude Opus 5 (max) nº1 con 63,1; Claude Fable 5 nº2 con 62,1; GPT-5.6 Sol y Grok 4.6 empatados en 60,9. Las novedades del 27-ago: Qwen3.8 27B (xhigh) en #14 con 52,0 y Motif 3 en #15 — la ola open-weight sigue llenando la mitad baja de la tabla.

Herramientas

Cursor lanza Origin Code Hosting y refuerza Cloud Agents. El changelog del 24-ago añade # /goal, “Agents in every repo”, extensiones de apps para repos de Cursor y “Bring your GitHub repos” — un movimiento claro hacia hosting + agentes omnipresentes en el repositorio, no solo en el editor. Delta grande: 59 líneas fuera, 75 dentro.

OpenAI y Perplexity bloquean el scraping de sus páginas de producto (403 persistente al collector). Nada accionable para el lector, pero síntoma del cierre progresivo de las superficies públicas de los vendors de agentes.

Benchmarks y datos

Atención en Reddit (14 días, reddit-research.db): Qwen 106 menciones (la “Qwen 3.8 27B is a game changer” sigue creciendo), Claude 157, GPT 132, Codex 87 — con quejas recurrentes sobre límites de uso (“$20 Plus con 1 uso de Codex restante”). DeepSeek V4 Pro 0813 suma 74 menciones.

Tendencias

Los agentes que compilan su propia experiencia. Tres papers del 27-ago apuntan a la misma idea desde ángulos distintos: WikiSkill compila experiencia de agentes en conocimiento persistente para evolucionar skills; SWE-Prime muestra que en ingeniería de software menos trayectorias y mejor curadas rinden más que escala bruta; y RedEvoAgent aplica lo mismo a red-teaming. La lección común: el cuello de botella ya no es cuántas trayectorias generas, sino qué conservas de ellas.

También notable: MCR-Bench benchmarkea code review iterativo real (no diffs estáticos), y CritICL propone weak-to-strong en tiempo de inferencia usando los modos de fallo de modelos pequeños.

Qué leer esta semana


Próximo radar: 5 de septiembre de 2026. RSS para actualizaciones semanales.

Fuentes: leaderboard-history.db (27-ago), paper-digest.db (28-ago), reddit-research.db (29-ago), competitor-monitor.db (24-ago). Precios GLM-5.3-Flash verificados contra Artificial Analysis en vivo el 31-ago. Nota del editor (31-ago): AA migró a Intelligence Index v4.1.1 y actualizó la metodología del Coding Agent Index el 20-ago; parte de los reshuffles de mitad de tabla de esta semana son ruido de re-indexado, no shifts reales.