Raven, el "harness de harnesses": agentes que se reescriben solos
Raven orquesta agentes propios y de terceros y reescribe sus harnesses en runtime: qué está verificado en repo y paper y qué es claim del vendor, con fecha.
🤖 Hub editorial
Arquitectura, coding agents, orquestación, memoria, MCP y evaluación.
Cómo construir agentes que trabajen sin quemar tokens.
Sistemas multiagente, coding agents, MCP, memoria, routing, contexto y evaluación. La pregunta no es "¿puede hacerlo un agente?", sino "¿merece la pena frente a un script aburrido?".
Raven orquesta agentes propios y de terceros y reescribe sus harnesses en runtime: qué está verificado en repo y paper y qué es claim del vendor, con fecha.
HomeBody conecta GPT Astra a un Unitree G1 con 5 skills motoras, sin VLA ni datos del entorno. Qué hay detrás: Real2Sim, latencia y mucha lentitud.
OpenShell ejecuta agentes con la política aplicada en el kernel: red denegada por defecto y credenciales que el modelo nunca ve. Dónde se queda corto.
AIDE², Darwin Gödel Machine y SICA reescriben el código de sus propios agentes con los modelos congelados: 20→50% en SWE-bench por ~$22.000, 17→53% por ~$7.000, 7 mejoras aceptadas en 8 días. Lo que está medido, lo que no lo está (la ignición), y qué técnicas de esos loops puedes copiar a tu harness hoy sin ningún bucle que se reescriba a sí mismo.
Ant International ha minado 1.006.822 skills de 19.769 repos de GitHub y las ha verificado pidiendo a un LLM que reconstruya el código a ciegas. Análisis de qué rinde (SWE-bench 9/9, +11,7% relativo), qué no (AgentBench 5/9, reasoning en BigCodeBench), y qué significa para el patrón SKILL.md.
Cuatro papers publicados el 18 de septiembre de 2026 dibujan la superficie de ataque de la memoria de agentes IA: envenenamiento que evade la revisión por documento, memorias en conflicto que amplifican alucinaciones y privacidad reconstruible desde fuera. Con los CVEs concretos que parchear y un checklist de higiene.
OpenAI afirma que unos 10.000 agentes resolvieron en 88 horas un caso del problema de Navier-Stokes. Qué se demostró de verdad (no es el Problema del Milenio completo), cuánto costó (nadie lo sabe) y por qué el crédito está en disputa.
Astra no es AGI: es la primera prueba seria de los agentes computer-use. Evaluamos qué tareas de SEO y contenido puedes delegar hoy y cuáles mantener bajo control humano.
Por qué 'conecta un LLM a tu base de datos' falla con datasets reales, y las seis decisiones de arquitectura que separan una demo de un producto.
Seis patrones de fallo que aparecen una y otra vez en los hilos de r/AI_Agents, con los datos y las soluciones que la comunidad ha validado.
Un hilo en r/ClaudeCode con 1.162 puntos asegura que modelos locales de 22GB corriendo en Pi ya superan a Claude Code con Opus 5 High en tareas reales posteriores al cutoff de entrenamiento. La parte verificable de la afirmación es más interesante que el titular: el benchmark interno de Databricks y el experimento de oh-my-pi sugieren que el diseño del harness decide más que los pesos del modelo.
Claude Opus 5 aterriza en Claude Code, Cursor lanza Router, plan India e iPad bajo la sombra de la compra de SpaceX, Windsurf desaparece como marca (ahora Devin Desktop) y OpenAI recorta precios de GPT-5.6 Terra y Luna. Repaso verificado de lo que cambió en cada herramienta entre el 17 de julio y el 9 de agosto de 2026.
Doce hilos en 24 horas describen los mismos cuatro fallos de memoria en agentes: resúmenes obsoletos, reconstrucción de contexto, race conditions y relectura de repos. Tres servidores MCP open source salieron esta semana con enfoques opuestos. Análisis de qué falla, por qué, y qué arquitectura resuelve cada modo.
El experimento de Google DeepMind donde 96 agentes coordinados generaron un sistema operativo funcional —incluyendo soporte para Doom— en 12 horas y por menos de $1.000 en tokens. Análisis de qué significa para la arquitectura multi-agente.
Ranking de las 10 plataformas de agentes IA más relevantes de 2026 evaluadas con criterios reales: setup, fiabilidad, coste y casos de uso en producción.
Los tres patrones de orquestación multi-agente en producción: router+workers, pipeline y blackboard. Código Python ejecutable y cuándo usar cada uno.
El update del 16 de abril convirtió Codex de coding agent en workstation completa: computer use en macOS, 90+ plugins, memoria persistente y browser integrado. Qué cambia de verdad y dónde sigue sin llegar.
En Stripe Sessions 2026 se presentó la infraestructura para que agentes de IA compren de forma autónoma. Repaso técnico de la pila de protocolos (ACP, UCP, MPP, x402), cómo funciona y qué implica para devs.
Dos tribunales chinos han establecido que reemplazar empleados con IA no es base legal para despido. Qué implica para devs que diseñan sistemas de automatización y cómo se compara con la regulación en UE y EEUU.
Guía práctica para construir coding agents con el Cursor SDK: desde la instalación hasta despliegue en cloud, comparación con Claude Code y OpenAI Agents SDK, y análisis de costes reales.
Matemática simple que demuestra por qué la racionalidad empresarial conduce a sobre-automatización y destruye demanda, causando despidos masivos.
El patrón drafter/reviewer/approver usa modelos baratos para generar y modelos potentes solo para validar. Con los precios de 2026, este enfoque cuesta un 84% menos que usar un modelo frontier para todo. Aquí tienes la implementación, los números y los casos donde no funciona.
Stripe lanza 288 productos para la era del comercio agente. Análisis técnico de oportunidades, implementación y realidades para desarrolladores.
Hermes Agent (Nous Research) y OpenClaw son los dos frameworks de agentes open source más activos en 2026. Pero resuelven problemas distintos: uno aprende, el otro conecta. Comparativa con datos, no con marketing.
Un gerente de Uber publicó un hilo que se volvió viral: 243K requests de codificación y $28K gastados en 2 meses, con 84% de code aceptado sin revisión. Los números reales, los trade-offs y la verdad sobre productividad vs coste.
Comparativa real de coding agents en 2026: qué hace cada uno, cuándo compensa, costes reales y qué es marketing.
Patrones de arquitectura reales para agents en producción: single-loop, multi-agent, MCP, memory, evaluación y lo que funciona vs lo que es marketing.
Los coding agents desperdician hasta un 60% de tokens en trayectorias redundantes (FSE 2026). Qué gestionan ya Claude Code, OpenClaw y Cursor y qué falta.
Un sitio web en blanco logró engañar a Perplexity y ChatGPT en 36 horas. Analizamos el experimento de Sascha Deforth y el protocolo ARP para solucionar la
Análisis técnico de las 5 herramientas que definen la autonomía en 2026: Cloudflare Agents SDK, OpenClaw, MCP, Claude Code y Parallel Chat API.
El patrón drafter/reviewer/approver usa modelos baratos para generar y modelos potentes solo para validar. Resultado: mejor calidad con un 80% menos de coste.
Modelos locales te dan privacidad pero fiabilidad limitada. Cloud APIs son potentes pero ven tus datos.
Cursor lanza @cursor/sdk: el motor de agentes del editor, ahora disponible como librería TypeScript. Cloud VMs, hooks,
Un tribunal chino ha fallado que reemplazar empleados por IA no es justificación legal de despido. Qué significa para la industria y qué viene después.
Cómo funciona un sistema multi-agente real con OpenClaw: routing jerárquico, memoria por agente, skills compartidas y lo que aprendimos deployando uno en