GPT Diffusion

Raven, el "harness de harnesses": agentes que se reescriben solos

2026-10-01 · Devs #agentes#multi-agent#orquestacion#arquitectura#coding-agents

TL;DR

  • Raven (EverMind) es un Host Agent open-source (Apache-2.0, Python, v0.2.3 del 27-sep-2026) que descompone un objetivo en un DAG de subtareas y orquesta 4 agentes built-in más hasta 13 agentes de terceros —Claude Code, Codex, OpenClaw o Hermes Agent, entre otros— vía ACP, CLI o API OpenAI-compatible. Verificado en el README; no lo hemos probado.
  • El giro frente al orchestrator-worker de toda la vida: los harnesses de los subagentes son mutables en runtime. Un Curator reescribe los 4 asientos del bucle de agente (Memory, Planning, Capability, Action). Es el elemento diferencial y el más frágil: es experimental y “ships with the repository rather than the installed package”.
  • “Built for RSI” es claim del vendor. Lo demostrado —nanochat: 172 runs de entrenamiento en 7 rondas y val_bpb −5,8%— son bucles de experimentación automatizada con criterios de evaluación fijados por humanos: el mismo patrón que AIDE² o Darwin Gödel Machine, con los modelos congelados.
  • Todos los benchmarks (MAOB, SWE-bench Pro/Verified, PresentBench, DeepResearch Mixed, DataAgentBench) son imágenes autopublicadas por el vendor, sin tablas en texto ni protocolo reproducible. El technical report es un PDF autopublicado y el autor del paper es una entidad corporativa (“EverMind AI”).
  • Estado: pre-alpha según su propio README. Momentum con fecha: 4.970 stars y 451 upvotes a 1-oct-2026. Interesante de seguir; no para producir nada hoy.

Contexto

El 27-sep-2026 fue un día redondo para EverMind: publicaron la v1 del paper en arXiv (2609.33439), la release v0.2.3 del repo y un technical report en PDF, todo con fecha del mismo día. El 30-sep el paper entró en los daily papers de Hugging Face y las métricas despegaron: el repo pasó de 4.090 stars el 30-sep a 4.970 a 1-oct-2026, y los upvotes de 283 a 451 en el mismo intervalo. Es atención, no madurez: el propio repo avisa que es pre-alpha.

Por qué merece una pieza más allá del ruido: la orquestación multi-agente ya la tenemos cubierta por patrones, y Raven, vistas por fuera, es un orchestrator-worker más con memoria persistente. Lo que la hace distinta es una idea concreta —que el harness de cada subagente no sea fijo, sino un artefacto que otro componente reescribe en runtime— y el empaquetado de la auto-mejora como producto, no como paper. Las dos cosas están en el repo; la pregunta es hasta dónde llega la evidencia de que funcionan.

Qué es Raven por dentro

Raven se describe como “the harness of harnesses, built for recursive self-improvement (RSI)”. Un harness, para quien llega de las piezas de RSI, es el código que envuelve al modelo: prompts, herramientas, bucle de agente, política de contexto. Raven propone orquestar harnesses, no modelos.

La arquitectura verificada en el README:

  • Un Host Agent que descompone el objetivo, empareja subtareas con agentes especializados, coordina dependencias de ejecución en un DAG e integra resultados.
  • 4 agentes built-in: Raven-Research, Raven-Code, Raven-Design y Raven-Oncall (investigación, coding, diseño visual y automatización desatendida).
  • El bucle de agente partido en 4 módulos: Memory (qué ve un turno), Planning (cómo aborda el trabajo), Capability (qué herramientas expone cada iteración) y Action (qué hace y cómo lo juzga antes de ejecutarlo).
  • EverOS como memoria persistente entre sesiones: “Raven carries memory and context across sessions”.
  • SkillForge para recuperar procedimientos reutilizables de librerías locales, de EverOS y del catálogo de SkillHub: “114,190 skills”. La existencia del catálogo es verificable; su calidad, no la hemos evaluado y el README no da criterios.

La cadencia de releases es rápida (v0.2.3 el 27-sep, con v0.2.0 apenas cuatro días antes) y el aviso de estabilidad es explícito: “Raven is pre-alpha. Interfaces and configuration may change quickly.”

¿Orchestrator-worker con otro nombre?

Descomponer, emparejar, coordinar, integrar: es el patrón orchestrator-worker que ya describimos en las arquitecturas multi-agente, con el roster de agentes como novedad práctica. Si Raven solo hiciera eso, no merecería artículo.

Hay dos diferencias reales. La primera es la memoria: EverOS no es un historial de chat, es infraestructura transversal del ecosistema, y el diseño es memory-first. La segunda es la mutabilidad del harness, que tratamos en la siguiente sección.

Y está el elemento formalmente nuevo del paper, que casi toda la cobertura está ignorando: una teoría de composición. Del abstract: “Our theory establishes sufficient conditions for such composition to expand reliable task coverage beyond that of the available individual agents under a shared resource budget” — condiciones suficientes para que componer agentes amplíe la cobertura de tareas fiables por encima de la de los agentes individuales, con presupuesto compartido. Es la parte con más valor a largo plazo y la menos demostrada: la validación empírica del paper son benchmarks del propio vendor, no resultados independientes. La arquitectura de producción con la que conviene contrastarlo sigue siendo esta.

Auto-mejora: lo que hay en el repo y lo que dice el vendor

El Curator reescribe los cuatro asientos del bucle. No cambia solo prompts: según el README puede sustituir herramientas, skills y “small piece[s] of judgement code” — juicio ejecutable, no texto. Dos salvaguardas declaradas: nada se instala sin pasar verificación antes, y las señales de cada ronda le llegan normalmente con la respuesta de referencia eliminada, para limitar cuánto se expone el resultado. El propio README lo marca como experimental: va con el repositorio, no con el paquete instalado. Lo primero que construye es una Persona: un asistente con rol principal y especialistas extraídos de tus agentes.

El Evolver es otra cosa: una herramienta separada que consume Raven como librería y evalúa cambios candidatos de harness contra benchmarks. Desarrolla a los agentes desde fuera, no corre dentro de ellos.

Esto es, exactamente, el patrón que documentamos en la pieza de RSI de agentes: búsqueda evolutiva sobre el código del harness, modelos congelados y verificación empírica como sustituto de la prueba formal. Lo que cambia es el empaquetado: de paper de laboratorio a producto instalable. El packaging no cambia la definición honesta: lo que hay demostrado son bucles de experimentación automatizada con criterios de evaluación fijados por humanos — el README mismo dice que el sistema recibe “a task and evaluation criteria it cannot modify”.

Las cifras que circularon con el lanzamiento son todas del vendor, y así hay que leerlas:

DemoCifra (según EverMind)Estado
nanochat pre-training172 runs en 7 rondas sin crash, val_bpb −5,8% con presupuesto de 20 min y 1 GPUClaim del vendor
Simulación dam-break (CFD)overshoot reducido 3 órdenes de magnitudClaim del vendor
Búsqueda de carga límite (FEA)bisección hasta 3,125 kN en 8 rondasClaim del vendor
THRESHOLD (videojuego)shooter jugable en Godot 4, ~4 días autónomos, 42 rondasClaim del vendor (showcase)

Ninguna es reproducible hoy desde el repo público: los resultados viven en imágenes del README y en un PDF autopublicado sin revisión por pares.

Tus agentes, dentro del suyo

La parte más utilizable sin adoptar el ecosistema entero: “Raven can connect to and orchestrate agents via ACP, CLI, or OpenAI-compatible APIs, with presets for 13 third-party agents”. La lista del README: Claude Code, Codex, OpenCode, Hermes Agent, OpenClaw, MiroThinker, GitHub Copilot, Qwen Code, CodeBuddy, Qoder, Grok Build, Kimi Code y Pi.

Un detalle que dice mucho del juego a largo plazo: EverMind mantiene plugins de memoria para varios de esos mismos agentes (OpenClaw, Hermes Agent, DeepSeek Harness, Dify). El roster unificado es la puerta de entrada; el recadero es su capa de memoria. Para quien ya corre agentes locales de coding, la idea de un roster común vía ACP es de las más interesantes de vigilar este trimestre.

Verificado vs claim

ClaimEstado
Existe: Apache-2.0, Python, v0.2.3 (27-sep-2026)Verificado (GitHub API, 1-oct-2026)
13 presets de terceros vía ACP/CLI/API OpenAI-compatibleVerbatim del README; sin prueba práctica
Catálogo SkillHub de 114.190 skillsVerbatim del README; calidad sin evaluar
Host Agent + 4 built-in, bucle de 4 módulos, Curator/Evolver, EverOSVerificado en README; efectividad sin medir
Teoría de composición (condiciones suficientes)En el abstract del paper; sin validación independiente
SOTA en MAOB, SWE-bench, PresentBench, DataAgentBenchClaim del vendor (imágenes autopublicadas)
nanochat: 172 runs, val_bpb −5,8%Claim del vendor (README/tech report)
THRESHOLD: Godot 4 en 4 días, 42 rondasClaim del vendor (showcase)

Sobre el MAOB (Multi-Agent Orchestration Benchmark): las métricas que anuncian —Node F1, Edge F1, Partial Order Accuracy, Exact Match Rate— están en el texto alternativo de las imágenes del README, junto a un “Raven-Code with Opus-5 achieves 0.8762 Pass@1” en DataAgentBench. No hay tablas en texto, ni datasets públicos, ni protocolo reproducible. Eso no significa que sea falso; significa que hoy es incrustable en una decisión de compra.

Cuándo te interesa y cuándo no

Te interesa si investigas orquestación o evolución de harnesses, si quieres leer la teoría de composición del paper con espíritu crítico, o si corres varios agentes de coding y quieres ver cómo un tercero intenta el roster unificado vía ACP.

No te interesa (todavía) si buscas algo para producción: es pre-alpha declarado, las interfaces cambian rápido y todo el ecosistema es de un solo vendor. Y una advertencia práctica: el instalador sugerido es un curl | bash y un orquestador con acceso a las claves de tus agentes es superficie de riesgo seria; si tocas el repo, el camino Docker con nada en el host salvo Git es el mínimo. Para elegir herramientas de agentes hoy, la comparativa de plataformas sigue siendo el punto de partida — Raven no está en ninguna comparativa seria aún, y no debería estarlo hasta que alguien externo reproduzca un benchmark suyo.

Metodología

Fecha de consulta: 1-oct-2026. Fuentes: abstract del paper en arXiv (verificado verbatim), README de main vía raw.githubusercontent, GitHub API (stars, forks, issues, licencia, releases, fecha de push), API de Hugging Face (upvotes, entrada en daily papers) y repos oficiales del ecosistema EverMind enlazados desde el README. No instalamos Raven, no ejecutamos sus benchmarks ni evaluamos el catálogo de SkillHub; toda cifra de rendimiento se etiqueta como claim del vendor. Las métricas de adopción llevan fecha de consulta porque se mueven en horas.

Conclusión

Raven es el intento más explícito hasta ahora de convertir el bucle RSI de laboratorio en producto de orquestación. La base es un patrón conocido, el giro real —harnesses mutables en runtime con verificación antes de instalar— existe como código experimental, y la teoría de composición del paper es la parte que merece lectura atenta. La distancia entre el README y la evidencia independiente es, por ahora, la distancia completa: cada benchmark es una imagen del vendor. Yo lo dejaría en watchlist, esperaría reproducciones externas del MAOB y probaría el roster de terceros en contenedor cuando la pre-alpha asiente. Nada de producción con esto.


Fuentes: arXiv 2609.33439 · repo EverMind-AI/Raven · technical report v1 · paper en Hugging Face · documentación oficial

Cargando comentarios...