GPT Diffusion

HomeBody: GPT Astra orquesta un Unitree G1 sin VLA

2026-09-29 · Devs #agentes#tool-use#orquestacion#arquitectura#llm

Si programas agentes, el bucle te resulta familiar: el modelo elige una herramienta, la invoca con argumentos estructurados y, si la ejecución falla, recibe el motivo del error y replanifica. HomeBody, del The Movement Lab de Stanford, aplica exactamente ese patrón a un Unitree G1: GPT Astra —un VLM de frontera corriendo remoto— orquesta cinco skills motoras para recoger una cocina y recuperar un objeto de un cajón, sin VLA intermedio y sin datos de entrenamiento del entorno.

Lo interesante para quien escribe software de agentes no es el robot, es la arquitectura: una biblioteca de skills con interfaz compartida, reintentos locales que no gastan tokens del modelo y errores que vuelven al LLM como contexto, no como excepción. Lo interesante para el escepticismo es todo lo demás: vídeos acelerados, pausas entre skills por latencia y una única cocina de laboratorio.

TL;DR

  • Verificado (página del proyecto de Stanford, consultada el 2026-09-29): HomeBody permite que “a Unitree G1 guided by GPT Astra to clean up across the room and retrieve a remembered object from an underspecified request, without environment-specific training data or additional policy learning”. El trabajo se hizo en The Movement Lab de Stanford; el primer autor, Gio Huh, es fellow de Caltech.
  • Verificado: el bucle es el de cualquier agente con tools —el VLM elige skill y target mediante un structured tool call, la skill ejecuta con reintentos locales acotados y, si se queda sin margen, devuelve el motivo al modelo para replanificar.
  • El matiz: la cadena “System 2 VLM → System 1 VLA → System 0 controlador” que ha popularizado la robótica aprendida es justo lo que HomeBody sustituye: “HomeBody replaces that chain with a plug-and-play VLM calling a composable skill library”.
  • La letra pequeña: los vídeos de skills van acelerados (etiquetas oficiales de 1,25×, y de 14×→4× en el picking desde cajón; heise llegó a contar 50× en algunos tramos), la latencia de Astra mete pausas entre skills, los servos de los dedos se sobrecalientan y toda la demo vive en una cocina del Stanford Robotics Center.
  • Veredicto: la señal es seria —el patrón agente-tools escala a actuadores reales—, pero a 29-sep-2026 no hay preprint ni código público, y nada de esto generaliza todavía a tu cocina.

Qué es HomeBody y qué sustituye

El diseño dominante en robótica aprendida encadena tres sistemas: un VLM lento que razona la tarea (System 2), un VLA —modelo visión-lenguaje-acción— que traduce a movimientos (System 1) y un controlador de cuerpo entero que sigue las referencias (System 0). Cada eslabón se entrena, cada eslabón puede fallar y la información se degrada en cada salto.

HomeBody elimina el eslabón intermedio. En su lugar, un VLM de frontera llama directamente a una biblioteca de skills motoras ya implementadas: navegación, agarrar, colocar, abrir cajones y agarrar desde cajón. No hay entrenamiento específico del entorno ni política aprendida nueva; lo que hay es memoria espacial —un gemelo digital construido con los datos que el propio robot recogió— y un modelo que compone skills como tu agente compone llamadas a una API.

El “GPT Astra” de la página es el modelo que analizamos hace semanas como agente de computer-use en qué delegar a GPT-6 Astra. Aquí hace de cerebro remoto: recibe vistas en ego, contexto del mapa, estado de la pinza y el resultado de la skill anterior, y decide la siguiente llamada.

El bucle agente, skill a skill

La frase que resume el diseño está en la propia página: el VLM “selects a skill and its target from the current ego view, map context, gripper state, recalled observations and the previous result. It passes this selection through a structured tool call, leaving the skill to plan and execute the motion.” Es decir: el modelo no genera trayectorias ni ángulos de articulación; elige una herramienta y le pasa argumentos tipados.

Cada skill define su contrato:

SkillQué recibe del VLMQué ejecuta por debajo
NavigationPunto 2D y orientación en coordenadas del mapa, en metrosLocalización con Super Odometry y mapa SLAM alineado por ICP
PickingPunto en imagen (normalizado 0–1000) y manoSegmentación SAM 2.1 + tracking SAMURAI, profundidad con Fast-FoundationStereo, grasp analítico, IK con chequeo de colisiones
PlacingMano, target 3D en el frame del torso y distancia de suelteSplines minimum-jerk e IK
Drawer openingEl cajón como target visualAlinear con el tirador, enganchar y caminar hacia atrás
Pick from drawerEl objeto dentro del cajónAlcance dentro del cajón y elevación del objeto

Dos decisiones de diseño merecen apunte. Primera: las skills comparten interfaz de targets y resultados, así que el VLM puede componerlas en despliegue sin reentrenar nada — el equivalente robótico de un esquema de tools bien definido. Segunda: las correcciones finas no pasan por el modelo. El tracking visual corrige la alineación durante la aproximación (“without requiring a new VLM decision for each adjustment”), y si un agarre se cierra al vacío, la skill prueba otro candidato o replanta los pies por su cuenta.

Los reintentos locales son acotados, y esa es la parte que muchos sistemas de agentes aún tienen mal: “These local retries are bounded. When recovery is exhausted or the failure needs a different action, the skill returns the reason to the VLM, which can reposition, choose a new target or change its plan.” El fallo no es una excepción que rompe el bucle; es información estructurada que vuelve al planificador. Es el mismo contrato que deberías exigir a tus tools — lo comentamos en arquitectura de agentes en producción y es la razón por la que envolver APIs reales con esquemas claros, como en el tutorial de MCP, marca la diferencia entre un agente que se recupera y uno que se atasca.

El pipeline que el vídeo no enseña

Antes de que el robot pueda hacer nada, hay un trabajo de preparación que la demo menciona pero que conviene dimensionar:

  • Exploración. El G1 recorre la cocina recogiendo vídeo de iPhone a 0,5×, observaciones de una cámara Intel D435i, escaneos LiDAR con SLAM, poses articulares y waypoints que elige el propio Astra.
  • Real2Sim. Con esos datos, Astra actúa como agente de reconstrucción para levantar un gemelo digital en Isaac Sim. La geometría medida por SLAM acota las dimensiones que el modelo estima por apariencia.
  • Localización compartida. Super Odometry sitúa al robot y el registro ICP alinea su mapa SLAM con la simulación; las observaciones quedan almacenadas en ese frame común, con lo que el robot puede volver a un objeto que salió de su vista.
  • Control. Brazo y mano a 250 Hz con splines minimum-jerk e IK con chequeo de colisiones; las piernas van con AMO preentrenado, cuya política se actualiza cada cinco ticks a 50 Hz.

Todo eso corre en un portátil Razer Blade con RTX 4090; Astra vive en la nube y se comunica por red. El setup es deliberadamente ligero —esa es la parte honesta del proyecto—, pero también significa que el cerebro está a una latencia de red de la mano.

Lo que los vídeos no cuentan

Los clips de skills de la página llevan etiqueta de velocidad: 1,25× en la mayoría, 14×→4× en el picking desde cajón y un “retry” a la vista en el clip de apertura de cajón — señal de que las cosas también fallan ahí. heise fue más allá con la cronometría: “even though the test video runs at 50 times its normal speed in places, the process remains agonizingly slow”. Limpiar una cocina, con este sistema, se mide en pausas de razonamiento tanto como en movimientos.

Las limitaciones declaradas en la propia página son de las más claras que hemos leído en una demo de este tipo: la reconstrucción Real2Sim añade tiempo de setup y costes de API; la duración de la tarea está limitada por alcance, capacidades de manipulación y resistencia del hardware, “including finger-servo overheating during extended operation”; la latencia de razonamiento de Astra introduce pausas entre skills; y el stack local exige una GPU RTX 4090 en portátil.

A eso se suman tres carencias de contexto. La demo entera se hizo en una cocina del Stanford Robotics Center —el propio sistema la explora y construye su mapa antes de actuar—, no un piso con la luz de tu pasillo y las sillas fuera de sitio. Y no hay forma de auditar nada más allá del texto: la página no enlaza preprint —el pill de “Paper” sigue en “coming soon”, sin enlace— y el repo de GitHub que sí enlaza, github.com/Stanford-TML/homebody, aún no contiene código fuente: su README se queda en un “Code coming soon” (29-sep-2026). Y la memoria espacial es del entorno concreto: el robot “recuerda” esa cocina porque la exploró, no porque entienda cocinas.

Qué haría yo

No intentes reproducir nada: no hay código, y un G1 no entra en tu presupuesto de laboratorio. Lee el patrón, que es gratis y se aplica a lo que ya construyes:

  1. Skills con contrato tipado y composables. Targets y resultados con interfaz compartida, como las skills de HomeBody, no funciones ad-hoc que el modelo tiene que adivinar.
  2. Reintentos locales acotados fuera del LLM. La corrección fina no debería costar una llamada al modelo; reserva el modelo para decisiones de plan, no para ajustes de milímetros.
  3. El fallo devuelto como motivo, no como excepción. El valor del bucle está en que el replanificador sepa por qué falló.

Y ajusta expectativas: esto es una demo universitaria con el modelo correcto y el hardware correcto en una habitación preparada. Interesantísima como señal de hacia dónde converge la robótica —menos VLA entrenados a mano, más modelos generales llamando skills—, lejos todavía de que un humanoide te recoja la cocina. Con la latencia actual, te lo haría despacio y con descansos para enfriar los dedos.

Fuentes

  • Página del proyecto HomeBody (The Movement Lab, Stanford; consultada el 2026-09-28 y re-verificada el 2026-09-29). Autores: Gio Huh, Cayden Gu, Takara E. Truong, C. Karen Liu y Guy Tevet, 2026.
  • heise: “GPT Astra with robot body tidies kitchen autonomously” (Carolin Riethmüller; consultado el 2026-09-29).
  • Hilo de r/singularity que originó la señal (vía research; métricas del hilo no verificadas de forma independiente). Sin preprint ni código público del proyecto a fecha de consulta.
Cargando comentarios...