Nemotron-Labs-Diffusion: cuando tu modelo elige cómo decodificar — AR, difusión o self-speculation
TL;DR
- NVIDIA publicó Nemotron-Labs-Diffusion (arXiv 2607.05722, 7-jul-2026): el primer modelo de pesos abiertos que unifica decodificación autorregresiva (AR), difusión y self-speculation en una sola arquitectura; cambiar de modo solo altera el patrón de atención.
- Los números son de los autores: 6x más tokens por forward que Qwen3-8B con precisión comparable y 4x de throughput en SPEED-Bench con SGLang sobre una GB200. Sin medición de terceros, todavía.
- No es un paper aislado: entre julio y septiembre de 2026 han aparecido tres trabajos más con difusión como drafter especulativo (DiffuSpec, DFlow, Flash-dLLM). La idea ya es una línea con varios equipos atacándola.
- Ojo con las comparaciones: los cuatro usan métricas distintas (tokens por forward, wall-clock, acceptance length, speedup sobre otro acelerador) y ninguna es comparable con las demás. Es la trampa habitual de las oleadas de benchmarks.
- Familia completa en Hugging Face (3B/8B/14B, base, instruct y visión) con guía de despliegue SGLang. “En producción” significa pesos servibles con stack estándar: no hay clientes citados ni auditorías externas.
El cuello de botella: decodificar token a token desaprovecha la GPU
La decodificación autorregresiva genera un token por pasada: en batch 1 — un usuario, un chat — cada forward recorre los pesos completos para producir un único token, y la GPU pasa buena parte del tiempo atada al ancho de banda de memoria, no al cómputo. Por eso un 8B para un solo usuario rara vez satura nada.
La difusión de lenguaje ataca ese límite por otra vía: en lugar de un token, produce bloques en paralelo refinándolos en varios pasos. Promesa: throughput. Precio histórico: calidad algo por detrás de la AR, latencia variable y sobrecoste de muestreo. Los dLLM puros — Mercury de Inception Labs, con 1.107 tok/s como claim del vendor sin validación de terceros — demuestran que la vía funciona, con matices; contexto de mercado en nuestra tabla de julio.
Lo interesante de 2026 no es “AR contra difusión”, sino la vía media: la difusión como drafter dentro de la decodificación especulativa. El patrón drafter/verificador no es nuevo — lo hemos descrito entre modelos distintos —, pero ahora drafter y verificador viven en el mismo modelo.
Una arquitectura, tres modos: en qué consiste el truco
Nemotron-Labs-Diffusion se entrena con un objetivo conjunto AR + difusión. Según los autores son complementarios: la difusión mejora la planificación hacia adelante y la AR aporta los priors lingüísticos que evitan textos incoherentes. El resultado es un único juego de pesos con tres modos:
- AR puro. Token a token. El modo de latencia mínima en batch 1.
- Difusión pura. Bloques en paralelo. El modo de throughput, cuando te importa el caudal agregado más que el tiempo hasta el primer token.
- Self-speculation. La difusión redacta un bloque de candidatos y la AR los verifica token a token: los aceptados son varios tokens cobrados por forward, los rechazados se descartan. Como el verificador es AR, la salida mantiene su fidelidad: la vía lossless de las tres.
El detalle relevante: cambiar de modo solo altera el patrón de atención. Para serving, eso es un despliegue y varias políticas de decodificación según la carga — el mismo razonamiento con el que eliges modelo según la petición, pero dentro de un solo modelo.
Y el drafter no es caro: un LoRA de rank 128 con unos 36 millones de parámetros (~0,4% del modelo), sobre un preentrenamiento de 1,3 billones de tokens más SFT de 45.000 millones. En self-speculation reportan mayor acceptance rate y mejor eficiencia en dispositivo real que la multi-token prediction clásica (MTP), que requiere entrenar cabezas extra.
Los números, con letra pequeña
Ninguna fila de la tabla la ha replicado un tercero; la columna “qué mide realmente” es la importante:
| Dato | Qué mide realmente | Quién lo midió | Hardware |
|---|---|---|---|
| 6x tokens por forward vs Qwen3-8B, precisión comparable | Tokens por pasada del modelo, no latencia ni tok/s | NVIDIA (abstract; Tab. 5 del paper: 5,99x self-spec linear con LoRA, 6,4x cuadrático) | No detallado |
| 4x throughput | Tok/s agregados en SPEED-Bench, servido con SGLang | Los autores | GB200 (Blackwell de gama alta) |
| +0,86% (modo AR) y +0,43% (modo difusión) de precisión media vs Qwen3-8B | Media en los benchmarks del paper | Los autores (Tab. 5) | — |
| Hasta +76,5% de tokens por forward | Techo teórico (“speed-of-light”) con sampler óptimo frente al propio modo self-speculation; no alcanzado | Análisis de los autores | — |
La familia cubre 3B, 8B y 14B en variantes base, instruct y visión: siete modelos en Hugging Face (referencia: nvidia/Nemotron-Labs-Diffusion-8B), repo público en NVlabs y guía de despliegue SGLang para DGX Spark y Blackwell.
Los tres modos como decisión de serving
Traducido a infraestructura, cada modo responde a una pregunta distinta:
- ¿Latencia? AR puro. Un token por forward es lo más rápido para el primer byte de una respuesta interactiva.
- ¿Caudal? Difusión pura. Batch alto, resúmenes, clasificación masiva: donde el usuario no espera token a token.
- ¿Caudal sin perder fidelidad? Self-speculation. La verificación AR evita el peaje de calidad del muestreo por bloques, a cambio de pagar los drafts rechazados.
Esa tercera vía es la apuesta realmente nueva. MTP y el spec decoding clásico llevan años demostrando el mecanismo; lo nuevo aquí es que el drafter no es un modelo aparte que sincronizar, sino el mismo modelo con otra atención y un adapter de 36 millones de parámetros. Menos piezas que versionar, menos drift entre drafter y verificador.
La ola paralela: cuatro equipos, dos meses, misma idea
El paper de NVIDIA no aparece solo. En una ventana de dos meses (no de una semana, que es como se cuenta a veces) han convergido cuatro trabajos que usan difusión para acelerar decodificación:
| Trabajo | Fecha | Claim | Qué mide realmente |
|---|---|---|---|
| DiffuSpec (ACL 2026 Findings) | oct-2025 | Hasta 3x wall-clock; media 3,08x con Dream-7B como drafter | Speedup de un drafter de difusión externo, no self-speculation |
| DFlow | 6-sep-2026 | +10,4% / +13,2% / +13,4% de acceptance length sobre DFlash (Qwen3-1.7B/4B/8B, greedy) | Mejora relativa sobre otro método especulativo, no speedup frente a un baseline AR |
| Flash-dLLM | 22-sep-2026 | 5,1x (GSM8K) y 11,0x (HumanEval) sobre Elastic-Cache; KV caching I/O-aware, training-free | Speedup frente a otro acelerador de dLLM, no frente a un baseline AR |
Que cuatro equipos independientes ataquen el mismo cuello de botella en dos meses dice más que cualquier cifra individual. Pero ojo: cada paper elige el baseline que mejor le conviene. Ninguno compara contra el mismo sistema con la misma métrica; la tabla no sirve para proclamar un ganador, sirve para constatar que la línea existe.
Lo que falta: replicación, hardware y un techo que nadie ha tocado
Tres cosas me impiden tratar estos números como hechos establecidos:
- Cero replicación de terceros. El 6x y el 4x los midieron los autores, con su stack y sus prompts. Sin mediciones independientes ni clientes de producción citados, la historia aconseja esperar: los 1.107 tok/s de Mercury siguen siendo claim propio meses después.
- El throughput está medido en una GB200. Tu A100, tu L40S o tu 4090 no son una GB200, y el beneficio de la decodificación por bloques depende del ratio cómputo/ancho de banda de cada GPU. La guía de SGLang existe; los números en hardware no-Blackwell, no.
- El +76,5% es un techo, no un resultado. Es el speed-of-light: lo que daría un sampler óptimo frente al modo self-speculation, lejos de alcanzarse y comparado contra un modo del propio modelo, no contra AR. Si alguien te lo cita como ganancia real, ya sabes qué preguntar.
Si lo pruebas: qué mirar en tu carga
Los benchmarks del paper no son tu carga. Si despliegas la familia con SGLang, tres métricas deciden si la tesis se sostiene contigo:
- Tokens por forward (TPF) con tus secuencias reales: en respuestas cortas, el sobrecoste de redactar y verificar bloques puede comerse la ganancia.
- Acceptance length en self-speculation. Si el drafter acierta poco — código muy determinista, JSON estricto — pagas los drafts rechazados sin cobrar nada. Depende del dominio más que del modelo.
- Tok/s sostenido y latencia p99 con tu concurrencia real, en tu GPU. No el mejor caso del benchmark: el p99 es el que dispara las alertas.
Metodología
Verificación de fuentes primarias el 24-sep-2026: abstract y HTML del paper (arXiv 2607.05722), repo de GitHub de NVlabs, colección de Hugging Face y blog de NVIDIA. Ola paralela: HTML de DFlow (arXiv 2609.06498), Flash-dLLM (arXiv 2609.26796) y página de DiffuSpec en ACL Anthology. No he ejecutado el modelo: no hay mediciones propias, y cada cifra lleva anotado quién la midió, en qué hardware y qué métrica representa. Las fechas de la ola van del 7-jul al 22-sep de 2026.
Conclusión: para qué sí y para qué no
No lo usaría todavía para serving con SLA si tu decisión depende de que alguien ajeno a NVIDIA haya validado el rendimiento — eso no existe hoy —, ni si tu parque es pre-Blackwell y el throughput es lo crítico: el 4x vive en una GB200.
Para explorar, sí: pesos abiertos, guía de SGLang, un adapter de 36 millones de parámetros y tres modos en un solo despliegue. Es el candidato más completo para probar decodificación especulativa con difusión sin montar un circo de dos modelos. Y aunque no toques el modelo, apunta una dirección: el serving se parece cada vez menos a un modelo fijado en piedra y cada vez más a un router que elige el patrón de decodificación según la carga. La próxima vez que alguien te venda un dLLM solo con tok/s, pregunta qué mide esa cifra. Después de esta ola de cuatro papers, no hay excusa para no saberlo.
Fuentes: Nemotron-Labs-Diffusion (arXiv 2607.05722) · Repositorio NVlabs · Blog de NVIDIA en Hugging Face · DiffuSpec (ACL 2026 Findings) · DFlow (arXiv 2609.06498) · Flash-dLLM (arXiv 2609.26796)