Nemotron Labs Competitive Coding 550B: la receta del oro en IOI 2026
TL;DR
- Lo nuevo no es un modelo nuevo: NVIDIA partió de su Nemotron-3-Ultra 550B-A55B y le aplicó un SFT de una época (477.642 trazas destiladas de GLM-5.2 sobre 22.000 problemas de 16 familias de concursos), sin RL adicional. La inteligencia extra vive en GenCorrect, una estrategia de test-time compute con feedback del evaluador.
- El titular — 535,4/600 en IOI 2026, por encima del umbral de oro (361,12) y del mejor humano (498,27) — es un dato del vendor: una única prueba en vivo, fuera del ranking oficial de la IOI, según reconoce el propio paper.
- Los pesos son abiertos (openmdw-1.1), pero solo en NVFP4 y solo para Blackwell: el despliegue de referencia son 4×GB300 con vLLM. En tu 4090 no entra ni de broma (unos 275 GB solo de pesos, cálculo propio).
- Lo replicable es la receta, no el checkpoint: teacher con RL verificable + destilación SFT corta + presupuesto fijo de submissions con feedback por subtareas. El modelo pequeño del paper (Nano-CC, 30B-A3B) no está publicado en Hugging Face a fecha de hoy.
Verificado vs claim
| Dato | Estado | Fuente |
|---|---|---|
| SFT de 1 época sobre 477.642 trazas destiladas de GLM-5.2; 22.000 problemas, 16 familias de concursos | Verificado (model card) | Model card HF |
| Inicializado del checkpoint RLVR-teacher de Nemotron-3-Ultra-550B-A55B; “no additional reinforcement learning” | Verificado (model card, verbatim) | Model card HF |
| Formato de salida estructurado (explicación → confianza → C++) y contexto de 262.144 tokens | Verificado (model card) | Model card HF |
| Pesos abiertos openmdw-1.1; único checkpoint público en NVFP4; hardware soportado: Blackwell | Verificado (model card + API HF) | Model card HF y API HF |
| 535,4/600 en IOI 2026 (oro 361,12; mejor humano 498,27) | Claim del vendor: run único prospectivo, fuera del ranking oficial | Paper, arXiv 2609.02849 |
| IOI 2025: 502/600 con GenCorrect; ICPC 2025: 9,6/12 problemas; LiveCodeBench Pro: 74,5% pass@1 | Claims del vendor (“all results are from the source paper”) | Model card HF, datos del paper |
| 736,8 tok/s/GPU en NVFP4 (52,8% Score@1) vs 199,1 en BF16 (59,4%) | Claim del vendor: trade-off deliberado de cuantización | Model card HF (sección Deployment) |
La noticia real: no es de esta semana ni es un modelo nuevo
El checkpoint está en Hugging Face desde el 3 de septiembre de 2026 (v1.0 GA según la model card; el registro de la API lo fecha el 4 de septiembre). El hilo de r/LocalLLaMA que circuló el 28 de septiembre es el eco, no la noticia. Esto es una pieza de referencia: si llegas aquí por un titular reciente, lo que lees tiene ya casi un mes.
Tampoco es el estreno de una familia. La línea Nemotron Labs existe al menos desde enero de 2026 — el Nemotron-Labs-Diffusion-8B-Base tiene fecha de creación del 14 de enero en la API de Hugging Face — y desde entonces ha acumulado variantes de difusión, audio y retrieval. Ya analizamos la rama de decodificación híbrida; esta es otra rama del mismo árbol, la de especialización por dominio.
Y el dominio aquí es estrecho. La model card lo advierte en la primera línea: es un modelo especialista de competitive programming, “not a general-purpose chat or agent model”. No es un asistente de código para tu día a día; es una máquina de resolver problemas algorítmicos con tests ocultos y presupuesto de envíos limitado.
La receta: una época de SFT sobre un modelo que ya sabía
La base no es cualquier checkpoint. NVIDIA parte del RLVR-teacher de Nemotron-3-Ultra-550B-A55B — el modelo que ya pasó por reinforcement learning con recompensa verificable — y encima hace exactamente una época de SFT. Textual de la model card: “SFT only; no additional reinforcement learning or distillation stage was applied to this checkpoint”. La apuesta es que el trabajo difícil ya lo hizo el RL previo, y que el especialista se consigue imitando, no reentrenando.
Con qué imita: 477.642 trazas de razonamiento sintéticas generadas por GLM-5.2 — un modelo de un competidor, dato que la model card confirma textualmente — sobre 22.000 problemas de 16 familias regionales e internacionales de concursos. La mezcla asigna más generaciones a los problemas difíciles e incluye trazas de auto-mejora donde el teacher refina su propia solución. Entrenamiento: 128 GPUs GB300 de 288 GB, una época, y fuera.
El detalle que dice más de lo que parece: eligieron GLM-5.2 frente a una variante del mismo experimento entrenada con DeepSeek-V4-Flash porque el resultado tenía “mayor precisión y generaciones aproximadamente un 30% más cortas”. En destilación, la longitud del teacher no es un detalle estético: cada token de traza es coste de entrenamiento, y cada token del alumno es coste de inferencia en el bucle que viene después. La familia GLM ya nos pareció seria candidata open-source para coding; aquí la elige hasta quien podría haber elegido a DeepSeek V4.
El formato de salida está cocinado en el SFT: explicación estructurada → confianza → respuesta, con el razonamiento paso a paso antes del C++ final. Y el contexto llega a 262.144 tokens, lo que permite engullir enunciados completos de concurso con sus restricciones.
GenCorrect: el oro se decide en el bucle de inferencia
GenCorrect es la mitad del resultado y la parte menos citada. El mecanismo, según la model card: generar candidatos diversos, seleccionar un subconjunto representativo mediante clustering de diversidad por token-shingles, someterlos al evaluador del concurso y condicionar las siguientes rondas con las puntuaciones por subtarea acumuladas y soluciones de referencia complementarias. Todo dentro de un presupuesto fijo de envíos, como un concursante humano.
Que el bucle importa tanto como el modelo lo muestra el propio paper con su variante de 30B: el Nano-CC pasa de 130 puntos en IOI 2025 a 291 tras el post-training, y a 468 con GenCorrect — por encima del umbral de oro de ese año (438,3), según el abstract. Un 30B no cruza el oro por conocer más algoritmos; lo cruza por iterar mejor con el feedback del evaluador.
La cuantización NVFP4 se entiende dentro de esta lógica. El run en vivo sirvió el modelo cuantizado a 736,8 tok/s por GPU con un 52,8% de Score@1 en IOI 2025, frente a 199,1 tok/s por GPU y 59,4% del baseline BF16 sin cuantizar: se aceptó perder puntos de precisión a cambio de triplicar el caudal, porque GenCorrect necesita lotes grandes de candidatos dentro de la ventana de tiempo del concurso. La cuantización no era una decisión de coste; era una decisión de reloj.
Por qué no lo vas a correr en local
“Open weights, training data, and recipes” es el eslogan de toda la familia Nemotron, pero conviene leerlo con lupa en este caso concreto:
- Un solo checkpoint público, y es NVFP4. No hay versión BF16 de esta variante. La búsqueda en la API de Hugging Face (29-sep-2026) devuelve exactamente un repo para la variante Competitive-Coding, con 34 descargas.
- El dataset SFT no está publicado. La model card enlaza el paper y las recetas de inferencia/evaluación en NeMo Skills, pero ningún repo de las 477.642 trazas. “Training data abierto” aquí es herencia del boilerplate familiar, no un enlace que puedas pulsar.
- Solo Blackwell, solo Linux, solo vLLM. La model card lo limita explícitamente a la microarquitectura NVIDIA Blackwell. El despliegue de referencia es un nodo de 4×GB300 con tensor parallel 4, contenedor
vllm/vllm-openai:v0.22.0, KV cache en FP8, prefix caching desactivado, MTP a 5 y una batería de variables de entorno afinadas para los kernels de MoE. - El tamaño no negocia. 550B de parámetros totales en NVFP4 son unos 275 GB solo de pesos (cálculo propio: 0,5 bytes por parámetro), antes del KV cache que exige servir contexto de 262K. Es hardware de alquiler por horas, no de escritorio.
Y la escapatoria que el propio paper insinúa — el Nano-CC de 30B-A3B, que con GenCorrect también superó el oro en IOI 2025 — no está publicada: busqué “Nano-CC” en Hugging Face el 29-sep-2026 y no hay ningún checkpoint. Si querías probar la receta en casa, hoy no hay modelo pequeño que bajar.
Lo que sí es replicable
El checkpoint no, la forma sí. El pipeline del paper es una receta con tres pasos que no requieren 128 GB300 para copiarse conceptualmente:
- Parte de un modelo que ya razona con recompensa verificable (el RLVR-teacher), no de un base pelado.
- Destila corto: una época de SFT sobre trazas de un teacher fuerte, con más datos donde el dominio es más difícil. Sin RL adicional en el especialista.
- Mueve la inteligencia al bucle de inferencia: candidatos diversos, poda por diversidad, feedback real del verificador, iteración con presupuesto fijo.
Cualquier dominio con verificador automático — tests unitarios, compiladores, validadores de esquemas, restas de cash-flow — admite esa misma forma de bucle. Es el mismo patrón que describimos al hablar de validación entre modelos, pero con el feedback viniendo del evaluador del problema y no de otro LLM.
Lo incómodo: mientras NVIDIA no publique el Nano-CC, replicar la receta con pesos propios significa repetir el entrenamiento completo — modelo base con RLVR, teacher, destilación —, que es exactamente la parte que nadie con una GPU de consumo puede pagarse.
Metodología
Verificación de fuentes primarias el 29-sep-2026: model card leída completa vía README raw de Hugging Face, abstract del paper (arXiv 2609.02849) cotejado verbatim, y API de Hugging Face para las fechas de la línea Nemotron Labs y para confirmar que solo existe un checkpoint público de esta variante (búsquedas “Competitive” y “Nano-CC”). No he ejecutado el modelo: no hay hardware Blackwell aquí, y cada cifra del vendor va atribuida como tal. El estado de publicación del Nano-CC es el del 29-sep-2026; si NVIDIA lo publica, ese punto queda obsoleto.
Qué haría yo
Si llegaste por el titular del oro: dilo entero cuando lo cites — “según NVIDIA, en un único run fuera del ranking oficial de la IOI”. El 535,4 es un resultado de laboratorio con reloj de concurso, y ni siquiera el modelo es nuevo: es la receta la que se publicó.
Si montas pipelines de código con verificador automático: cópiale la forma, no el modelo. Diversidad controlada de candidatos, feedback del evaluador inyectado al contexto y presupuesto fijo de intentos es algo que puedes probar esta semana con cualquier modelo que ya tengas en el router.
Si esperabas bajarlo a local: no hay nada que bajar que no sea un nodo de GB300. Vigila el Nano-CC — si NVIDIA publica ese 30B, la receta completa se vuelve probablemente la pieza open-weights más interesante del año para probar test-time compute en casa.
Fuentes: Model card de NVIDIA-Nemotron-Labs-3-Competitive-Coding-550B-A55B-NVFP4 · Post-Training Language Models for Gold-Medal Performance in Coding Competitions (arXiv 2609.02849) · API de Hugging Face (fechas y repos) · NeMo Skills — recetas de inferencia y evaluación · Hilo de r/LocalLLaMA (eco comunitario, no fuente)