Muse Glimmer 30B de Meta: análisis del modelo agéntico open-weight que corre en tu GPU
Muse Glimmer 30B: el primer modelo de Meta con licencia Apache 2.0
TL;DR
Meta lanzó Muse Glimmer el 10 de agosto de 2026. Es un modelo denso de 30B parámetros, optimizado para agentes locales, publicado bajo Apache 2.0 (no la licencia restrictiva de Llama). En benchmarks agénticos propios de Meta, gana a Gemma 4 31B y Qwen 3.6 27B en casi todas las categorías. En evaluación independiente de Artificial Analysis, la historia es más matizada: empata en inteligencia general con Kimi K2.5 Reasoning (35 vs 36 en el Intelligence Index), pero se queda atrás en tareas de conocimiento agéntico (953 Elo en GDPval-AA v2, por debajo del baseline humano de 1000) y tiene una tasa de alucinación del 82% en AA-Omniscience, frente al 49% de Qwen 3.6.
La pregunta real no es si Muse Glimmer es el mejor modelo de 30B. Es si necesitas un modelo de 30B que vive en tu máquina o uno más pequeño que llama a la nube. Depende de tu caso de uso.
Contexto: por qué importa este lanzamiento
Meta no había publicado pesos abiertos desde Llama 4 (que fue recibido con tibieza). La línea Muse ha ido por dos caminos: modelos cerrados hosted (Muse Spark 1.1 y 1.2) y destilaciones open-weight para hardware local. Muse Glimmer es la segunda entrega de este último grupo.
Lo que cambia respecto a Llama 4 es la licencia. Apache 2.0 significa que puedes usarlo comercialmente, modificarlo y redistribuirlo sin restricciones. La licencia Llama tenía cláusulas que limitaban uso si tu producto tenía más de 700 millones de usuarios mensuales y prohibían entrenar otros modelos con los outputs. Apache 2.0 no tiene nada de eso.
Mark Zuckerberg publicó un manifiesto de 6.500 palabras el mismo día del lanzamiento, enmarcando el open-source como cuestión de competitividad americana frente a laboratorios chinos. Alexandr Wang, Chief AI Officer de Meta, repitió el compromiso en su propio canal. Zuckerberg también dijo que Meta publicará “pronto” los pesos de Muse Spark 1.2, el modelo detrás del coding agent Muse Code. No dio fecha.
Arquitectura y especificaciones
| Parámetro | Valor |
|---|---|
| Parámetros totales | 30B (densos, no MoE) |
| Contexto | 128K tokens (extensible) |
| Multimodal | Sí, encoder de visión de ~1.8B (74% MMMU-Pro) |
| Licencia | Apache 2.0 |
| Memoria BF16 | ~60 GB |
| Memoria 4-bit | ~18 GB |
| Atención | Híbrida (3 capas sliding-window por cada capa global) |
La elección de arquitectura densa tiene consecuencias prácticas. Los modelos MoE (como Gemma 4 y Qwen 3.6 en sus variantes) activan menos parámetros por token, lo que reduce el cuello de botella de ancho de banda en memoria unificada. Muse Glimmer, al ser denso, decodifica más lento en hardware como Apple Silicon, donde el ancho de banda ya es menos restrictivo en el caso base.
El mecanismo de atención híbrida (sliding window intercalado con atención global) mantiene el KV cache en ~1.8 GB para 128K tokens, lo que hace viable correr el modelo a contexto completo en una sola GPU de 24 GB.
Benchmarks: lo que dicen los números
Benchmarks propios de Meta
Meta comparó Muse Glimmer con Gemma 4 31B y Qwen 3.6 27B. Los datos provienen de la tabla oficial publicada por Meta — verifícalos contra tu propio workload antes de tomar decisiones de producción.
| Benchmark | Muse Glimmer | Gemma 4 31B | Qwen 3.6 27B |
|---|---|---|---|
| MCP-Atlas | 75.5 | 54.2 | 62.5 |
| DeepSearch QA | 74.6 | 61.7 | 71.1 |
| SWE-Bench Verified | 76.0 | — | 77.2 |
| SWE-Bench Pro | 51.2 | 36.9 | — |
| TerminalBench 2.1 | 51.7 | — | 60.7 |
| OSWorld-Verified | 65.9 | — | 75.6 |
| WildClawBench | 47.6 | 37.6 | 43.2 |
| GAIA2 | 43.3 | 36.4 | 40.0 |
| AIME 2026 | 94.7 | — | — |
| SciCode | 43.6 | — | — |
El patrón es claro: Muse Glimmer domina en benchmarks de razonamiento agéntico multi-turno (MCP-Atlas, DeepSearch QA, GAIA2). Qwen 3.6 27B gana en tareas que requieren control de escritorio y trabajo sostenido en terminal (TerminalBench, OSWorld). La diferencia en SWE-Bench Verified es marginal (76.0 vs 77.2).
Evaluación independiente (Artificial Analysis)
Artificial Analysis evaluó el modelo de forma independiente y le asignó 35 en el Intelligence Index. Esto lo coloca:
- 5 puntos por encima de Gemma 4 31B Reasoning (30)
- A la par con Kimi K2.5 Reasoning (36), que tiene 33x más parámetros totales
- 3 puntos por debajo de Qwen 3.6 27B Reasoning (38)
Los puntos débiles que detectaron:
- GDPval-AA v2: 953 Elo. Por debajo del baseline humano (1000). Qwen 3.6 27B puntúa 1141. Esto mide rendimiento en tareas de conocimiento realista dentro de un loop agéntico.
- AA-Omniscience: -33. Tasa de alucinación del 82%, frente al 49% de Qwen 3.6 y 34% de Gemini 3.5 Flash-Lite. Esto significa que cuando el modelo no sabe algo, inventa en lugar de admitirlo, con más frecuencia que sus competidores directos.
- Tau3-Banking: 24%. Aquí sí gana: por delante de Gemini 3.5 Flash-Lite (18%) y Qwen 3.6 27B (17%). Es la única categoría agéntica donde lidera claramente en evaluación independiente.
La discrepancia entre los benchmarks de Meta (donde Muse Glimmer domina) y los de Artificial Analysis (donde queda atrás) es notable. No necesariamente indica que Meta cherry-pick. Los benchmarks miden cosas distintas: MCP-Atlas evalúa tool-calling estructurado, GDPval-AA mide trabajo de conocimiento libre. Muse Glimmer es bueno en lo primero y mediocre en lo segundo.
DFlash: la pieza de ingeniería interesante
La decisión de diseño más relevante de Muse Glimmer no es el modelo en sí, sino DFlash, su esquema de speculative decoding.
Speculative decoding no es nuevo. La idea: un modelo pequeño (drafter) genera bloques de tokens, y el modelo grande los verifica en una sola pasada, aceptando lo correcto y corrigiendo lo que no. Lo que hace Meta es afinarlo específicamente para el cuello de botella de ancho de banda en GPUs de consumo.
Los números reales, medidos a través de llama.cpp:
| Hardware | Sin DFlash (tok/s) | Con DFlash (tok/s) | Speedup |
|---|---|---|---|
| RTX 5090 | 74.9 | 233 | 3.1x |
| M5-Max | ~28 | 50 | 1.8x |
| M4-Max | ~25 | 38 | 1.5x |
| AMD 7900XT (Q4_K_XL) | 36 | 60 | 1.7x |
El speedup es sustancial en NVIDIA y modesto en Apple Silicon. La explicación probable: la memoria unificada de Apple ya tiene menos cuello de botella de ancho de banda en el caso base, así que hay menos margen para recuperar.
Un usuario reportó correr Muse Glimmer en un Mac Mini de 32GB vía Ollama. Funcionó, pero lento. La experiencia práctica depende mucho de tu hardware específico.
La distinción open-weight vs open-source
Vale la pena ser preciso aquí. Muse Glimmer es open-weight bajo Apache 2.0, no open-source. La diferencia:
- Open-weight: publicas los pesos entrenados. Cualquiera puede descargarlos y usarlos. No publicas los datos de entrenamiento, ni el código de entrenamiento, ni la receta completa para reproducir el modelo desde cero.
- Open-source: publicas todo lo anterior. El modelo es reproducible de forma independiente.
Varios comentaristas en el hilo de Hacker News cuestionaron el framing de Meta por esta razón. Apache 2.0 es una licencia más permisiva que la de Llama, lo cual es positivo. Pero llamarlo “open source” sin proporcionar datos ni código de entrenamiento es estirar el término.
Cómo correrlo
Muse Glimmer está disponible en Hugging Face como meta-models/Muse-Glimmer-30B. Las integraciones optimizadas para llama.cpp, MLX, ExecuTorch y Ollama llegaron en los días posteriores al lanzamiento.
El template de tool-calling usa tags <atem:function_calls>, <atem:invoke> y <atem:parameter>. Varios desarrolladores notaron que “atem” es “meta” al revés, probablemente para evitar colisiones con tags HTML <meta> reales en datos de entrenamiento o output de agentes.
# Ejemplo con Ollama (cuando esté disponible)
ollama run muse-glimmer:30b
# Con llama.cpp (GGUF quantizado)
# El PR #26841 de llama.cpp se mergeó en horas
./main -m muse-glimmer-30b-Q4_K_XL.gguf -c 131072 -t 8
Casos de uso: dónde encaja y dónde no
Encaja si:
- Necesitas un agente local con tool-calling y no quieres depender de una API en la nube. Muse Glimmer es competitivo en MCP-Atlas y Tau3-Banking.
- Tienes una GPU de 24GB (RTX 5090, RTX 4090) o un Mac con 32GB+ de memoria unificada.
- Tu caso de uso principal es function calling estructurado y razonamiento multi-turno, no trabajo de terminal o control de escritorio.
No encaja si:
- Necesitas el mejor modelo agéntico general. Qwen 3.6 27B puntúa mejor en GDPval-AA, TerminalBench y OSWorld.
- La alucinación es crítica. La tasa del 82% en AA-Omniscience es alta para su clase.
- Tu hardware tiene menos de 20GB disponibles. Incluso cuantizado a 4-bit, necesitas ~18GB solo para el modelo, más memoria para KV cache y el vision encoder.
Qué falta por ver
Zuckerberg dijo que Muse Spark 1.2 (el modelo detrás de Muse Code) se publicará como open-weight “pronto”. Si esto se materializa, sería un cambio significativo: Muse Spark 1.2 es un modelo frontier, no una destilación de 30B. Tendría sentido trackear ese compromiso.
El espacio de modelos de 30B para uso local está más competido que nunca. NVIDIA publicó Nemotron 3.5 Lightning un día después de Muse Glimmer (30B total, 3B activo, MoE, licencia OpenMDW-1.1). Qwen 3.6 27B sigue siendo el leader en parameter-efficiency. Y Gemma 4 31B, aunque queda por detrás en benchmarks agénticos, tiene mejor safety (menor tasa de violaciones en CI Memories, menor attack success rate en Siren AgentDojo).