Workstation Logo
Productos
Labs de IAAgentes OpenAIAgentes ClaudeGrok BotWorkstation CRM (WSL CRM)MarketingTodos los Productos
Soluciones IA
Estaciones de Trabajo IAAI SME PackagesIA PrivadaClústeres GPUIA en el BordeLaboratorio IA EmpresarialIA por Industria
Servicios
Modernización de plataformaIngeniería digitalFundamentos de datos e IAOperaciones autónomasConsultoría de IAAutomatización DevOpsCiberseguridadDesarrollo de softwareCreación de agentesConfiguración MLOps
Sobre Nosotros
SociosHistorias de Clientes
Artículos
Documentación
WSL ProxyRing PromoterWSL VaultJobshoutSysOps 24/7
Blog
ContáctenosLogin
Workstation

Estaciones de trabajo de IA, software multiagente de IA, infraestructura de GPU y soluciones de agentes inteligentes para empresas modernas.

Contáctenos

Soluciones de IA

Estaciones de Trabajo IAAI SME PackagesIA PrivadaClústeres GPUIA en el BordeLaboratorio IA EmpresarialIA por Industria

Productos

Todos los ProductosWSL CRM y ERPMarketingAgentes OpenAIWSL ProxyRing PromoterWSL VaultJobshoutSysOps 24/7

Empresa

Sobre NosotrosPor qué WorkstationSociosHistorias de ClientesPreciosContacto

Recursos

ArtículosDocumentaciónBlogBuscarMapa del Sitio
Oficina Reino Unido
77-79 Marlowes, Hemel Hempstead HP1 1LFCómo llegar: tome la salida 20 de la M25, Outer LondonN.º de empresa: 11641870Lun - Vie: 9:00 - 18:00 GMT
+44 7515 356 146
Oficina Bélgica
Workstation SRL, Rue Vanderkindere 34, 1180 Uccle, BrusselsBE 0751.518.683Lun - Vie: 9:00 - 18:00 CET
+32 492 45 67 46
Oficina India
#159 Sector 9, Pocket 1, DDA Flats, 110077 Dwarka, New Delhi
+91 98881 98841

© 2026 Workstation AI. Todos los derechos reservados.

PrivacidadCookiesTérminos de ServicioMapa del sitio web
Home / Articles / Technology
IAMLOpsOpen Source

Muse Glimmer en Ollama: agentes locales siempre activos en un GPU

Análisis profundo de Workstation: arquitectura, etiquetas Ollama/MLX, matriz de referencia meta frente a Gemma4-31B y Qwen3.6-27B, metodología de evaluación y lista de verificación de producción

August 12, 2026Technology9 min read

Muse Glimmer es el modelo de lenguaje causal de 30 mil millones de parámetros de Meta con un codificador de percepción dedicado, destilado de Muse Spark y publicado para cargas de trabajo agentes autónomas en hardware de consumidores y estaciones de trabajo. Distribuido a través de Ollama bajo Apache 2.0, apunta al uso confiable de herramientas, tareas a largo plazo, comprensión multimodal y recuperación de fallas, sin requerir inferencia en la nube. Este informe técnico de Workstation reescribe y amplía la tarjeta de modelo público para ingenieros que envían agentes locales.

Muse Glimmer en Ollama — Guía técnica de Workstation

Navegación. Blog complementario: resumen de negocios. Relacionado: adopción de peso abierto, Mac Studio + Ollama, Apple Silicon / OpenClaw, MCP OAuth y bóveda, LLM en Kubernetes.
Resumen del agente.
  • Clase: 30B codificador de percepción LM + causal; destilado de Muse Spark; visión + herramientas + pensamiento.
  • Atender: ollama run muse-glimmer (~18GB, 128K, texto+imagen); Apple Silicon: muse-glimmer:30b-mlx (~21GB, DFlash).
  • Adaptar: Agentes locales/aislados siempre activos en un GPU o Mac Silicon, no en un modelo de clúster MoE de varios TB.
  • Señal de fuerza: lidera la matriz de clases de tamaño informada por Meta en MCP-Atlas, DeepSearch QA, WildClawBench, SWE-Bench Pro, AA-LCR, Beam128K (razonamiento alto).
  • Operaciones: andamio a través de ollama launch (Claude Code, OpenCode, Hermes, OpenClaw); gobernar con evaluaciones, HITL, autenticación MCP.

Fuentes primarias: Biblioteca Ollama - muse-glimmer; Metodología de metaevaluación — Metodología Muse Glimmer. Los números y etiquetas cambian; Verifique la tarjeta del modelo en vivo antes de la adquisición.

1. Intención de arquitectura y diseño

Muse Glimmer no está posicionado como un MoE de chat general. El encuadre de Meta es finalización de tareas de agente de un extremo a otro En hardware, puedes comprar para un escritorio o un pequeño estante de laboratorio:

  • Columna vertebral causal de LM (30B) – próxima generación de tokens con cadenas de razonamiento de varios pasos sostenidas a lo largo de largos flujos de trabajo.
  • Codificador de percepción dedicado — acepta texto e imágenes entrelazados para que los agentes puedan razonar sobre capturas de pantalla, gráficos y documentos en la misma ventana contextual que las transcripciones de herramientas.
  • Destilación de Muse Spark — transferencia de capacidad a un espacio que apunta a la implementación de un único GPU/clase de consumidor en lugar del servicio exclusivo del centro de datos.
  • Comportamiento de recuperación de fallas — cuando una llamada a una herramienta falla o devuelve una carga útil inesperada, el modelo se entrena/ajusta para diagnosticar y volver a intentar en lugar de detener el episodio.
  • Esfuerzo controlable — La intensidad del razonamiento se puede seleccionar para que los operadores puedan intercambiar latencia por calidad por ruta.
  • Cobertura de formación multilingüe — Datos de entrenamiento de metaestados de más de 100 idiomas.

Para las pilas Workstation, la implicación del producto es: tratar a Glimmer como un cerebro en tiempo de ejecución del agente detrás de las herramientas, shells, navegadores y editores de archivos de MCP, no como un reemplazo directo para cada llamada API de frontera cerrada.

Pila de agentes locales: andamio, Ollama, Muse Glimmer, herramientas, plano de control

2. Distribución de Ollama (etiquetas, huella, E/S)

Según lo publicado en la tarjeta de la biblioteca Ollama (verifique los tamaños en vivo):

Etiqueta Aprox. tamaño Contexto Aporte Notas
muse-glimmer:latest / :30b~18GB128KTexto, ImagenRuta predeterminada de GPU único
muse-glimmer:30b-mlx~21GB128KTexto, ImagenMotor Ollama MLX; DFlash + imagen en Apple Silicon
# Pull + interactive
ollama run muse-glimmer

# Apple Silicon (MLX)
ollama run muse-glimmer:30b-mlx

# HTTP chat (localhost Ollama)
curl http://localhost:11434/api/chat \
  -d '{"model":"muse-glimmer","messages":[{"role":"user","content":"Hello!"}]}'

# Scaffold launchers (from Ollama applications list)
ollama launch claude --model muse-glimmer
ollama launch opencode --model muse-glimmer
ollama launch hermes --model muse-glimmer
ollama launch openclaw --model muse-glimmer

Los clientes de Python/JS deben fijar la etiqueta que validaste (muse-glimmer vs :30b-mlx) en la configuración, no en el código fijo latest en agentes de producción.

3. Superficie de capacidad (lectura de ingeniería)

  • Finalización de agentes de extremo a extremo — Meta cita resultados sólidos en las tareas de la familia DeepSearch QA, MCP-Atlas, τ3-Bench (banca) y SWE-Bench que miden el éxito de varios turnos andamiados, no trivias de un solo disparo.
  • Uso confiable de herramientas — amplia cobertura de llamadas de funciones con precisión de esquema en flujos de trabajo extendidos (crítico para flotas de herramientas MCP).
  • Razonamiento de varios pasos — planificar la coherencia a largo plazo; se combina con la ventana de contexto de 128K para transcripción + retención de documentos.
  • Recuperación de fallas — diagnosticar resultados inesperados de la herramienta y volver a intentarlo; Reduce los abortos por "agentes frágiles" en trabajos nocturnos.
  • razonamiento multimodal — El codificador de percepción permite capturas de pantalla/gráficos/documentos intercalados con texto (bancos de conexión a tierra de GUI y análisis de documentos incluidos en la matriz de Meta).
  • Compatibilidad con andamios — OpenClaw, Hermes Agent y patrones de orquestación similares; Ollama enumera los lanzadores Claude Code y OpenCode como aplicaciones de primera clase.

4. Matriz de referencia (metainformada, razonamiento alto)

Meta compara Muse Glimmer-30B (razonamiento alto) con Gemma4-31B y Qwen3.6-27B en modo de pensamiento. Lectura del titular Workstation: Glimmer lidera varios agente suites públicas (MCP-Atlas, DeepSearch QA, WildClawBench, Gaia2, SWE-Bench Pro) mientras siguen o empatan a sus pares en algunas métricas de agente de escritorio y GDP-val. Vuelva a ejecutar siempre su aprovechar.

Categoría Punto de referencia Luz tenue-30B Gemma4-31B Qwen3.6-27B
agente generalMCP-Atlas (público)75.554.262.5
Control de calidad de búsqueda profunda74.661.771.1
τ3-Banca23.515.116.7
Banco De Garra Salvaje47.637.643.2
GDPVal-AA v29538111141
Gaia243.336.440.0
SkillsBench (con habilidades)44.332.446.6
OSWorld-Verified65.958.575.6
Codificación agenteSWE-Bench Pro51.236.950.2
SWE-Bench Verificado76.066.677.2
Banco de terminales 2.151.743.460.7
Código de ciencia43.643.439.8
MultimodalRazonamiento CharXiv78.877.778.4
ScreenSpotPro75.475.976.1
OmniDocBench v1.575.872.577.8
MMMU Pro747375
Razonamiento / LCRIFBanco77.076.070.8
OBJETIVO 202694.789.294.1
Diamante GPQA (AA)83.585.784.2
Texto HLE (AA)22.023.623.1
AA-LCR80.068.373.3
Haz128K65.158.263.0

Los bancos de seguridad (CI Memories, Siren AgentDojo) muestran compensaciones: Glimmer informa una gran utilidad bajo las inyecciones de AgentDojo con ASR de paquete medio; Trate la seguridad como un problema de control de implementación (firewalls rápidos, listas de herramientas permitidas, HITL), no como una propiedad del modelo resuelta. Consulte el PDF de metodología de Meta para conocer modelos de jueces, recuentos de intentos y advertencias sobre los arneses.

5. Metodología de evaluación (qué significan los números)

La nota metodológica de Meta es esencial antes de citar cualquier celda en un tablero:

  • Selección de pares: modelos abiertos de clase de tamaño (Gemma4-31B, Qwen3.6-27B); los compañeros pueden utilizar puntuaciones autoinformadas o reproducidas internamente; Se utiliza análisis artificial cuando está disponible para los tres.
  • Muestreo: Glimmer informó una alta capacidad de razonamiento con temperatura = 1,0 / top_p = 0,95 / top_k = 64; los pares usan configuraciones de pensamiento recomendadas por los proveedores (Qwen usa temperaturas más frías en algunos bancos de agentes).
  • Advertencia sobre el sesgo del arnés: Es posible que los modelos de terceros de Meta Notes no estén ajustados a las indicaciones del sistema/herramienta de Meta: las clasificaciones absolutas pueden cambiar bajo andamios nativos de pares.
  • MCP-Atlas: uso de herramientas de múltiples turnos en más de 20 servidores MCP; Tasa de aprobación del juez LLM (umbral 0,75) en 500 tareas públicas, promediada en 4 ejecuciones.
  • Control de calidad de búsqueda profunda: bucle de navegación autónomo (buscar/abrir/encontrar) en 900 preguntas de investigación difíciles; F1 mediante extracción de juez.
  • Banco WildClaw / Gaia2: Tareas de agente Dockerizado de largo horizonte bajo arneses estilo OpenClaw con inyección de eventos y clasificación mixta determinista/LLM.
  • SWE-Bench: bash + andamio de herramientas de archivos; Pro y Verified promediados en múltiples ejecuciones: las comparaciones Pro evitan la variante de tarea refinada de Qwen.
  • OSWorld-Verificado: Control de VM Ubuntu solo mediante GUI a partir de capturas de pantalla (sin shell directo); Las diferencias en el espacio de acción entre modelos son importantes.
  • Haz 128K: Sonda de memoria de contexto largo no agente a 128K: relevante si mantiene transcripciones grandes en contexto sin RAG.

Política Workstation: publique la matriz de Meta para orientación, luego inicie la producción en un conjunto dorado interno (sus herramientas MCP, sus repositorios, su SLO de latencia).

6. Hardware y servicio a la realidad

  • Clase GPU única: ~18GB huella de peso implica un moderno 24GB+ consumidor/profesional GPU es el piso práctico de NVIDIA una vez que se consideran las activaciones de visión y caché de KV; perfil con su contexto máximo y sesiones simultáneas.
  • Apple Silicon: preferir :30b-mlx (~21GB) para la ruta MLX de Ollama con decodificación especulativa DFlash y entrada de imagen nativa: las configuraciones Mac Studio/Mac mini Max son nodos SME de primera clase.
  • No clase Kimi-K3: Este no es un MoE de múltiples nodos. Si necesita agentes abiertos de billones de parámetros, consulte nuestro guía de pesos abiertos; Glimmer es dueño del siempre activo en el escritorio nicho.
  • Kubernetes: paquete Ollama o un sidecar compatible con OpenAI por nodo; mantenga las extracciones de modelos en su registro/caché privado; no exponga Ollama sin vincular a Internet.

7. Seguridad y gobernanza para agentes siempre activos

Los pesos locales reducen la salida de datos pero aumentan el radio de explosión de un host de agente comprometido. Línea base mínima de Workstation:

  1. MCP OAuth 2.1 + secretos de corta duración (arrendamientos de Vault) — consulte artículo de seguridad agente.
  2. Listas de herramientas permitidas y políticas de salida de red por identidad de agente.
  3. HITL bloquea acciones irreversibles (pagos, implementaciones de productos, correo electrónico masivo).
  4. Monitoreo de inyección rápida en contenido devuelto por herramientas (modelo de amenaza estilo Siren AgentDojo).
  5. El modo sin conexión/air-gap probado como un runbook de primera clase, no una esperanza.

8. Lista de verificación de producción

  1. Fijar la etiqueta Ollama (30b vs 30b-mlx) y registrar resumen/hash en GitOps.
  2. Cree un paquete dorado de entre 20 y 50 tareas que refleje sus herramientas MCP y sus flujos de trabajo de codificación; seguimiento de la latencia pass@1 y p95 en cada nivel de esfuerzo.
  3. Andamio de alambre (ollama launch … o personalizado) con registro estructurado de llamadas y reintentos de herramientas.
  4. Definir enrutador híbrido: Glimmer local para RAG/agentes privados; conmutación por error en la nube para desbordamiento/pico de IQ.
  5. Documente el espacio libre de VRAM/memoria unificada a 32 K/64 K/128 K con la visión activada.
  6. Legal: revisión de Apache 2.0 para su modelo de distribución (generalmente licencias de peso abierto sencillas versus restrictivas).
  7. Bot de revisión de envíos + puertas de evaluación antes de habilitar agentes nocturnos desatendidos.
Veredicto Workstation. Muse Glimmer es la versión abierta de “agente local siempre activo en una sola caja” más clara en su clase de tamaño: Apache 2.0, Ollama nativo, visión + herramientas + recuperación de fallas y bancos competitivos de agentes metainformados. Úselo como carril privado de una arquitectura híbrida; pruébalo en tus tareas doradas; gobernarlo como software de producción.

Publicado por Workstation. Tarjeta modelo: ollama.com/library/muse-glimmer.

Share this article

More in Technology

Jobshout SEO Analyst AI Agent — Analyse Any Website & Fix SEO Issues Automatically

Jobshout SEO Analyst AI Agent — Analyse Any Website & Fix SEO Issues Automatically

Technical brief: SEO Analyst modes, real workstation.co.uk run (score 44), findings with fix prompts, Improve/Publish paths, and Jobshout supervised agents

Read more
WSLVault: Steal the Server. Not the Secrets.

WSLVault: Steal the Server. Not the Secrets.

Technical brief: AES-256-GCM envelope hierarchy, cryptographic tenant isolation, engines, identity/MFA, active/active regions, Kubernetes deploy, and video chapters

Read more
Workstation WSL Proxy — Docker Image Optimisation, Build Cache, Full Deploy Workflow, and Shipping It with AI Assistance

Workstation WSL Proxy — Docker Image Optimisation, Build Cache, Full Deploy Workflow, and Shipping It with AI Assistance

Technical brief: prebuilt OpenResty Dockerfile, Buildx/GHA cache, Ansible extract, delivery pipeline DEPLOY_MODE, and an operator+agent loop for finishing pipeline work

Read more