Workstation Logo
Produtos
Labs de IAAgentes OpenAIAgentes ClaudeGrok BotWorkstation CRM (WSL CRM)MarketingTodos os Produtos
Soluções IA
Estações de Trabalho IAAI SME PackagesIA PrivadaClusters GPUIA EdgeLaboratório IA EmpresarialIA por Indústria
Serviços
Modernização de plataformaEngenharia digitalFundações de dados e IAOperações autónomasConsultoria de IAAutomação DevOpsCibersegurançaDesenvolvimento de softwareConstrução de agentesConfiguração MLOps
Sobre Nós
ParceirosHistórias de Clientes
Artigos
Documentação
WSL ProxyRing PromoterWSL VaultJobshoutSysOps 24/7
Blog
Contacte-nosLogin
Workstation

Estações de trabalho de IA, software multiagente de IA, infraestrutura de GPU e soluções de agentes inteligentes para empresas modernas.

Contacte-nos

Soluções de IA

Estações de Trabalho IAAI SME PackagesIA PrivadaClusters GPUIA EdgeLaboratório IA EmpresarialIA por Indústria

Produtos

Todos os ProdutosWSL CRM e ERPMarketingAgentes OpenAIWSL ProxyRing PromoterWSL VaultJobshoutSysOps 24/7

Empresa

Sobre NósPor que WorkstationParceirosHistórias de ClientesPreçosContato

Recursos

ArtigosDocumentaçãoBlogPesquisarMapa do Site
Escritório Reino Unido
77-79 Marlowes, Hemel Hempstead HP1 1LFComo chegar: pegue a saída 20 da M25, Outer LondonN.º da empresa: 11641870Seg - Sex: 9:00 - 18:00 GMT
+44 7515 356 146
Escritório Bélgica
Workstation SRL, Rue Vanderkindere 34, 1180 Uccle, BrusselsBE 0751.518.683Seg - Sex: 9:00 - 18:00 CET
+32 492 45 67 46
Escritório Índia
#159 Sector 9, Pocket 1, DDA Flats, 110077 Dwarka, New Delhi
+91 98881 98841

© 2026 Workstation AI. Todos os direitos reservados.

PrivacidadeCookiesTermos de ServiçoMapa do site
Home / Articles / Technology
IAMLOpsOpen Source

Muse Glimmer no Ollama: agentes locais sempre ativos em um GPU

Aprofundamento do Workstation: arquitetura, tags Ollama/MLX, matriz de benchmark Meta vs Gemma4-31B e Qwen3.6-27B, metodologia de avaliação e lista de verificação de produção

August 12, 2026Technology9 min read

Muse Glimmer é o modelo de linguagem causal de 30 bilhões de parâmetros da Meta com um codificador de percepção dedicado, destilado do Muse Spark e publicado para cargas de trabalho de agente autônomo em hardware de consumidor e estação de trabalho. Distribuído via Ollama sob Apache 2.0, ele visa o uso confiável de ferramentas, tarefas de longo prazo, compreensão multimodal e recuperação de falhas, sem exigir inferência na nuvem. Este resumo técnico do Workstation reescreve e expande o cartão de modelo público para engenheiros que enviam agentes locais.

Muse Glimmer na Ollama — guia técnico da Workstation

Navegação. Blog complementar: resumo do negócio. Relacionado: adoção de peso aberto, Mac Studio + Ollama, Apple Silicon/OpenClaw, OAuth e cofre do MCP, LLMs no Kubernetes.
Resumo do agente.
  • Aula: 30B causal LM + codificador de percepção; destilado de Muse Spark; visão + ferramentas + pensamento.
  • Servir: ollama run muse-glimmer (~18GB, 128K, texto+imagem); Apple Silicon: muse-glimmer:30b-mlx (~21GB, DFlash).
  • Ajustar: agentes locais/air-gapped sempre ativos em um GPU ou Mac Silicon — não um modelo de cluster MoE de vários TB.
  • Sinal de força: lidera a matriz de classe de tamanho relatada pela Meta em MCP-Atlas, DeepSearch QA, WildClawBench, SWE-Bench Pro, AA-LCR, Beam128K (alto raciocínio).
  • Operações: andaime via ollama launch (Claude Code, OpenCode, Hermes, OpenClaw); governar com avaliações, HITL, autenticação MCP.

Fontes primárias: Biblioteca Ollama – muse-glimmer; Metodologia de metaavaliação - Metodologia Muse Glimmer. Números e tags mudam; verifique o cartão do modelo ao vivo antes da aquisição.

1. Intenção de arquitetura e design

Muse Glimmer não está posicionado como um MoE de bate-papo geral. O enquadramento de Meta é conclusão de tarefa de agente de ponta a ponta em hardware que você pode comprar para uma mesa ou um pequeno rack de laboratório:

  • Estrutura LM causal (30B) — próxima geração de tokens com cadeias de raciocínio de várias etapas sustentadas em longos fluxos de trabalho.
  • Codificador de percepção dedicado — aceita texto e imagens intercalados para que os agentes possam raciocinar sobre capturas de tela, gráficos e documentos na mesma janela de contexto das transcrições da ferramenta.
  • Destilação de Muse Spark — transferência de capacidade para um espaço que visa implantação de GPU único/classe de consumidor, em vez de atendimento apenas em datacenter.
  • Comportamento de recuperação de falhas — quando uma chamada de ferramenta falha ou retorna uma carga inesperada, o modelo é treinado/ajustado para diagnosticar e tentar novamente, em vez de interromper o episódio.
  • Esforço controlável — a força do raciocínio é selecionável para que os operadores possam trocar a latência pela qualidade por rota.
  • Cobertura de treinamento multilíngue — Meta indica dados de treinamento de mais de 100 idiomas.

Para pilhas Workstation, a implicação do produto é: trate o Glimmer como um cérebro de tempo de execução do agente por trás de ferramentas MCP, shells, navegadores e editores de arquivos - não como um substituto imediato para todas as chamadas API de fronteira fechada.

Pilha de agentes locais: andaime, Ollama, Muse Glimmer, ferramentas, plano de controle

2. Distribuição Ollama (tags, pegada, E/S)

Conforme publicado no cartão da biblioteca Ollama (verifique os tamanhos em tempo real):

Marcação Aprox. tamanho Contexto Entrada Notas
muse-glimmer:latest / :30b~18GB128KTexto, ImagemCaminho GPU único padrão
muse-glimmer:30b-mlx~21GB128KTexto, ImagemMotor Ollama MLX; DFlash + imagem em Apple Silicon
# Pull + interactive
ollama run muse-glimmer

# Apple Silicon (MLX)
ollama run muse-glimmer:30b-mlx

# HTTP chat (localhost Ollama)
curl http://localhost:11434/api/chat \
  -d '{"model":"muse-glimmer","messages":[{"role":"user","content":"Hello!"}]}'

# Scaffold launchers (from Ollama applications list)
ollama launch claude --model muse-glimmer
ollama launch opencode --model muse-glimmer
ollama launch hermes --model muse-glimmer
ollama launch openclaw --model muse-glimmer

Os clientes Python/JS devem fixar a tag que você validou (muse-glimmer contra :30b-mlx) na configuração, não no código rígido latest em agentes de produção.

3. Superfície de capacidade (leitura de engenharia)

  • Conclusão de agente ponta a ponta - Meta cita bons resultados em tarefas da família DeepSearch QA, MCP-Atlas, τ3-Bench (bancário) e SWE-Bench que medem o sucesso de múltiplas voltas do andaime, e não curiosidades de tiro único.
  • Uso confiável de ferramentas — ampla cobertura de chamadas de função com precisão de esquema em fluxos de trabalho estendidos (crítico para frotas de ferramentas MCP).
  • Raciocínio em várias etapas — planejar a coerência em horizontes longos; emparelha com a janela de contexto de 128K para retenção de transcrição + documento.
  • Recuperação de falhas — diagnosticar resultados inesperados da ferramenta e tentar novamente; reduz abortos por “agentes frágeis” em trabalhos noturnos.
  • Raciocínio multimodal - o codificador de percepção permite captura de tela/gráfico/documento intercalado com texto (base de GUI e bancos de análise de documentos incluídos na matriz do Meta).
  • Compatibilidade de andaime — OpenClaw, Hermes Agent e padrões de orquestração semelhantes; Ollama lista os inicializadores Claude Code e OpenCode como aplicativos de primeira classe.

4. Matriz de referência (meta-relatado, raciocínio elevado)

Meta compara Muse Glimmer-30B (alto raciocínio) com Gemma4-31B e Qwen3.6-27B no modo de pensamento. Leitura do título Workstation: Glimmer lidera vários agente suítes públicas (MCP-Atlas, DeepSearch QA, WildClawBench, Gaia2, SWE-Bench Pro) enquanto rastreia ou vincula pares em algumas métricas de agente de desktop e valor de PIB. Sempre execute novamente seu aproveitar.

Categoria Referência Brilho-30B Gema4-31B Qwen3.6-27B
Agente geralMCP-Atlas (público)75.554.262.5
Controle de qualidade do DeepSearch74.661.771.1
τ3-Banco23.515.116.7
Banco WildClaw47.637.643.2
PIBVal-AA v29538111141
Gaia243.336.440.0
SkillsBench (com habilidades)44.332.446.6
Verificado pelo OSWorld65.958.575.6
Codificação agenteSWE-Bench Pró51.236.950.2
SWE-Bench verificado76.066.677.2
TerminalBench 2.151.743.460.7
SciCode43.643.439.8
MultimodalRaciocínio CharXiv78.877.778.4
TelaSpot Pro75.475.976.1
OmniDocBench v1.575.872.577.8
MMMU Pro747375
Raciocínio / LCRBanco IFB77.076.070.8
AIME 202694.789.294.1
Diamante GPQA (AA)83.585.784.2
Texto HLE (AA)22.023.623.1
AA-LCR80.068.373.3
Feixe128K65.158.263.0

Bancos de segurança (CI Memories, Siren AgentDojo) mostram compensações: Glimmer relata alta utilidade sob injeções de AgentDojo com ASR mid-pack; trate a segurança como um problema de controle de implantação (firewalls de prompt, listas de permissões de ferramentas, HITL) — e não uma propriedade de modelo resolvida. Consulte o PDF da metodologia Meta para modelos de juízes, contagens de tentativas e advertências de aproveitamento.

5. Metodologia de avaliação (o que significam os números)

A nota metodológica do Meta é essencial antes de você citar qualquer célula em um deck de tabuleiro:

  • Seleção de pares: modelos abertos de classe de tamanho (Gemma4-31B, Qwen3.6-27B); os pares podem usar pontuações auto-relatadas ou reproduzidas internamente; Análise Artificial usada quando disponível para todos os três.
  • Amostragem: Glimmer relatou alta força de raciocínio com temperatura = 1,0 / top_p = 0,95 / top_k = 64; os pares usam configurações de pensamento recomendadas pelo fornecedor (Qwen usa temperaturas mais baixas em alguns bancos de agentes).
  • Advertência sobre polarização do chicote de fios: Meta observa que modelos de terceiros podem não ser ajustados aos prompts de ferramenta/sistema do Meta – as classificações absolutas podem mudar em andaimes nativos de pares.
  • MCP-Atlas: uso de ferramentas multivoltas em mais de 20 servidores MCP; Taxa de aprovação do juiz LLM (limite de 0,75) em 500 tarefas públicas, com média de 4 execuções.
  • Controle de qualidade do DeepSearch: loop de navegação autônomo (pesquisar/abrir/encontrar) em 900 questões de pesquisa difíceis; F1 via extração de juiz.
  • Banco WildClaw/Gaia2: tarefas de agentes Dockerizados de longo horizonte sob chicotes estilo OpenClaw com injeção de eventos e classificação mista determinística/LLM.
  • SWE-Bench: bash + estrutura de ferramentas de arquivo; Média Pro e Verificada em várias execuções – As comparações Pro evitam a variante de tarefa refinada de Qwen.
  • Verificado pelo OSWorld: Controle Ubuntu VM somente GUI a partir de capturas de tela (sem shell direto); as diferenças no espaço de ação entre os modelos são importantes.
  • Feixe128K: sondagem de memória de contexto longo não agente em 128K — relevante se você mantiver transcrições grandes no contexto sem RAG.

Política Workstation: publique a matriz do Meta para orientação e, em seguida, bloqueie a produção em um conjunto dourado interno (suas ferramentas MCP, seus repositórios, seu SLO de latência).

6. Hardware e serviço à realidade

  • Classe GPU única: A pegada de peso ~18GB implica um 24GB+ moderno para consumidor/profissional. GPU é o piso prático da NVIDIA, uma vez que o cache KV e as ativações de visão são consideradas; perfil com seu contexto máximo e sessões simultâneas.
  • Apple Silicon: prefiro :30b-mlx (~21GB) para o caminho MLX do Ollama com decodificação especulativa DFlash e entrada de imagem nativa – as configurações Mac Studio / Mac mini Max são nós SME de primeira classe.
  • Não é classe Kimi-K3: este não é um MoE de vários nós. Se você precisar de agentes abertos com trilhões de parâmetros, consulte nosso guia de pesos abertos; Glimmer possui o sempre ligado na mesa nicho.
  • Kubernetes: empacotar Ollama ou um sidecar compatível com OpenAI por nó; mantenha pulls de modelo em seu registro/cache privado; não exponha o Ollama não vinculado à Internet.

7. Segurança e governança para agentes sempre ativos

Os pesos locais reduzem a saída de dados, mas aumentam o raio de explosão de um host de agente comprometido. Linha de base mínima do Workstation:

  1. MCP OAuth 2.1 + segredos de curta duração (locações do Vault) — consulte artigo de segurança de agente.
  2. Listas de permissões de ferramentas e políticas de saída de rede por identidade de agente.
  3. O HITL bloqueia ações irreversíveis (pagamentos, implantações de produtos, e-mail em massa).
  4. Monitoramento de injeção de prompt em conteúdo retornado por ferramenta (modelo de ameaça estilo Siren AgentDojo).
  5. Modo offline / air-gap testado como um runbook de primeira classe, não uma esperança.

8. Lista de verificação de produção

  1. Fixar etiqueta Ollama (30b contra 30b-mlx) e registre resumo/hash no GitOps.
  2. Crie um conjunto dourado de 20 a 50 tarefas que espelhe suas ferramentas MCP e fluxos de trabalho de codificação; rastreie a latência pass@1 e p95 em cada nível de esforço.
  3. Andaime de arame (ollama launch … ou personalizado) com registro estruturado de chamadas de ferramenta e novas tentativas.
  4. Definir roteador híbrido: Glimmer local para RAG/agentes privados; failover na nuvem para overflow/pico de QI.
  5. Documente espaço de VRAM/memória unificada em 32K/64K/128K com visão ativada.
  6. Legal: revisão Apache 2.0 para seu modelo de distribuição (geralmente licenças abertas simples versus restritivas).
  7. Enviar bot de revisão + portões de avaliação antes de habilitar agentes noturnos autônomos.
Veredicto Workstation. Muse Glimmer é o lançamento aberto de “agente local sempre ativo em uma caixa” mais claro em sua classe de tamanho: Apache 2.0, Ollama nativo, visão + ferramentas + recuperação de falhas e bancos de agentes competitivos com meta-relatos. Use-o como via privada de uma arquitetura híbrida; prove isso em suas tarefas de ouro; governá-lo como software de produção.

Publicado por Workstation. Cartão modelo: ollama.com/library/muse-glimmer.

Share this article

More in Technology

Jobshout SEO Analyst AI Agent — Analyse Any Website & Fix SEO Issues Automatically

Jobshout SEO Analyst AI Agent — Analyse Any Website & Fix SEO Issues Automatically

Technical brief: SEO Analyst modes, real workstation.co.uk run (score 44), findings with fix prompts, Improve/Publish paths, and Jobshout supervised agents

Read more
WSLVault: Steal the Server. Not the Secrets.

WSLVault: Steal the Server. Not the Secrets.

Technical brief: AES-256-GCM envelope hierarchy, cryptographic tenant isolation, engines, identity/MFA, active/active regions, Kubernetes deploy, and video chapters

Read more
Workstation WSL Proxy — Docker Image Optimisation, Build Cache, Full Deploy Workflow, and Shipping It with AI Assistance

Workstation WSL Proxy — Docker Image Optimisation, Build Cache, Full Deploy Workflow, and Shipping It with AI Assistance

Technical brief: prebuilt OpenResty Dockerfile, Buildx/GHA cache, Ansible extract, delivery pipeline DEPLOY_MODE, and an operator+agent loop for finishing pipeline work

Read more