O que é Muse Glimmer, o modelo agentivo aberto da Meta que roda no seu PC?

Muse Glimmer é o primeiro modelo de pesos abertos do Meta Superintelligence Labs, anunciado em 10 de agosto de 2026 sob licença Apache 2.0. São 30 bilhões de parâmetros (29,6B) em arquitetura densa, 128K de contexto e entrada multimodal com encoder de percepção próprio, destilados do Muse Spark, o modelo proprietário da Meta. O posicionamento oficial é claro: agentes locais sempre ativos rodando inteiramente em hardware de consumo (Mac ou PC com GPU), sem nuvem e sem taxa de API. Quantizado em cerca de 4 bits, ele cai pra menos de 20GB e cabe numa placa de 24GB
A Meta abriu os pesos de um modelo agentivo feito pra rodar no PC de casa
Fala aí, beleza? O Muse Glimmer saiu em 10 de agosto de 2026, o primeiro modelo open-weights do Meta Superintelligence Labs, e a proposta não é brigar por trono de benchmark: é ser o motor de agentes locais que ficam ligados o dia inteiro na sua máquina
Neste post eu te conto o que é o Muse Glimmer, de onde ele veio, quanto de máquina ele pede, pra quem ele serve e o que a página oficial lista como recurso
Só o que tem fonte, beleza? O que não está documentado, eu não invento aqui 😀
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
De onde vem o Muse Glimmer e por que ele é aberto
O anúncio oficial da Meta apresenta o modelo como o primeiro de pesos abertos do Meta Superintelligence Labs
Ele saiu em 10 de agosto de 2026 e já foi direto pro download, sem reversão, despublicação ou mudança de licença até 11 de agosto de 2026
A origem dele é a parte mais interessante: ele foi destilado do Muse Spark, o modelo proprietário de fronteira da Meta, num processo de destilação em três fases que inclui logit distillation ainda no pré-treino
O que é destilação, já que eu joguei o termo aí?
É o processo de treinar um modelo menor pra imitar o comportamento de um modelo maior, em vez de aprender tudo do zero sozinho
Se você já viu aquela ideia de aluno aprendendo com o professor olhando a resposta E o raciocínio, é bem por aí: no logit distillation o modelo menor aprende olhando as probabilidades que o modelo grande atribui a cada token, não só o texto final
E a licença Apache 2.0 muda o que na prática?
Os pesos são distribuídos sob Apache 2.0, uma licença permissiva
Na prática isso significa que você baixa os pesos, roda onde quiser e não fica dependendo de aprovação caso a caso pra usar
O peso mora no seu disco, e é isso que destrava o resto do post
A ficha técnica:
- Tamanho: 30 bilhões de parâmetros (29,6B), arquitetura densa
- Contexto: 128K tokens (131.072 tokens)
- Decoder de texto: 52 camadas, hidden 6656
- Atenção híbrida: três camadas de janela deslizante de 2.048 tokens com RoPE, seguidas de uma camada de atenção total sem embedding posicional (NoPE)
- Precisão dos pesos: BF16
- Visão: encoder de percepção ViT-G/14 de aproximadamente 1,8B, que interpreta capturas de tela, gráficos, documentos e imagens
- Corte de conhecimento: 4 de janeiro de 2026
- Idiomas: treinado em mais de 100
Repara na atenção híbrida, que é o truque de engenharia aqui: a maior parte das camadas só olha uma janelinha de 2.048 tokens, e de vez em quando entra uma camada que olha tudo
É o que segura 128K de contexto sem exigir PC da Nasa
Quanto de máquina o Muse Glimmer exige
Aqui vem a pergunta que todo mundo faz antes de baixar 30 bilhões de parâmetros: cabe na minha placa?
A quantização de aproximadamente 4 bits derruba o modelo pra menos de 20GB
A variante k-quant de 17GB mira placas de 24GB, e essa folga não é sobra à toa: ela existe pra caber o KV cache, o vision encoder e o drafter DFlash junto
Já a variante dinâmica mira 32GB
Os runtimes que suportam o modelo:
O modelo tem suporte em Ollama, LM Studio, llama.cpp, MLX, ExecuTorch, vLLM e SGLang
Ou seja, tem caminho tanto pro pessoal do clique (LM Studio, Ollama) quanto pra quem vai servir o modelo (vLLM, SGLang)
E o tal do DFlash?
O modelo vem acompanhado de um drafter chamado DFlash, que faz decodificação especulativa: ele prevê blocos de 16 tokens por passagem e o modelo principal só confere
É o velho truque de adiantar o palpite pra gastar menos passada cara
Os números que a Meta reporta com ele ligado:
| Hardware | Sem DFlash | Com DFlash |
|---|---|---|
| Nvidia RTX 5090 | 74,9 tokens/s | 233,4 tokens/s |
| Apple M5 Max | 26,6 tokens/s | 50,2 tokens/s |
| Apple M4 Max | 23,7 tokens/s | 37,8 tokens/s |
O salto da 5090 é insano, mas repara que o ganho cai conforme o hardware muda
Número de fabricante é sempre teto, então trate isso como referência e meça na sua máquina
Para quem serve o modelo: os casos de uso oficiais
A página do modelo lista quatro usos, e eu vou ficar exatamente neles
1. Agentes locais e function calling
É o caso de uso número um do modelo
A documentação cita planejamento multi-etapa, chamada sequencial de ferramentas, recuperação de falhas e execução de tarefas longas
Essa parte de recuperação de falhas é o que separa agente de brinquedo de agente útil: ferramenta que quebra no meio do caminho é rotina, não exceção
2. Agentes de código
Escrever e depurar código, com o modelo rodando local
3. Raciocínio multimodal
Como ele tem o encoder de percepção próprio, entra imagem no prompt: capturas de tela, gráficos, documentos e imagens
Pra agente que precisa OLHAR uma tela e decidir o próximo passo, isso conta muito
4. LLM-as-a-judge
Usar o modelo como avaliador de saída de outro modelo
É um uso que combina demais com modelo local: avaliação costuma ser chamada em volume, e volume na API é conta alta
O esforço de raciocínio tem quatro níveis
O modelo deixa você controlar a força de raciocínio em low, medium, high e xhigh
A orientação oficial é usar high ou xhigh pra código e tarefas agentivas complexas, e cair pros níveis menores quando velocidade importa mais que profundidade
Ou seja: o botão está na sua mão, e ele tem preço em tempo
Como baixar e rodar o Muse Glimmer
Bora ver na prática?
- Vá até os pesos no Hugging Face: eles estão na organização
meta-models, no repositórioMuse-Glimmer-30B, com variantes BF16, GGUF e ExecuTorch
- Escolha a variante pelo seu hardware, não pelo nome mais bonito: a quantizada de ~4 bits (menos de 20GB, k-quant de 17GB) é a que mira placa de 24GB
- Se for pelo Ollama, rode a tag MLX: essa variante tem 21GB e janela de 128K
ollama run muse-glimmer:30b-mlx- Confira as outras tags antes de puxar o download errado: a biblioteca do Ollama também lista
muse-glimmer:30b,muse-glimmer:30b-bf16-dflash(59GB) emuse-glimmer:30b-mlx-bf16-dflash(65GB)
O erro comum deste passo é justamente esse: baixar a tag pesada de 59GB ou 65GB achando que é "a versão boa" e estourar a memória da máquina
A versão boa é a que CABE, beleza? Comece pela quantizada e só suba se sobrar folga
- Ajuste o nível de raciocínio depois que estiver rodando: high ou xhigh pra código e agente complexo, níveis menores quando você quer resposta rápida
Muse Glimmer é forte? O que os números públicos dizem
Agora a parte honesta
Na página do modelo no Artificial Analysis, o posicionamento no índice de inteligência fica assim:
| Modelo | Artificial Analysis Intelligence Index |
|---|---|
| Muse Spark 1.2 (xhigh) | 57 |
| Qwen3.6 27B (Reasoning) | 38 |
| Muse Glimmer (high) | 35 |
Então não, ele não chega perto do modelo de fronteira da própria Meta, e fica abaixo do Qwen3.6 27B nesse índice
E tudo bem: o valor dele não está em ganhar placar, está em rodar inteiro na sua máquina, sem nuvem e sem taxa de API
Um aviso importante: essa é uma página viva, os valores mudam conforme o Artificial Analysis roda novas medições
Se você chegou aqui meses depois, confere na fonte antes de repetir o número por aí
O que muda no seu dia a dia de dev
O posicionamento oficial do modelo é rodar inteiramente em hardware de consumo (Mac ou PC com GPU), sem nuvem, sem acesso à rede e sem taxa de API
Lê de novo essa parte de "sem acesso à rede"
Pra quem trabalha com código que não pode sair da máquina, isso não é detalhe, é o motivo inteiro de existir
E tem o custo: agente sempre ativo é agente que consome token o tempo todo, e token local não vira fatura no fim do mês
E o trade-off fica claro: raciocínio maior (high, xhigh) custa velocidade, e a sua máquina é o teto
Não tem elástico de nuvem pra te salvar quando o contexto encher
Vídeo do canal pra entrar no assunto
A corrida dos modelos abertos não começou ontem, e ela é o pano de fundo desse lançamento
Pra começar do zero com um panorama de modelo aberto grande brigando com os modelos de fronteira, este vídeo do canal mostra o caso do Kimi K3:
Conclusão
O Muse Glimmer é o primeiro modelo de pesos abertos do Meta Superintelligence Labs: 30 bilhões de parâmetros (29,6B) densos, 128K de contexto, entrada multimodal, licença Apache 2.0 e destilação em três fases a partir do Muse Spark
Vale olhar agora se você tem 24GB de VRAM, ou um Mac com memória unificada sobrando, e quer um agente local sempre ativo sem mandar seu código pra nuvem
O próximo passo é bem concreto: baixa a variante quantizada (não a de 59GB), começa no nível high, e mede a velocidade na TUA máquina antes de plugar o modelo em qualquer workflow
Número de fabricante é referência, o que vale é o tokens/s que aparece aí no seu terminal
Até o próximo post! 🙂
Perguntas frequentes
Muse Glimmer roda sem internet, direto no PC?
Sim, essa é a proposta oficial do modelo: rodar inteiramente em hardware de consumo, seja Mac ou PC com GPU, sem depender de nuvem, sem acesso à rede e sem taxa de API. É por isso que ele é pensado como motor de agentes locais que ficam ligados o dia inteiro na sua máquina.
Qual a diferença entre Muse Glimmer e Muse Spark?
O Muse Glimmer foi destilado do Muse Spark, o modelo proprietário de fronteira da Meta, num processo de destilação em três fases que inclui logit distillation no pré-treino. A diferença de capacidade aparece no Artificial Analysis Intelligence Index: o Muse Glimmer (high) marca 35 pontos, enquanto o Muse Spark 1.2 (xhigh) marca 57.
Quanta memória preciso pra rodar o Muse Glimmer?
A quantização de aproximadamente 4 bits reduz o modelo para menos de 20GB. A variante k-quant de 17GB mira placas de 24GB, deixando espaço para o KV cache, o vision encoder e o drafter DFlash, e a variante dinâmica mira 32GB.
Qual comando roda o Muse Glimmer no Ollama?
O comando é ollama run muse-glimmer:30b-mlx, que baixa a variante MLX de 21GB com janela de contexto de 128K. A biblioteca do Ollama também lista as tags muse-glimmer:30b, 30b-bf16-dflash (59GB) e 30b-mlx-bf16-dflash (65GB).
Muse Glimmer é de graça pra uso comercial?
Os pesos são distribuídos sob licença Apache 2.0, que é permissiva, no Hugging Face, na organização meta-models, repositório Muse-Glimmer-30B. Na prática isso significa baixar os pesos e rodar onde quiser, sem aprovação caso a caso.
Quantos tokens de contexto o Muse Glimmer suporta?
A janela de contexto é de 128K tokens (131.072 tokens). Isso é sustentado pela atenção híbrida do modelo: três camadas de janela deslizante de 2.048 tokens com RoPE seguidas de uma camada de atenção total sem embedding posicional (NoPE).
Formações
Formação SAAS com IA
Tire usas ideias do papel criando softwares com IA, integre pagamentos e lance seu projeto!
- 291 aulas
- 18 projetos
- 24h 17min
Blog | Mais populares

As diferenças de var, let e const

Como fazer redirecionamento com PHP
Neste artigo você vai aprender a como fazer redirecionamento com PHP, utilizaremos abordagens fáceis de entender e de aplicar Fala programador(a), beleza? Bora aprender mais […]

ChatGPT: o que é, como usar, dicas e como acessar login
ChatGPT é uma ferramenta de processamento de linguagem natural (NLP) baseada na arquitetura GPT-3.5, desenvolvida pela OpenAI. Sua criação representa um marco significativo no campo […]
