Muse Glimmer roda no meu Mac ou PC? O que significa “uma única GPU de consumo”

Muse Glimmer rodando em GPU de consumo única no Mac ou PC
Resposta rápida

O Muse Glimmer é o modelo aberto da Meta lançado em 10 de agosto de 2026, com pesos no Hugging Face sob licença Apache 2.0 e cerca de 30 bilhões de parâmetros. Em precisão total ele pede mais de 55 GB de memória, mas quantizado em 4 bits o modelo de linguagem cai abaixo de 20 GB e cabe num envelope de 24 GB ou 32 GB, com menos de 1% de queda de acurácia segundo Meta e NVIDIA. Ou seja: roda numa placa só, de desktop de casa, ou num Mac com memória unificada suficiente, sem depender de API na nuvem

Fala aí, beleza? A Meta voltou a soltar peso aberto no dia 10 de agosto de 2026, e dessa vez a promessa não é "o maior modelo do mundo", é algo bem mais interessante pra quem tá lendo isso: rodar na SUA máquina

O Muse Glimmer foi anunciado pelo Meta Superintelligence Labs com os pesos publicados no Hugging Face (meta-models/Muse-Glimmer-30B) e licença Apache 2.0, ou seja, download gratuito dos pesos

Aí vem a pergunta que todo mundo faz antes de gastar 20 e poucos GB de banda: dá ou não dá no meu hardware?

Bora destrinchar isso com os números que a Meta, a NVIDIA e a AMD publicaram, sem achismo 🙂

O que significa "uma única GPU de consumo"

GPU de consumo é aquela placa que vai num desktop normal, de casa, a mesma que roda jogo

E "uma única" é o ponto forte da frase: uma placa só, sem cluster, sem rack, sem servidor com oito aceleradores conversando entre si

Se você conhece a diferença entre subir um site num compartilhado e alugar um datacenter, é mais ou menos isso: a proposta aqui é caber inteiro dentro de UMA peça de hardware que você já tem ou pode comprar

Formação Vibe Coding
Formação Recomendada

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

E por que o tamanho é o que decide?

Porque o modelo precisa caber na memória da placa pra rodar rápido

Ele tem cerca de 30 bilhões de parâmetros em arquitetura densa (um transformer causal com encoder de percepção próprio pra imagem), foi destilado do Muse Spark, o modelo de fronteira fechado da Meta, aceita texto e imagem na entrada, foi treinado em mais de 100 idiomas e tem janela de contexto de 131.072 tokens (divulgada como 128K+)

Destilação, pra quem não tá familiarizado, é pegar o modelo grandão e treinar um menor pra imitar o comportamento dele

Em precisão total, sem quantização, o model card da Meta fala em mais de 55 GB de memória

É aqui que entra a quantização: em 4 bits (K-Quant) o modelo de linguagem fica abaixo de 20 GB, sobrando espaço pro cache KV, pro encoder de imagem e pro drafter dentro de um envelope de 24 GB ou 32 GB

E a conta de qualidade? Meta e NVIDIA falam em menos de 1% de queda de acurácia pra caber numa GPU única de 24 GB ou 32 GB

Menos de 1% pra sair de 55 GB pra menos de 20 GB é bem massa, convenhamos

Quanta memória cada versão do Muse Glimmer pede

O catálogo do Ollama já publicou as variantes com o peso de download de cada uma

Se liga na diferença brutal entre elas:

VersãoDownloadContextoEntradaPra que tipo de máquina faz sentido
muse-glimmer:30b-mlx21 GB128Ktexto e imagema que cabe no envelope de 24 GB ou 32 GB, o caminho de quem tem uma placa só
muse-glimmer:30b-bf16-dflash59 GB128Ktexto e imagemprecisão alta, só faz sentido com memória de sobra bem acima do envelope de consumo
muse-glimmer:30b-mlx-bf16-dflash65 GB128Ktexto e imagema mais pesada da lista, mesma história: memória grande ou nada

Repara numa coisa importante: download não é a mesma medida que memória de execução, e também não é a mesma conta do "abaixo de 20 GB"

Aquele número da Meta é do modelo de linguagem quantizado em 4 bits, e os 21 GB aqui são o arquivo da variante inteira que o Ollama entrega, medida diferente

Mesmo assim o tamanho do arquivo já te dá o tapa na cara: se ele tem 59 GB, não vai caber numa placa de consumo

A linha que interessa pra maioria das pessoas é a primeira

Roda no meu Mac? E no meu PC com placa NVIDIA ou AMD?

A Meta publicou medições em três frentes, e todas usando o DFlash

Que é DFlash?

É um decodificador especulativo: um modelo drafter leve prevê blocos de 16 tokens de uma vez e o modelo principal verifica o bloco em paralelo, mantendo os acertos e corrigindo os erros

Na prática, ele adianta o trabalho e o modelo grande só confere

Todos os testes abaixo foram com batch 1 e decodificação greedy, então trate como referência de cenário controlado, não como garantia do seu setup

No Mac com Apple Silicon

A Meta rodou os testes em MacBook Pro com M4 Max e M5 Max

No M4 Max: de 23,7 pra 37,8 tokens/s com DFlash

No M5 Max: de 26,6 pra 50,2 tokens/s

No Mac quem faz o papel da VRAM é a memória unificada, então a conta que importa é quanta memória unificada a sua máquina tem disponível pro modelo

Tome cuidado aqui: a Meta mediu em chips topo de linha, então não dá pra assumir que o seu Mac de entrada entrega a mesma coisa

No PC com NVIDIA

A medição publicada foi numa RTX 5090, via llama.cpp: de 74,9 pra 233,4 tokens/s com DFlash, um salto de 3,1x

É o número mais alto da lista, e também a placa mais cara da lista, o que é meio óbvio haha

No PC com AMD

A AMD publicou até 24 tokens/s no Ryzen AI Max+ 395 e até 53 tokens/s numa Radeon AI PRO R9700 com DFlash ativado

E a recomendação da própria AMD pra rodar via LM Studio é sistema com mais de 32 GB de VRAM ou Variable Graphics Memory

Repara que essa é a recomendação da AMD pro caminho dela, com folga acima do envelope de 24 GB ou 32 GB que a Meta cita pra versão em 4 bits: cada fabricante mede a própria casa, então use a régua de quem você vai seguir

Nas três frentes o recado é o mesmo, memória primeiro, velocidade depois

Como baixar e rodar o Muse Glimmer na sua máquina

  1. Confira sua memória disponível antes de baixar qualquer coisa

No PC é a VRAM da placa, no Mac é a memória unificada

O alvo é o envelope de 24 GB ou 32 GB, que é onde a versão quantizada em 4 bits cabe junto com cache KV, encoder de imagem e drafter

O erro comum deste passo: olhar só o espaço em disco. Disco você tem, o gargalo é a memória

  1. Baixe e rode a variante MLX pelo Ollama
ollama run muse-glimmer:30b-mlx

Essa é a variante de 21 GB de download, com contexto 128K e entrada de texto e imagem

O erro comum deste passo: escolher a variante bf16 sem ter memória pros 59 GB ou 65 GB. Dá pra ver as opções no catálogo de tags do Ollama antes de puxar o arquivo errado

  1. Ou vá pelo LM Studio, se você prefere interface

O modelo está disponível pra baixar e rodar dentro do LM Studio

Depois do download ele aparece como opção de modelo local em qualquer sessão nova ou existente

  1. Escolha o nível de raciocínio conforme a tarefa

O modelo tem quatro níveis de reasoning strength: low, medium, high e xhigh

A orientação publicada é usar high ou xhigh pra código e tarefas agênticas complexas

O erro comum deste passo: deixar tudo no nível mais alto por padrão e reclamar que tá lento. Esforço maior custa tempo

  1. Se o seu fluxo é outro, o modelo já tem suporte em várias stacks

Hugging Face transformers, Ollama, LM Studio, llama.cpp, MLX, ExecuTorch, vLLM e SGLang

As integrações otimizadas ainda estavam chegando no anúncio, então vale conferir a documentação de cada uma antes de montar seu pipeline em cima

Local ou API na nuvem: o que muda na prática

Aqui tem um detalhe que muita gente passa batido: a Meta não serve o modelo em API própria

Os pesos estão no Hugging Face e quem quiser nuvem depende de terceiros, tipo NVIDIA NIM no build.nvidia.com e Hugging Face Inference Endpoints

Então a escolha não é "API oficial barata versus local trabalhoso"

É hospedar você mesmo ou pagar alguém pra hospedar

Rodando local, os pesos são gratuitos sob Apache 2.0, os dados ficam na sua máquina e a velocidade fica presa ao seu hardware

É a mesma lógica de rodar seu próprio relay: você troca conveniência por controle

E se a sua máquina não fecha a conta, a saída natural é subir isso num servidor alugado, o que abre outra discussão inteira sobre quanta RAM e GPU uma VPS precisa

E a qualidade? Vale o download?

Aqui vale honestidade, porque tem dois lados

A Meta divulgou MCP-Atlas 75,5 (contra 54,2 do Gemma4-31B e 62,5 do Qwen3.6-27B), DeepSearch QA 74,6, Gaia2 43,3 e SWE-Bench Pro 51,2

Números da casa, sempre bom lembrar

O Artificial Analysis colocou o modelo em 35 pontos no Intelligence Index na variante "high", abaixo do Qwen3.6-27B (38) e perto do Kimi K2.5 (36)

Será que isso mata o modelo? Não, mas ajusta a expectativa: ele não tá liderando tudo, ele tá competitivo numa faixa em que também cabe na sua placa

Os casos de uso alvo declarados pela Meta são bem específicos: agentes locais com execução de tarefas em múltiplos passos, chamada de ferramentas (function calling), escrita e depuração de código, e trabalho com arquivos e imagens/screenshots

Ou seja, ele foi feito pra ser o motor de um agente que roda na sua máquina, não pra ganhar concurso de benchmark

Vale rodar o Muse Glimmer na sua máquina?

A resposta curta é a mais chata possível: depende da sua memória

Se você tem 24 GB ou 32 GB disponíveis, a versão quantizada em 4 bits é o caminho, com menos de 1% de queda de acurácia segundo Meta e NVIDIA

Abaixo disso o cenário não fecha com o que foi publicado até agora, e a hospedagem de terceiros vira a alternativa realista

Próximo passo bem concreto: confere quanta memória você tem livre de verdade, começa pela variante de 21 GB no Ollama ou pelo LM Studio, e vai subindo o reasoning strength conforme a tarefa apertar

E olha, os parceiros de otimização de hardware anunciados pela Meta são AMD, Arm, Dell, Intel e NVIDIA

Com essa lista, a tendência é o suporte melhorar nas próximas semanas, então quem ficou de fora agora talvez entre depois…

Bora testar? 😀

até o próximo post!

Perguntas frequentes

Muse Glimmer é gratuito?

Os pesos estão publicados no Hugging Face sob licença Apache 2.0, e o download dos pesos é gratuito. É o mesmo modelo em meta-models/Muse-Glimmer-30B.

Qual a diferença entre o Muse Glimmer e o Muse Spark?

O Muse Glimmer é destilado do Muse Spark, que é o modelo de fronteira fechado da Meta. Destilação é treinar um modelo menor pra imitar o comportamento do grandão, e é assim que o Glimmer chega a rodar em uma única GPU de consumo.

Rodar em 4 bits perde muita qualidade?

Segundo a Meta e a NVIDIA, a queda de acurácia fica abaixo de 1% ao caber numa GPU única de 24 GB ou 32 GB. É uma perda bem pequena considerando que o modelo sai de mais de 55 GB pra menos de 20 GB.

Qual nível de reasoning strength usar pra programar?

O modelo tem quatro níveis: low, medium, high e xhigh. Pra código e tarefas agênticas complexas, o recomendado é high ou xhigh.

O Muse Glimmer tem API oficial da Meta pra rodar na nuvem?

Não. A Meta não serve o modelo em API própria, só publica os pesos no Hugging Face. Quem quer nuvem depende de terceiros, como NVIDIA NIM em build.nvidia.com ou Hugging Face Inference Endpoints.

O modelo entende outros idiomas além de inglês e português?

Sim, ele foi treinado em mais de 100 idiomas. E além de texto, o modelo é multimodal e aceita imagem na entrada.




Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted
Inline Feedbacks
View all comments

Formações

Formação SAAS com IA

Formação SAAS com IA

Tire usas ideias do papel criando softwares com IA, integre pagamentos e lance seu projeto!

  • 291 aulas
  • 18 projetos
  • 24h 17min

Blog | Mais populares