Muse Glimmer roda no meu Mac ou PC? O que significa “uma única GPU de consumo”

O Muse Glimmer é o modelo aberto da Meta lançado em 10 de agosto de 2026, com pesos no Hugging Face sob licença Apache 2.0 e cerca de 30 bilhões de parâmetros. Em precisão total ele pede mais de 55 GB de memória, mas quantizado em 4 bits o modelo de linguagem cai abaixo de 20 GB e cabe num envelope de 24 GB ou 32 GB, com menos de 1% de queda de acurácia segundo Meta e NVIDIA. Ou seja: roda numa placa só, de desktop de casa, ou num Mac com memória unificada suficiente, sem depender de API na nuvem
Fala aí, beleza? A Meta voltou a soltar peso aberto no dia 10 de agosto de 2026, e dessa vez a promessa não é "o maior modelo do mundo", é algo bem mais interessante pra quem tá lendo isso: rodar na SUA máquina
O Muse Glimmer foi anunciado pelo Meta Superintelligence Labs com os pesos publicados no Hugging Face (meta-models/Muse-Glimmer-30B) e licença Apache 2.0, ou seja, download gratuito dos pesos
Aí vem a pergunta que todo mundo faz antes de gastar 20 e poucos GB de banda: dá ou não dá no meu hardware?
Bora destrinchar isso com os números que a Meta, a NVIDIA e a AMD publicaram, sem achismo 🙂
O que significa "uma única GPU de consumo"
GPU de consumo é aquela placa que vai num desktop normal, de casa, a mesma que roda jogo
E "uma única" é o ponto forte da frase: uma placa só, sem cluster, sem rack, sem servidor com oito aceleradores conversando entre si
Se você conhece a diferença entre subir um site num compartilhado e alugar um datacenter, é mais ou menos isso: a proposta aqui é caber inteiro dentro de UMA peça de hardware que você já tem ou pode comprar
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
E por que o tamanho é o que decide?
Porque o modelo precisa caber na memória da placa pra rodar rápido
Ele tem cerca de 30 bilhões de parâmetros em arquitetura densa (um transformer causal com encoder de percepção próprio pra imagem), foi destilado do Muse Spark, o modelo de fronteira fechado da Meta, aceita texto e imagem na entrada, foi treinado em mais de 100 idiomas e tem janela de contexto de 131.072 tokens (divulgada como 128K+)
Destilação, pra quem não tá familiarizado, é pegar o modelo grandão e treinar um menor pra imitar o comportamento dele
Em precisão total, sem quantização, o model card da Meta fala em mais de 55 GB de memória
É aqui que entra a quantização: em 4 bits (K-Quant) o modelo de linguagem fica abaixo de 20 GB, sobrando espaço pro cache KV, pro encoder de imagem e pro drafter dentro de um envelope de 24 GB ou 32 GB
E a conta de qualidade? Meta e NVIDIA falam em menos de 1% de queda de acurácia pra caber numa GPU única de 24 GB ou 32 GB
Menos de 1% pra sair de 55 GB pra menos de 20 GB é bem massa, convenhamos
Quanta memória cada versão do Muse Glimmer pede
O catálogo do Ollama já publicou as variantes com o peso de download de cada uma
Se liga na diferença brutal entre elas:
| Versão | Download | Contexto | Entrada | Pra que tipo de máquina faz sentido |
|---|---|---|---|---|
muse-glimmer:30b-mlx |
21 GB | 128K | texto e imagem | a que cabe no envelope de 24 GB ou 32 GB, o caminho de quem tem uma placa só |
muse-glimmer:30b-bf16-dflash |
59 GB | 128K | texto e imagem | precisão alta, só faz sentido com memória de sobra bem acima do envelope de consumo |
muse-glimmer:30b-mlx-bf16-dflash |
65 GB | 128K | texto e imagem | a mais pesada da lista, mesma história: memória grande ou nada |
Repara numa coisa importante: download não é a mesma medida que memória de execução, e também não é a mesma conta do "abaixo de 20 GB"
Aquele número da Meta é do modelo de linguagem quantizado em 4 bits, e os 21 GB aqui são o arquivo da variante inteira que o Ollama entrega, medida diferente
Mesmo assim o tamanho do arquivo já te dá o tapa na cara: se ele tem 59 GB, não vai caber numa placa de consumo
A linha que interessa pra maioria das pessoas é a primeira
Roda no meu Mac? E no meu PC com placa NVIDIA ou AMD?
A Meta publicou medições em três frentes, e todas usando o DFlash
Que é DFlash?
É um decodificador especulativo: um modelo drafter leve prevê blocos de 16 tokens de uma vez e o modelo principal verifica o bloco em paralelo, mantendo os acertos e corrigindo os erros
Na prática, ele adianta o trabalho e o modelo grande só confere
Todos os testes abaixo foram com batch 1 e decodificação greedy, então trate como referência de cenário controlado, não como garantia do seu setup
No Mac com Apple Silicon
A Meta rodou os testes em MacBook Pro com M4 Max e M5 Max
No M4 Max: de 23,7 pra 37,8 tokens/s com DFlash
No M5 Max: de 26,6 pra 50,2 tokens/s
No Mac quem faz o papel da VRAM é a memória unificada, então a conta que importa é quanta memória unificada a sua máquina tem disponível pro modelo
Tome cuidado aqui: a Meta mediu em chips topo de linha, então não dá pra assumir que o seu Mac de entrada entrega a mesma coisa
No PC com NVIDIA
A medição publicada foi numa RTX 5090, via llama.cpp: de 74,9 pra 233,4 tokens/s com DFlash, um salto de 3,1x
É o número mais alto da lista, e também a placa mais cara da lista, o que é meio óbvio haha
No PC com AMD
A AMD publicou até 24 tokens/s no Ryzen AI Max+ 395 e até 53 tokens/s numa Radeon AI PRO R9700 com DFlash ativado
E a recomendação da própria AMD pra rodar via LM Studio é sistema com mais de 32 GB de VRAM ou Variable Graphics Memory
Repara que essa é a recomendação da AMD pro caminho dela, com folga acima do envelope de 24 GB ou 32 GB que a Meta cita pra versão em 4 bits: cada fabricante mede a própria casa, então use a régua de quem você vai seguir
Nas três frentes o recado é o mesmo, memória primeiro, velocidade depois
Como baixar e rodar o Muse Glimmer na sua máquina
- Confira sua memória disponível antes de baixar qualquer coisa
No PC é a VRAM da placa, no Mac é a memória unificada
O alvo é o envelope de 24 GB ou 32 GB, que é onde a versão quantizada em 4 bits cabe junto com cache KV, encoder de imagem e drafter
O erro comum deste passo: olhar só o espaço em disco. Disco você tem, o gargalo é a memória
- Baixe e rode a variante MLX pelo Ollama
ollama run muse-glimmer:30b-mlx
Essa é a variante de 21 GB de download, com contexto 128K e entrada de texto e imagem
O erro comum deste passo: escolher a variante bf16 sem ter memória pros 59 GB ou 65 GB. Dá pra ver as opções no catálogo de tags do Ollama antes de puxar o arquivo errado
- Ou vá pelo LM Studio, se você prefere interface
O modelo está disponível pra baixar e rodar dentro do LM Studio
Depois do download ele aparece como opção de modelo local em qualquer sessão nova ou existente
- Escolha o nível de raciocínio conforme a tarefa
O modelo tem quatro níveis de reasoning strength: low, medium, high e xhigh
A orientação publicada é usar high ou xhigh pra código e tarefas agênticas complexas
O erro comum deste passo: deixar tudo no nível mais alto por padrão e reclamar que tá lento. Esforço maior custa tempo
- Se o seu fluxo é outro, o modelo já tem suporte em várias stacks
Hugging Face transformers, Ollama, LM Studio, llama.cpp, MLX, ExecuTorch, vLLM e SGLang
As integrações otimizadas ainda estavam chegando no anúncio, então vale conferir a documentação de cada uma antes de montar seu pipeline em cima
Local ou API na nuvem: o que muda na prática
Aqui tem um detalhe que muita gente passa batido: a Meta não serve o modelo em API própria
Os pesos estão no Hugging Face e quem quiser nuvem depende de terceiros, tipo NVIDIA NIM no build.nvidia.com e Hugging Face Inference Endpoints
Então a escolha não é "API oficial barata versus local trabalhoso"
É hospedar você mesmo ou pagar alguém pra hospedar
Rodando local, os pesos são gratuitos sob Apache 2.0, os dados ficam na sua máquina e a velocidade fica presa ao seu hardware
É a mesma lógica de rodar seu próprio relay: você troca conveniência por controle
E se a sua máquina não fecha a conta, a saída natural é subir isso num servidor alugado, o que abre outra discussão inteira sobre quanta RAM e GPU uma VPS precisa
E a qualidade? Vale o download?
Aqui vale honestidade, porque tem dois lados
A Meta divulgou MCP-Atlas 75,5 (contra 54,2 do Gemma4-31B e 62,5 do Qwen3.6-27B), DeepSearch QA 74,6, Gaia2 43,3 e SWE-Bench Pro 51,2
Números da casa, sempre bom lembrar
O Artificial Analysis colocou o modelo em 35 pontos no Intelligence Index na variante "high", abaixo do Qwen3.6-27B (38) e perto do Kimi K2.5 (36)
Será que isso mata o modelo? Não, mas ajusta a expectativa: ele não tá liderando tudo, ele tá competitivo numa faixa em que também cabe na sua placa
Os casos de uso alvo declarados pela Meta são bem específicos: agentes locais com execução de tarefas em múltiplos passos, chamada de ferramentas (function calling), escrita e depuração de código, e trabalho com arquivos e imagens/screenshots
Ou seja, ele foi feito pra ser o motor de um agente que roda na sua máquina, não pra ganhar concurso de benchmark
Vale rodar o Muse Glimmer na sua máquina?
A resposta curta é a mais chata possível: depende da sua memória
Se você tem 24 GB ou 32 GB disponíveis, a versão quantizada em 4 bits é o caminho, com menos de 1% de queda de acurácia segundo Meta e NVIDIA
Abaixo disso o cenário não fecha com o que foi publicado até agora, e a hospedagem de terceiros vira a alternativa realista
Próximo passo bem concreto: confere quanta memória você tem livre de verdade, começa pela variante de 21 GB no Ollama ou pelo LM Studio, e vai subindo o reasoning strength conforme a tarefa apertar
E olha, os parceiros de otimização de hardware anunciados pela Meta são AMD, Arm, Dell, Intel e NVIDIA
Com essa lista, a tendência é o suporte melhorar nas próximas semanas, então quem ficou de fora agora talvez entre depois…
Bora testar? 😀
até o próximo post!
Perguntas frequentes
Muse Glimmer é gratuito?
Os pesos estão publicados no Hugging Face sob licença Apache 2.0, e o download dos pesos é gratuito. É o mesmo modelo em meta-models/Muse-Glimmer-30B.
Qual a diferença entre o Muse Glimmer e o Muse Spark?
O Muse Glimmer é destilado do Muse Spark, que é o modelo de fronteira fechado da Meta. Destilação é treinar um modelo menor pra imitar o comportamento do grandão, e é assim que o Glimmer chega a rodar em uma única GPU de consumo.
Rodar em 4 bits perde muita qualidade?
Segundo a Meta e a NVIDIA, a queda de acurácia fica abaixo de 1% ao caber numa GPU única de 24 GB ou 32 GB. É uma perda bem pequena considerando que o modelo sai de mais de 55 GB pra menos de 20 GB.
Qual nível de reasoning strength usar pra programar?
O modelo tem quatro níveis: low, medium, high e xhigh. Pra código e tarefas agênticas complexas, o recomendado é high ou xhigh.
O Muse Glimmer tem API oficial da Meta pra rodar na nuvem?
Não. A Meta não serve o modelo em API própria, só publica os pesos no Hugging Face. Quem quer nuvem depende de terceiros, como NVIDIA NIM em build.nvidia.com ou Hugging Face Inference Endpoints.
O modelo entende outros idiomas além de inglês e português?
Sim, ele foi treinado em mais de 100 idiomas. E além de texto, o modelo é multimodal e aceita imagem na entrada.
Formações
Formação SAAS com IA
Tire usas ideias do papel criando softwares com IA, integre pagamentos e lance seu projeto!
- 291 aulas
- 18 projetos
- 24h 17min
Blog | Mais populares
As diferenças de var, let e const
Como fazer redirecionamento com PHP
Neste artigo você vai aprender a como fazer redirecionamento com PHP, utilizaremos abordagens fáceis de entender e de aplicar Fala programador(a), beleza? Bora aprender mais […]
ChatGPT: o que é, como usar, dicas e como acessar login
ChatGPT é uma ferramenta de processamento de linguagem natural (NLP) baseada na arquitetura GPT-3.5, desenvolvida pela OpenAI. Sua criação representa um marco significativo no campo […]
