O que é o GLM-5.3-Flash, o primeiro modelo nativamente multimodal da série GLM-5?

O GLM-5.3-Flash é o primeiro modelo nativamente multimodal da série GLM-5, anunciado pela Z.ai em 26 de agosto de 2026, depois de uma semana circulando anonimamente sob o codinome Ox Alpha. É um MoE de 320 bilhões de parâmetros totais e 18 bilhões ativos por token, com janela de 1 milhão de tokens, entrada de texto, imagem e vídeo e saída em texto. Os pesos saíram abertos sob licença MIT no Hugging Face, e o modelo está disponível nos planos Lite, Pro e Max do GLM Coding Plan, com preço de tabela de US$ 0,15 por milhão de tokens de entrada
Fala aí, beleza? Aquele modelo anônimo que passou a primeira semana rodando como Ox Alpha no OpenCode e no OpenRouter finalmente tem nome: GLM-5.3-Flash
A Z.ai revelou o modelo em 26 de agosto de 2026 e posiciona ele como o primeiro nativamente multimodal da família GLM-5, voltado a codificação eficiente e a tarefas de agente de longo horizonte
E não parou no anúncio: os pesos saíram abertos sob licença MIT, no repositório zai-org/GLM-5.3-Flash no Hugging Face 😀
Neste post tu vai entender o que é o GLM-5.3-Flash, o que significa esse tal de "nativamente multimodal" e pra quem o modelo foi liberado
Formação Claude Code
Domine Claude Code do absoluto zero até o avançado
- 116 aulas
- 4 projetos
- 9h 23min
O que significa ser nativamente multimodal na série GLM-5
Aqui vale a parada pra definir o conceito, porque a palavra "multimodal" virou guarda-chuva pra coisas bem diferentes
Um modelo pode virar multimodal por adaptação posterior: nasce só de texto e depois ganha um componente que traduz imagem em algo que ele entende, meio que um puxadinho colado na casa pronta
Já o nativamente multimodal é a casa projetada com o cômodo desde a planta: as modalidades entram no treino desde o começo, não como remendo
É a diferença entre aprender uma segunda língua na infância e aprender aos 40 com tradutor no ouvido, saca?
No caso do GLM-5.3-Flash, o que sustenta essa posição é o corpus: a Z.ai reporta treino em 30 trilhões de tokens multimodais
E se tu quer entender melhor a fronteira entre treinar do zero e ajustar depois, dá uma olhada em o que é post-training, que é justamente o outro lado dessa moeda
Entra imagem e vídeo, sai texto:
Atenção nesse ponto, porque é onde muita gente se ilude
O GLM-5.3-Flash aceita texto, imagem e vídeo como entrada e devolve texto
Ou seja: ele lê o print, lê a gravação, lê o documento e te responde escrevendo
Ele não gera imagem, não gera vídeo, não é isso que a ficha dele promete
Ficha técnica do GLM-5.3-Flash: números e arquitetura
| Item | GLM-5.3-Flash |
|---|---|
| Parâmetros | MoE 320B totais / 18B ativos por token (320B-A18B) |
| Roteamento | cada token passa por 8 de 288 especialistas |
| Arquitetura de atenção | híbrida: camadas de atenção linear KDA + camadas MLA esparsas NoPE |
| Janela de contexto | 1.048.576 tokens (1M) |
| Entrada | texto, imagem e vídeo |
| Saída | texto |
| Corpus de treino | 30 trilhões de tokens multimodais |
| Licença dos pesos | MIT, publicados no Hugging Face |
| Artificial Analysis Intelligence Index | 57 pontos (GLM-5.3 marca 60 na mesma tabela) |
Se liga no que essa mistura de atenção resolve
Contexto longo é caro porque, na atenção tradicional, cada token quer olhar pra todos os outros, e a conta cresce feio conforme o texto engorda
A atenção linear corta esse crescimento, e a esparsa faz o token olhar só pra parte do que veio antes, em vez de tudo
Misturando as duas camadas, dá pra segurar 1 milhão de tokens sem precisar do PC da Nasa embaixo da mesa em cada requisição
O mesmo raciocínio vale pro MoE: são 320 bilhões de parâmetros no total, mas só 18 bilhões acordam por token
Modelo grande no armário, conta menor na hora de rodar 🙂
De Ox Alpha ao anúncio: como o modelo chegou ao público
A linha do tempo é curtinha e explica o burburinho da semana passada
- O modelo passou a primeira semana rodando de forma anônima, sob o codinome Ox Alpha, no OpenCode e no OpenRouter
- Em 26 de agosto de 2026, a Z.ai revelou que o tal Ox Alpha era o GLM-5.3-Flash e publicou os pesos
- Junto do anúncio veio a afirmação de que, nesse período como Ox Alpha, o modelo foi servido integralmente em chips de IA de fabricação chinesa
Um detalhe importante: esse ponto dos chips é afirmação da própria Z.ai, não é medição de terceiro
Eu marco isso porque acho zoado repassar como fato consumado uma alegação que só a fabricante fez, beleza?
Quem acompanhou o modelo ainda no anonimato já tinha visto ele aparecer em comparações do Ox Alpha com outros modelos, antes de qualquer nome oficial na caixa
Para que serve o GLM-5.3-Flash na prática
Pelo posicionamento oficial e pela ficha, os cenários que fazem sentido são estes
- Codificação eficiente: é o alvo declarado do modelo, e a estrutura MoE com poucos parâmetros ativos por token existe justamente pra baratear esse tipo de uso repetitivo
- Agentes de longo horizonte: tarefa que roda em muitos passos come contexto que não acaba mais, e 1M de tokens dá fôlego pra segurar histórico, arquivos e logs no mesmo fio
- Entrada visual no fluxo de dev: print de erro, captura de tela da interface quebrada, gravação de tela reproduzindo o bug, tudo isso entra como imagem ou vídeo e volta como texto
- Uso local ou autohospedado: os pesos estão abertos sob MIT, então quem tem infraestrutura pode rodar sem depender da API
O que eu NÃO vou fazer aqui é te prometer que ele resolve o teu bug cabeludo melhor que o modelo X ou Y
A pontuação pública que dá pra conferir hoje é a do Artificial Analysis Intelligence Index, e ali ele marca 57 contra 60 do GLM-5.3
O resto depende de teste independente aparecendo nas próximas semanas…
Preço, planos e como acessar o GLM-5.3-Flash
Na API da Z.ai, o preço de tabela é:
- US$ 0,15 por milhão de tokens de entrada
- US$ 0,03 por milhão de tokens de entrada em cache
- US$ 0,50 por milhão de tokens de saída
E tem promoção de lançamento: 50% de desconto até 09/09/2026, 24:00 UTC+8, o que deixa a entrada em US$ 0,075 e a saída em US$ 0,25 por milhão de tokens nesse período
E quem já assina o GLM Coding Plan?
O GLM-5.3-Flash está disponível pros planos Lite, Pro e Max, com a troca de modelo feita dentro do próprio agente de codificação
E tem um detalhe que muda o jogo pra quem usa muito: a cota utilizável dele é 3x a do GLM-5.3
Os detalhes operacionais que dá pra confirmar:
O identificador do modelo na API é glm-5.3-flash
Pra ativar a janela de 1M de tokens, usa o sufixo [1m]:
glm-5.3-flash[1m]
A Z.ai também oferece um endpoint compatível com a API da Anthropic pra usar os modelos GLM em agentes de codificação:
https://api.z.ai/api/anthropic
E pra mandar imagem, o caminho é um bloco de conteúdo do tipo image_url dentro de messages[].content[]:
{
"model": "glm-5.3-flash",
"messages": [
{
"role": "user",
"content": [
{
"type": "image_url",
"image_url": {
"url": "https://seusite.com/print-do-erro.png"
}
},
{
"type": "text",
"text": "O que está quebrado nesse print?"
}
]
}
]
}
Tome cuidado com dois pontos aqui
A URL da imagem é o caminho recomendado, mas dá pra passar um Data URL em Base64 no mesmo campo image_url.url
E se tu quer mandar várias imagens, precisa de vários blocos: não adianta empilhar tudo em um só
Fechando o assunto de desempenho: a Z.ai afirma que o GLM-5.3-Flash supera o GLM-5.2 nos benchmarks reportados por ela, e que chega perto do Claude Opus 4.8 no benchmark interno de codificação
De novo: benchmark interno é benchmark da casa, vale como sinal e não como veredito
Vídeo: o cenário dos modelos chineses de código aberto
O GLM-5.3-Flash não caiu do céu, ele entra numa fila de lançamentos abertos vindos da China que tá bem movimentada
Pra pegar o panorama dessa corrida e o tamanho da briga com os modelos de fronteira, dá o play no vídeo abaixo:
Conclusão
Recapitulando o que dá pra afirmar com fonte na mão
O GLM-5.3-Flash é o primeiro modelo nativamente multimodal da série GLM-5, um MoE de 320B totais e 18B ativos, com roteamento por 8 de 288 especialistas, atenção híbrida linear e esparsa, janela de 1M de tokens, entrada de texto, imagem e vídeo, saída em texto e pesos abertos sob licença MIT no Hugging Face
Ele nasceu em público como Ox Alpha e foi revelado em 26 de agosto de 2026
O que ainda depende de verificação independente é o essencial: o quanto ele aguenta em tarefa real de código e de agente, longe dos números reportados pela própria fabricante
O próximo passo é teu: baixar os pesos no Hugging Face pra rodar na tua máquina, testar via API com o identificador glm-5.3-flash ou simplesmente trocar o modelo dentro do GLM Coding Plan enquanto a janela de desconto de 50% tá aberta
Faça o teste e tira a tua conclusão =)
até o próximo post!
Perguntas frequentes
O GLM-5.3-Flash consegue gerar imagem ou vídeo?
Não. Ele aceita texto, imagem e vídeo como entrada, mas a saída é sempre texto. Serve pra ler print de erro, gravação de tela ou documento e responder escrevendo, não pra criar mídia.
Qual a diferença entre o GLM-5.3-Flash e o GLM-5.3?
O GLM-5.3-Flash marca 57 pontos no Artificial Analysis Intelligence Index, contra 60 do GLM-5.3 na mesma tabela. Em compensação, quem assina o GLM Coding Plan tem 3x a cota utilizável do GLM-5.3-Flash em relação ao GLM-5.3, além de ser o único dos dois com entrada multimodal nativa.
O GLM-5.3-Flash é gratuito?
Pela API da Z.ai não, o preço de tabela é US$ 0,15 por milhão de tokens de entrada e US$ 0,50 por milhão de saída, com 50% de desconto até 09/09/2026. Como os pesos são abertos sob licença MIT no Hugging Face, dá pra rodar sem pagar API se tu tiver infraestrutura própria.
Como ativar a janela de contexto de 1 milhão de tokens no GLM-5.3-Flash?
Usa o identificador com o sufixo [1m], ou seja, glm-5.3-flash[1m], ao chamar o modelo na API. O identificador padrão é glm-5.3-flash.
Dá pra usar o GLM-5.3-Flash com ferramentas feitas pra API da Anthropic?
Dá sim, a Z.ai disponibiliza um endpoint compatível com a API da Anthropic em https://api.z.ai/api/anthropic. Isso permite plugar o GLM-5.3-Flash em agentes de codificação já preparados pra esse formato.
Onde baixar os pesos do GLM-5.3-Flash?
Os pesos estão publicados sob licença MIT no repositório zai-org/GLM-5.3-Flash, no Hugging Face. É o mesmo lugar onde a Z.ai revelou, em 26 de agosto de 2026, que o modelo anônimo Ox Alpha era na verdade o GLM-5.3-Flash.
Formações
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Blog | Mais populares
GLM-5.3-Flash no GLM Coding Plan: o que muda no seu fluxo agora?
GLM-5.3-Flash chegou ao GLM Coding Plan (Lite, Pro e Max) sem custo extra e rende 3x mais quota. Veja como ativar no Claude Code e as ressalvas.
GLM-5.3 é open source? Entenda a diferença para open-weights e quando os pesos serão liberados
GLM-5.3 open weights significa acesso aos pesos sob MIT, mas nao e open-source completo. Saiba quando os 743B parametros serao liberados pela Z.ai (previsto 28/08/2026).
O que é post-training e como o GLM-5.3 melhorou sem trocar de modelo
Post-training GLM-5.3: como a Z.ai melhorou o modelo sem trocar arquitetura, atingindo 48.2 pontos no AutomationBench com refinamento pos-treino.
