O que é o GLM-5.3-Flash, o primeiro modelo nativamente multimodal da série GLM-5?

ilustração do GLM-5.3-Flash, modelo multimodal da série GLM-5
Resposta rápida

O GLM-5.3-Flash é o primeiro modelo nativamente multimodal da série GLM-5, anunciado pela Z.ai em 26 de agosto de 2026, depois de uma semana circulando anonimamente sob o codinome Ox Alpha. É um MoE de 320 bilhões de parâmetros totais e 18 bilhões ativos por token, com janela de 1 milhão de tokens, entrada de texto, imagem e vídeo e saída em texto. Os pesos saíram abertos sob licença MIT no Hugging Face, e o modelo está disponível nos planos Lite, Pro e Max do GLM Coding Plan, com preço de tabela de US$ 0,15 por milhão de tokens de entrada

Fala aí, beleza? Aquele modelo anônimo que passou a primeira semana rodando como Ox Alpha no OpenCode e no OpenRouter finalmente tem nome: GLM-5.3-Flash

A Z.ai revelou o modelo em 26 de agosto de 2026 e posiciona ele como o primeiro nativamente multimodal da família GLM-5, voltado a codificação eficiente e a tarefas de agente de longo horizonte

E não parou no anúncio: os pesos saíram abertos sob licença MIT, no repositório zai-org/GLM-5.3-Flash no Hugging Face 😀

Neste post tu vai entender o que é o GLM-5.3-Flash, o que significa esse tal de "nativamente multimodal" e pra quem o modelo foi liberado

Formação Claude Code
Formação Recomendada

Formação Claude Code

Domine Claude Code do absoluto zero até o avançado

  • 116 aulas
  • 4 projetos
  • 9h 23min

O que significa ser nativamente multimodal na série GLM-5

Aqui vale a parada pra definir o conceito, porque a palavra "multimodal" virou guarda-chuva pra coisas bem diferentes

Um modelo pode virar multimodal por adaptação posterior: nasce só de texto e depois ganha um componente que traduz imagem em algo que ele entende, meio que um puxadinho colado na casa pronta

Já o nativamente multimodal é a casa projetada com o cômodo desde a planta: as modalidades entram no treino desde o começo, não como remendo

É a diferença entre aprender uma segunda língua na infância e aprender aos 40 com tradutor no ouvido, saca?

No caso do GLM-5.3-Flash, o que sustenta essa posição é o corpus: a Z.ai reporta treino em 30 trilhões de tokens multimodais

E se tu quer entender melhor a fronteira entre treinar do zero e ajustar depois, dá uma olhada em o que é post-training, que é justamente o outro lado dessa moeda

Entra imagem e vídeo, sai texto:

Atenção nesse ponto, porque é onde muita gente se ilude

O GLM-5.3-Flash aceita texto, imagem e vídeo como entrada e devolve texto

Ou seja: ele lê o print, lê a gravação, lê o documento e te responde escrevendo

Ele não gera imagem, não gera vídeo, não é isso que a ficha dele promete

Ficha técnica do GLM-5.3-Flash: números e arquitetura

Item GLM-5.3-Flash
Parâmetros MoE 320B totais / 18B ativos por token (320B-A18B)
Roteamento cada token passa por 8 de 288 especialistas
Arquitetura de atenção híbrida: camadas de atenção linear KDA + camadas MLA esparsas NoPE
Janela de contexto 1.048.576 tokens (1M)
Entrada texto, imagem e vídeo
Saída texto
Corpus de treino 30 trilhões de tokens multimodais
Licença dos pesos MIT, publicados no Hugging Face
Artificial Analysis Intelligence Index 57 pontos (GLM-5.3 marca 60 na mesma tabela)

Se liga no que essa mistura de atenção resolve

Contexto longo é caro porque, na atenção tradicional, cada token quer olhar pra todos os outros, e a conta cresce feio conforme o texto engorda

A atenção linear corta esse crescimento, e a esparsa faz o token olhar só pra parte do que veio antes, em vez de tudo

Misturando as duas camadas, dá pra segurar 1 milhão de tokens sem precisar do PC da Nasa embaixo da mesa em cada requisição

O mesmo raciocínio vale pro MoE: são 320 bilhões de parâmetros no total, mas só 18 bilhões acordam por token

Modelo grande no armário, conta menor na hora de rodar 🙂

De Ox Alpha ao anúncio: como o modelo chegou ao público

A linha do tempo é curtinha e explica o burburinho da semana passada

  1. O modelo passou a primeira semana rodando de forma anônima, sob o codinome Ox Alpha, no OpenCode e no OpenRouter
  2. Em 26 de agosto de 2026, a Z.ai revelou que o tal Ox Alpha era o GLM-5.3-Flash e publicou os pesos
  3. Junto do anúncio veio a afirmação de que, nesse período como Ox Alpha, o modelo foi servido integralmente em chips de IA de fabricação chinesa

Um detalhe importante: esse ponto dos chips é afirmação da própria Z.ai, não é medição de terceiro

Eu marco isso porque acho zoado repassar como fato consumado uma alegação que só a fabricante fez, beleza?

Quem acompanhou o modelo ainda no anonimato já tinha visto ele aparecer em comparações do Ox Alpha com outros modelos, antes de qualquer nome oficial na caixa

Para que serve o GLM-5.3-Flash na prática

Pelo posicionamento oficial e pela ficha, os cenários que fazem sentido são estes

  • Codificação eficiente: é o alvo declarado do modelo, e a estrutura MoE com poucos parâmetros ativos por token existe justamente pra baratear esse tipo de uso repetitivo
  • Agentes de longo horizonte: tarefa que roda em muitos passos come contexto que não acaba mais, e 1M de tokens dá fôlego pra segurar histórico, arquivos e logs no mesmo fio
  • Entrada visual no fluxo de dev: print de erro, captura de tela da interface quebrada, gravação de tela reproduzindo o bug, tudo isso entra como imagem ou vídeo e volta como texto
  • Uso local ou autohospedado: os pesos estão abertos sob MIT, então quem tem infraestrutura pode rodar sem depender da API

O que eu NÃO vou fazer aqui é te prometer que ele resolve o teu bug cabeludo melhor que o modelo X ou Y

A pontuação pública que dá pra conferir hoje é a do Artificial Analysis Intelligence Index, e ali ele marca 57 contra 60 do GLM-5.3

O resto depende de teste independente aparecendo nas próximas semanas…

Preço, planos e como acessar o GLM-5.3-Flash

Na API da Z.ai, o preço de tabela é:

  • US$ 0,15 por milhão de tokens de entrada
  • US$ 0,03 por milhão de tokens de entrada em cache
  • US$ 0,50 por milhão de tokens de saída

E tem promoção de lançamento: 50% de desconto até 09/09/2026, 24:00 UTC+8, o que deixa a entrada em US$ 0,075 e a saída em US$ 0,25 por milhão de tokens nesse período

E quem já assina o GLM Coding Plan?

O GLM-5.3-Flash está disponível pros planos Lite, Pro e Max, com a troca de modelo feita dentro do próprio agente de codificação

E tem um detalhe que muda o jogo pra quem usa muito: a cota utilizável dele é 3x a do GLM-5.3

Os detalhes operacionais que dá pra confirmar:

O identificador do modelo na API é glm-5.3-flash

Pra ativar a janela de 1M de tokens, usa o sufixo [1m]:

glm-5.3-flash[1m]

A Z.ai também oferece um endpoint compatível com a API da Anthropic pra usar os modelos GLM em agentes de codificação:

https://api.z.ai/api/anthropic

E pra mandar imagem, o caminho é um bloco de conteúdo do tipo image_url dentro de messages[].content[]:

{
  "model": "glm-5.3-flash",
  "messages": [
    {
      "role": "user",
      "content": [
        {
          "type": "image_url",
          "image_url": {
            "url": "https://seusite.com/print-do-erro.png"
          }
        },
        {
          "type": "text",
          "text": "O que está quebrado nesse print?"
        }
      ]
    }
  ]
}

Tome cuidado com dois pontos aqui

A URL da imagem é o caminho recomendado, mas dá pra passar um Data URL em Base64 no mesmo campo image_url.url

E se tu quer mandar várias imagens, precisa de vários blocos: não adianta empilhar tudo em um só

Fechando o assunto de desempenho: a Z.ai afirma que o GLM-5.3-Flash supera o GLM-5.2 nos benchmarks reportados por ela, e que chega perto do Claude Opus 4.8 no benchmark interno de codificação

De novo: benchmark interno é benchmark da casa, vale como sinal e não como veredito

Vídeo: o cenário dos modelos chineses de código aberto

O GLM-5.3-Flash não caiu do céu, ele entra numa fila de lançamentos abertos vindos da China que tá bem movimentada

Pra pegar o panorama dessa corrida e o tamanho da briga com os modelos de fronteira, dá o play no vídeo abaixo:

Conclusão

Recapitulando o que dá pra afirmar com fonte na mão

O GLM-5.3-Flash é o primeiro modelo nativamente multimodal da série GLM-5, um MoE de 320B totais e 18B ativos, com roteamento por 8 de 288 especialistas, atenção híbrida linear e esparsa, janela de 1M de tokens, entrada de texto, imagem e vídeo, saída em texto e pesos abertos sob licença MIT no Hugging Face

Ele nasceu em público como Ox Alpha e foi revelado em 26 de agosto de 2026

O que ainda depende de verificação independente é o essencial: o quanto ele aguenta em tarefa real de código e de agente, longe dos números reportados pela própria fabricante

O próximo passo é teu: baixar os pesos no Hugging Face pra rodar na tua máquina, testar via API com o identificador glm-5.3-flash ou simplesmente trocar o modelo dentro do GLM Coding Plan enquanto a janela de desconto de 50% tá aberta

Faça o teste e tira a tua conclusão =)

até o próximo post!

Perguntas frequentes

O GLM-5.3-Flash consegue gerar imagem ou vídeo?

Não. Ele aceita texto, imagem e vídeo como entrada, mas a saída é sempre texto. Serve pra ler print de erro, gravação de tela ou documento e responder escrevendo, não pra criar mídia.

Qual a diferença entre o GLM-5.3-Flash e o GLM-5.3?

O GLM-5.3-Flash marca 57 pontos no Artificial Analysis Intelligence Index, contra 60 do GLM-5.3 na mesma tabela. Em compensação, quem assina o GLM Coding Plan tem 3x a cota utilizável do GLM-5.3-Flash em relação ao GLM-5.3, além de ser o único dos dois com entrada multimodal nativa.

O GLM-5.3-Flash é gratuito?

Pela API da Z.ai não, o preço de tabela é US$ 0,15 por milhão de tokens de entrada e US$ 0,50 por milhão de saída, com 50% de desconto até 09/09/2026. Como os pesos são abertos sob licença MIT no Hugging Face, dá pra rodar sem pagar API se tu tiver infraestrutura própria.

Como ativar a janela de contexto de 1 milhão de tokens no GLM-5.3-Flash?

Usa o identificador com o sufixo [1m], ou seja, glm-5.3-flash[1m], ao chamar o modelo na API. O identificador padrão é glm-5.3-flash.

Dá pra usar o GLM-5.3-Flash com ferramentas feitas pra API da Anthropic?

Dá sim, a Z.ai disponibiliza um endpoint compatível com a API da Anthropic em https://api.z.ai/api/anthropic. Isso permite plugar o GLM-5.3-Flash em agentes de codificação já preparados pra esse formato.

Onde baixar os pesos do GLM-5.3-Flash?

Os pesos estão publicados sob licença MIT no repositório zai-org/GLM-5.3-Flash, no Hugging Face. É o mesmo lugar onde a Z.ai revelou, em 26 de agosto de 2026, que o modelo anônimo Ox Alpha era na verdade o GLM-5.3-Flash.




Escrito por | Matheus Battisti

Matheus Battisti
Fundador da Hora de Codar

Programador apaixonado pelo mundo das tecnologias, sempre buscando em aprender e se aprofundar em linguagens, frameworks e o que mais for necessário para executar um bom trabalho. Agora tem uma nova missão que é de passar seu conhecimento adiante para formar novos programadores e especializar mais os que já são.

Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares