GLM-5.3-Flash no GLM Coding Plan: o que muda no seu fluxo agora?

GLM-5.3-Flash disponível no GLM Coding Plan para uso no Claude Code
Resposta rápida

O GLM-5.3-Flash é o novo modelo da Z.ai, anunciado em 26 de agosto de 2026, primeiro nativamente multimodal da família GLM-5: MoE 320B-A18B, janela de 1M de tokens e pesos abertos sob licença MIT. Se você já assina o GLM Coding Plan, ele aparece em Lite, Pro e Max sem custo extra e rende 3x a quota utilizável do GLM-5.3 no mesmo tier. A documentação da Z.ai descreve como apontar o Claude Code para ele via ~/.claude/settings.json. Antes de migrar tarefa crítica, vale olhar as ressalvas: o Artificial Analysis classifica o modelo como lento e muito verboso

Você abriu o terminal hoje e tinha um modelo novo esperando na lista, sem pagar um centavo a mais

A Z.ai anunciou o GLM-5.3-Flash em 26 de agosto de 2026, o primeiro modelo nativamente multimodal da família GLM-5

E ele já chegou disponível pra assinante do GLM Coding Plan em todos os tiers: Lite, Pro e Max

Então a pergunta não é "vale a pena assinar?"

A pergunta é: em que parte do seu fluxo esse modelo entra hoje, e o que tu precisa conferir antes de jogar tarefa crítica nele? Bora destrinchar 🙂

O que é o GLM-5.3-Flash (e por que ele já rodava como "Ox Alpha"):

Se tu acompanha OpenRouter e OpenCode, provavelmente esbarrou num modelo misterioso chamado Ox Alpha circulando por lá antes de qualquer anúncio

Formação Claude Code
Formação Recomendada

Formação Claude Code

Domine Claude Code do absoluto zero até o avançado

  • 116 aulas
  • 4 projetos
  • 9h 23min

Pois é, era ele

A autoria foi confirmada como Z.ai em 26/08/2026, o mesmo dia do lançamento oficial

E a ficha técnica é bem completona:

Item GLM-5.3-Flash
Arquitetura MoE 320B-A18B (320B totais, 18B ativos)
Janela de contexto 1M tokens (1.048.576)
Entrada texto e imagem
Saída texto
Pesos abertos, licença MIT

Repara no MoE: 320B de parâmetros totais, mas só 18B ativos por vez

"E o que isso significa?"

É o mesmo truque que faz um modelo grande responder sem exigir o PC da Nasa em cima de cada token: ele acende só uma fatia dos especialistas por vez, não o modelo inteiro

Daí o "Flash" no nome

E o preço da API, já que os pesos são abertos?

O preço de lista publicado na documentação da Z.ai é assim:

Tipo de token Preço por 1M
Entrada US$ 0,15
Entrada em cache US$ 0,03
Saída US$ 0,50

E tem um desconto promocional de 50% rolando até 9 de setembro de 2026, às 16:00 UTC, que derruba pra US$ 0,075 de entrada, US$ 0,015 de leitura de cache e US$ 0,25 de saída

Mas se liga nisso: isso é referência de posicionamento, não é a sua conta

Quem assina o GLM Coding Plan não paga por token

Esses valores servem só pra tu entender em que faixa a Z.ai colocou o modelo, e o quanto de trabalho ele foi desenhado pra aguentar

O que muda na prática para quem já assina o GLM Coding Plan:

Aqui mora a mudança que realmente mexe no teu dia

O GLM-5.3-Flash rende 3x a quota utilizável do GLM-5.3 dentro do mesmo tier

Mesma assinatura, mesmo valor, três vezes mais chão pra rodar

E tem um detalhe que pega muita gente desprevenida: desde 30 de julho a contabilização deixou de ser por tokens e passou a ser por Credits

Então se tu ainda raciocina "quantos tokens gastei hoje", tá medindo com a régua velha

A janela de pico existe e mexe no teu consumo:

O plano tem horário de pico definido: das 14:00 às 18:00 no fuso UTC+8, de segunda a sexta

Fora dessa janela, e nos fins de semana inteiros, o consumo é de 50% dos pontos padrão

Ou seja: a mesma tarefa custa metade se tu rodar no horário certo

Já me ferrei o suficiente com quota estourada pra saber que isso não é detalhe, é planejamento

Deixa a refatoração gigante agendada pra fora do pico e pronto

Quanto isso rende no que você já paga:

Os preços mensais do plano são estes:

Tier Preço mensal
Lite US$ 18
Pro US$ 80
Max US$ 168

A graça é que o Flash não é exclusividade de tier caro

A própria página do plano lista GLM-5.3, GLM-5.3-Flash, GLM-5.2 e GLM-5-Turbo, e a documentação confirma suporte a GLM-5.3 e GLM-5.3-Flash para Max, Pro e Lite

Quem tá no Lite de US$ 18 ganhou o mesmo modelo novo que quem tá no Max

Muito massa isso

Em que etapas do fluxo acionar o GLM-5.3-Flash:

Não é troca de modelo padrão às cegas

É escolher etapa por etapa, olhando o que a ficha técnica entrega de verdade:

  • Leitura de repositório grande e refatoração ampla: com 1M de tokens de janela, dá pra jogar muito mais arquivo dentro da mesma conversa antes de precisar compactar contexto
  • Tarefa repetitiva e de alto volume: aqui a quota 3x pesa mais que o topo absoluto de inteligência, tipo migração mecânica, ajuste em série, varredura de padrão
  • Trabalho com print de tela ou mockup: o modelo aceita entrada de imagem e devolve texto, então descrever uma tela pra ele deixou de ser só copiar e colar HTML
  • Execução fora do horário de pico: mesmo trabalho, metade dos pontos padrão

Sobre o item do mockup, vale a ressalva: entrada de imagem é capacidade do modelo, e não muda a discussão de qual agente de design usar no seu laptop, que é outra escolha

E ó, escrever bem o pedido continua valendo mais que o modelo da vez

Se tu prompta em português, dá uma olhada em como descrever tarefas para a IA no seu idioma antes de culpar o modelo pelo resultado zoado

E onde ele NÃO é a escolha óbvia?

Aqui entra a parte honesta

O Artificial Analysis, na página viva do modelo, classifica o GLM-5.3-Flash como lento e muito verboso

Então pensa duas vezes em:

  • tarefa sensível a latência, aquele loop curto onde tu fica esperando resposta pra continuar digitando
  • tarefa que exige resposta enxuta, tipo commit message, resumo curto, saída que vai direto pra um script

Modelo verboso em pipeline automatizada é dor de cabeça na certa

Como apontar o Claude Code para o GLM-5.3-Flash:

A documentação da Z.ai descreve o caminho pelo arquivo de configuração do Claude Code

E se tu usa outro agente de código, a própria Z.ai indica que a troca entre modelos é feita dentro do Coding Agent que tu já usa

  1. Abra o arquivo ~/.claude/settings.json

Ele já pode existir com as suas configurações atuais, beleza? Não é pra criar do zero por cima

  1. Adicione ou atualize as variáveis de ambiente, sem substituir o arquivo inteiro
{
  "env": {
    "ANTHROPIC_DEFAULT_HAIKU_MODEL": "glm-5.3-flash[1m]",
    "ANTHROPIC_DEFAULT_SONNET_MODEL": "glm-5.3-flash[1m]",
    "ANTHROPIC_DEFAULT_OPUS_MODEL": "glm-5.3-flash[1m]",
    "CLAUDE_CODE_AUTO_COMPACT_WINDOW": "1000000"
  }
}

O erro comum deste passo é justamente o mais bobo: colar esse bloco por cima e sobrescrever o settings.json inteiro

Aí tu perde tudo que já tinha configurado ali dentro e vai passar a tarde descobrindo por quê

Copia o arquivo antes, sempre

  1. Confira o sufixo [1m] no nome do modelo

Não é enfeite

É ele que habilita o contexto de 1M: o nome vai como glm-5.3-flash[1m], e junto com ele tu configura o parâmetro da janela de compressão

O erro comum aqui é escrever só glm-5.3-flash e ficar sem a janela ampliada, achando que ganhou 1M de contexto quando não ganhou

  1. Confirme o CLAUDE_CODE_AUTO_COMPACT_WINDOW em 1000000

Sem esse valor casado com o sufixo, tu configura metade da história

O que verificar antes de migrar tarefas críticas:

Os números que existem na mesa são estes

O GLM-5.3-Flash marca 57 pontos no Artificial Analysis Intelligence Index v4.1.1, contra uma mediana de 27 entre os modelos avaliados

E esse índice não é um teste só: são 9 avaliações combinadas

  • GDPval-AA v2
  • 𝜏³-Banking
  • Terminal-Bench v2.1
  • SciCode
  • Humanity’s Last Exam
  • GPQA Diamond
  • CritPt
  • AA-Omniscience
  • AA-LCR

A mesma fonte coloca ele entre os líderes de inteligência para modelos de peso aberto de tamanho similar

E a MESMA fonte diz que ele é lento e muito verboso

As duas coisas convivem, não escolhe só a metade que te agrada 😀

O que é alegação da própria empresa:

Importante separar

A Z.ai afirma que o GLM-5.3-Flash supera o GLM-5.2 nos testes reportados por um décimo do preço, e que se aproxima do Claude Opus 4.8 no benchmark interno de código da empresa

Benchmark interno, reportado pela empresa que vende o modelo

Não é motivo pra descartar, mas também não é a mesma coisa que avaliação de terceiro

Eu leio isso como "promissor", não como "pode trocar o padrão hoje"

Checklist pra rodar no SEU repositório:

Antes de mover tarefa crítica, mede essas coisas no teu próprio código:

  • Tempo de resposta: cronometra uma tarefa que tu já conhece bem, porque "lento" no benchmark pode ser aceitável ou insuportável dependendo do teu loop
  • Verbosidade da saída: vê se o diff vem enxuto ou se ele reescreve meio arquivo pra mudar três linhas
  • Consumo de Credits: mesma tarefa, mesmo horário, comparando com o GLM-5.3
  • Aderência às suas instruções: se tu tem regras de projeto, testa se ele respeita ou se atropela
  • Comportamento com contexto cheio: 1M de janela na ficha técnica é uma coisa, qualidade lá pelo fim da janela é outra, e só o teu repo responde isso

Conclusão:

O movimento de baixo risco aqui é bem simples

Usa o GLM-5.3-Flash nas tarefas de volume, onde a quota 3x dentro do mesmo tier faz diferença real

E mantém o GLM-5.3 onde a decisão é cara, aquela mudança que se sair errada tu paga em revisão

Os dois convivem no mesmo tier, então isso não é escolha de casamento, é escolha de ferramenta por tarefa

Próximo passo concreto, e faça o teste antes de mexer no padrão: pega uma tarefa real que tu já conhece o resultado, roda nos dois modelos, fora do horário de pico, e compara resultado e consumo de Credits lado a lado

Com dado do teu repo na mão a decisão fica fácil

até o próximo post! 🙂

Perguntas frequentes

O GLM-5.3-Flash é gratuito para quem já paga o GLM Coding Plan?

Sim, ele está incluso em todos os tiers da assinatura (Lite, Pro e Max), sem cobrança extra por token. O consumo dentro do plano é medido em Credits desde 30 de julho, não mais por token, e o Flash rende 3x a quota utilizável do GLM-5.3 no mesmo tier.

Qual a diferença entre o GLM-5.3-Flash e o GLM-5.3 no dia a dia do plano?

A ficha técnica é a mesma classe: arquitetura MoE 320B-A18B e janela de 1M tokens. A diferença que pesa no bolso da assinatura é a quota: o GLM-5.3-Flash rende 3 vezes mais quota utilizável que o GLM-5.3 dentro do mesmo tier pago.

Até quando vale o desconto de 50% na API do GLM-5.3-Flash?

A promoção vai até 9 de setembro de 2026, às 16:00 UTC. Nesse período o preço cai de US$ 0,15 para US$ 0,075 por 1M de tokens de entrada, de US$ 0,03 para US$ 0,015 na entrada em cache e de US$ 0,50 para US$ 0,25 na saída. Vale lembrar que isso é preço de API, não afeta quem usa via GLM Coding Plan.

O GLM-5.3-Flash consegue analisar print de tela ou imagem?

Sim, ele aceita entrada de texto e imagem, e devolve texto como saída. É o primeiro modelo nativamente multimodal da família GLM-5, então dá pra mandar um mockup ou print junto do prompt.

Preciso trocar de agente de código para usar o GLM-5.3-Flash?

Não. A Z.ai indica que a troca entre GLM-5.3 e GLM-5.3-Flash acontece dentro do próprio Coding Agent que você já usa, em qualquer tier (Lite, Pro ou Max). No caso do Claude Code, isso é feito ajustando variáveis de ambiente no ~/.claude/settings.json.

O ‘Ox Alpha’ que circulava no OpenRouter era mesmo o GLM-5.3-Flash?

Sim. O modelo misterioso chamado Ox Alpha, que apareceu no OpenRouter e no OpenCode antes de qualquer anúncio oficial, teve a autoria confirmada como Z.ai em 26 de agosto de 2026, o mesmo dia do lançamento oficial do GLM-5.3-Flash.



Escrito por | Matheus Battisti

Matheus Battisti
Fundador da Hora de Codar

Programador apaixonado pelo mundo das tecnologias, sempre buscando em aprender e se aprofundar em linguagens, frameworks e o que mais for necessário para executar um bom trabalho. Agora tem uma nova missão que é de passar seu conhecimento adiante para formar novos programadores e especializar mais os que já são.

Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares