GLM-5.3-Flash ou Claude Opus 4.8: em quais tarefas vale pagar mais?

comparação de preço e tarefas entre GLM-5.3-Flash e Claude Opus 4.8
Resposta rápida

GLM-5.3-Flash vs Claude Opus 4.8 é menos um duelo de benchmark e mais uma decisão por tipo de tarefa. O GLM-5.3-Flash, lançado pela Z.ai em 26 de agosto de 2026 com pesos abertos sob licença MIT, custa US$ 0,15 por milhão de tokens de entrada e US$ 0,50 de saída, contra US$ 5 e US$ 25 do Opus 4.8 na API da Anthropic. Na prática: delegue volume, boilerplate, testes e leitura de base grande ao modelo barato, e guarde o Opus para tarefa longa de código, debugging cabeludo e decisão de arquitetura, onde erro silencioso custa mais caro que token 🙂

Um milhão de tokens de saída sai por US$ 0,50 no GLM-5.3-Flash e por US$ 25 no Claude Opus 4.8

Mesmo com essa distância toda, a resposta certa não é "usa o barato sempre"

Fala aí, beleza? A Z.ai soltou no dia 26 de agosto de 2026 o GLM-5.3-Flash, o primeiro modelo nativamente multimodal da família GLM-5, que antes circulou de forma anônima como "Ox Alpha", segundo o anúncio da própria Z.ai

Ele veio com licença MIT e pesos abertos publicados no Hugging Face, ou seja: dá pra usar na API deles, dá pra usar em roteador e dá pra rodar fora da casa da Z.ai também

Antes de seguir, um aviso pra ninguém se perder: o Claude Opus 4.8 NÃO é mais o topo de linha da Anthropic

O Claude Opus 5 foi lançado em 24 de julho de 2026, pelo mesmo preço de US$ 5 e US$ 25 por milhão, é o modelo padrão do plano Max e o mais forte disponível no Pro, e lidera o Artificial Analysis Intelligence Index com 63,0 pontos, contra 61,4 do 4.8

O 4.8 segue na API como geração anterior, e é justamente ele que a Z.ai colocou na tabela do próprio anúncio, por isso é ele que aparece aqui do lado caro

Como o preço por milhão é o mesmo nos dois Opus, a conta de custo que vem a seguir não muda de forma alguma: o que muda é o quanto de capacidade você leva do lado caro

Então esse post não vai montar placar de benchmark

A pergunta que interessa pra quem já tem o Claude Code aberto o dia inteiro é outra: em QUAL tipo de tarefa a diferença de preço compensa, e em qual ela te cobra o dobro em retrabalho…

Formação Claude Code
Formação Recomendada

Formação Claude Code

Domine Claude Code do absoluto zero até o avançado

  • 120 aulas
  • 4 projetos
  • 9h 45min

GLM-5.3-Flash e Claude Opus 4.8 lado a lado

Item GLM-5.3-Flash Claude Opus 4.8
Entrada (por milhão de tokens) US$ 0,15 US$ 5
Saída (por milhão de tokens) US$ 0,50 US$ 25
Entrada em cache US$ 0,03 economia de até 90% no custo de entrada com prompt caching
Promoção de lançamento 50% até 09/09/2026 às 24:00 (UTC+8) sem promoção
Preço no OpenRouter (com o desconto) US$ 0,075 entrada / US$ 0,25 saída não se aplica
Modo rápido não se aplica Fast Mode a US$ 10 / US$ 50, sem suporte ao Batch API
Batch API não se aplica US$ 2,50 entrada / US$ 12,50 saída
Arquitetura MoE de 320B totais com 18B ativos por token (320B-A18B), atenção híbrida esparsa e linear não divulgada
Entradas texto e imagem, saída em texto não se aplica aqui
Janela de contexto 1M de tokens não se aplica aqui
Artificial Analysis Intelligence Index 57 pontos (mediana dos comparáveis: 27) 61,4 pontos
Velocidade medida (API da Z.ai) 48,7 tokens por segundo, abaixo da mediana de 67,0 t/s de pesos abertos de porte parecido, e classificado como muito verboso não medida nesta comparação
Licença e portas de entrada MIT, pesos no Hugging Face, GLM Coding Plan, AI Gateway da Vercel API da Anthropic

Pra referência, já que a geração nova existe: o Claude Opus 5 custa os mesmos US$ 5 de entrada e US$ 25 de saída por milhão e marca 63,0 pontos no mesmo índice

Repara numa coisa antes de olhar benchmark: o preço por token desses modelos muda de geração pra geração e vale entender o que mudou no preço do Opus antes de tomar a decisão só pelo número de hoje

Por que os números de coding não batem entre as duas empresas:

Cada fabricante roda o próprio harness e reporta o próprio número, então comparar as duas tabelas direto é armadilha

A Z.ai reporta pro GLM-5.3-Flash: Terminal-Bench 2.1 em 84,3 (e coloca o Claude Opus 4.8 em 85,0 na mesma tabela), DeepSWE v1.1 em 63,4 (contra 46,2 do GLM-5.2) e AutomationBench em 48,8 (contra 26,2 do GLM-5.2)

As condições estão publicadas no repositório zai-org/GLM-5.3-Flash: o Terminal-Bench 2.1 foi avaliado dentro do Claude Code 2.1.207, com temperature=1.0, top_p=1, max_new_tokens=65536 e timeout de 6h, e o DeepSWE rodou no harness mini-swe-agent, com temperature=0.95, top_p=1.0, timeout de 6h e contexto de 400K

Já a Anthropic reportou, no anúncio do Opus 4.8: SWE-bench Pro 69,2% (contra 64,3% do Opus 4.7), SWE-bench Verified 88,6%, Terminal-Bench 2.1 74,6% e OSWorld-Verified 83,4%

Olha o Terminal-Bench 2.1 nas duas tabelas: 85,0 na da Z.ai e 74,6% na da Anthropic, pro MESMO modelo

Não é alguém mentindo, é harness diferente

Por isso o critério aqui vai ser tarefa, não placar 😀

Em que tarefas o modelo barato resolve (e em quais o Opus se paga)

O jeito que eu penso nisso é simples: token é barato, retrabalho é caro

Se a tarefa tem resposta verificável rápido (o teste passa ou não passa, o build quebra ou não quebra), o modelo barato tende a ganhar, porque errar sai barato e você descobre o erro em segundos

Se a tarefa tem erro que só aparece três dias depois em produção, o cálculo vira outro

Delega pro GLM-5.3-Flash:

  • refactor mecânico: renomear, extrair função, padronizar import, aplicar o mesmo ajuste em 40 arquivos
  • boilerplate: CRUD, formulário, config, aquele arquivo que você já escreveu 200 vezes na vida
  • geração de teste em cima de código que já existe e já está decidido
  • tradução de código entre linguagens ou entre frameworks, onde a lógica já está definida e o trabalho é de transposição
  • leitura de base grande: a janela de 1M de tokens deixa você jogar um monte de arquivo dentro e pedir mapa do território
  • classificação e triagem em volume (issue, log, commit, ticket)
  • loop agêntico de alto volume, onde o custo POR RODADA é o que domina a conta no fim do mês
  • tarefa com imagem na entrada, já que ele aceita texto e imagem

Mantém no Claude Opus (4.8 ou 5):

  • tarefa longa de código com muitos passos encadeados, onde o modelo precisa segurar o plano inteiro sem se perder no meio
  • debugging de causa não óbvia, aquele bug que não está onde o stack trace aponta
  • decisão de arquitetura: escolher abordagem, dizer o que NÃO fazer, apontar o custo escondido de um caminho
  • revisão de código, principalmente quando o risco maior é o erro passar em silêncio

Se você está no Max, o Opus que responde por padrão já é o 5, e no Pro ele é o mais forte que tu tem à mão

Se você chama pela API, o 4.8 continua lá como geração anterior, pelo mesmo preço

Esse último ponto da lista é o argumento mais forte que a Anthropic deu pro Opus 4.8: segundo ela, o modelo tem cerca de 4x menos chance que o Opus 4.7 de deixar passar sem comentário falhas no código que ele mesmo escreve

E é exatamente aí que mora o dinheiro

Um modelo que entrega código errado E avisa que tem algo estranho te custa cinco minutos

Um modelo que entrega código errado calado te custa a tarde inteira

A regra prática (e a pegadinha da verbosidade):

Compare o custo do RETRABALHO com o custo do token, nunca o preço por milhão isolado

E tem um detalhe que muita gente esquece: você paga a saída

O Artificial Analysis classifica o GLM-5.3-Flash como muito verboso, e mediu 48,7 tokens por segundo na API da Z.ai, abaixo da mediana de 67,0 t/s de modelos de pesos abertos de porte semelhante

Modelo verboso gera mais token de saída, e token de saída é a parte cara da conta nos dois lados

Ou seja: a economia real quase nunca é a razão bruta entre os preços de tabela

Ainda é uma economia enorme, mas é menor do que a planilha ingênua diz

Se você já organiza seu trabalho pensando em qual modelo usar em cada tarefa, esse raciocínio aqui é a mesma lógica, só que atravessando a fronteira entre dois fornecedores

Como testar o GLM-5.3-Flash sem largar o Claude Code

O caminho de menor atrito é não trocar de ferramenta

A própria documentação da Z.ai descreve como apontar o Claude Code pra API deles

  1. Instale o Claude Code, se ainda não tiver:
npm install -g @anthropic-ai/claude-code
  1. Pegue uma API key da Z.ai na conta que você for usar
  1. Configure as variáveis no arquivo ~/.claude/settings.json, dentro do campo env:
{
  "env": {
    "ANTHROPIC_BASE_URL": "https://api.z.ai/api/anthropic",
    "ANTHROPIC_AUTH_TOKEN": "sua-api-key-da-zai"
  }
}

O erro comum deste passo: mexer no arquivo errado ou deixar vírgula sobrando no JSON, aí o Claude Code simplesmente ignora sua config e você fica achando que a Z.ai está fora do ar

Tome cuidado também com a chave em si, ~/.claude/settings.json é arquivo de config, não é cofre

  1. Se precisar, ajuste o timeout e o mapeamento de modelos: a documentação cita API_TIMEOUT_MS e as variáveis ANTHROPIC_DEFAULT_HAIKU_MODEL, ANTHROPIC_DEFAULT_SONNET_MODEL e ANTHROPIC_DEFAULT_OPUS_MODEL, que é o que decide qual modelo da Z.ai responde quando o Claude Code pede cada tier

O erro comum deste passo: tarefa agêntica longa estourando timeout padrão e você concluindo que o modelo "travou"

  1. Rode uma tarefa de verdade, não um "oi"

Pega aquele refactor chato que você adiou e manda ver

E se você não quiser mexer em config de terminal, tem outras portas de entrada: o GLM Coding Plan (que lista GLM-5.3, GLM-5.3-Flash, GLM-5.2 e GLM-5-Turbo), o AI Gateway da Vercel com o modelo exposto como zai/glm-5.3-flash, ou os pesos MIT no Hugging Face pra quem quer rodar fora da API

O que aprendi testando o Opus na prática (e por que isso muda a conta)

Aqui eu preciso ser honesto com você sobre o que eu tenho e o que eu não tenho

Eu não testei o GLM-5.3-Flash ainda, e o teste completo que eu fiz foi com o Claude Opus 4.5, não com o 4.8 nem com o 5

Mas tem uma coisa daquele teste que vale MUITO pra essa conversa de preço, e o vídeo nem falava de preço

Quando testei, o que me chamou atenção foi o número de prompts até chegar num resultado aceitável

A simulação web de campo de dominós com física saiu em uns três prompts (eu mesmo fiquei na dúvida do número exato)

A cidade 3D com construções, veículos circulando, vista isométrica e até modo de exploração em primeira pessoa parecido com Street View saiu em UM prompt, mesmo com os controles ruins

Cada SVG que eu mostrei foi um prompt só, e eu escolhi de propósito um personagem menos mainstream pra fugir de cidade e lua, que é figura de quadrado, retângulo e círculo que todo modelo já domina

O JRPG estilo Final Fantasy foi o contrário: dois prompts e um resultado que eu achei bem pior que o do concorrente, com batalha ruim, controle trocando de teclado pra mouse e combate que só termina fugindo

No Gemini, em teste anterior, eu estimo ter gastado uns cinco prompts nesse mesmo JRPG, mas é estimativa vaga minha

Sacou onde isso encosta no preço?

Se uma tarefa sai em um prompt no modelo caro e em cinco no barato, o preço por milhão de tokens deixa de ser o número que decide

E o inverso também vale: se a tarefa é mecânica e sai de primeira em qualquer um dos dois, pagar o preço do Opus é queimar dinheiro por conforto

A variável que fecha a conta é PROMPTS ATÉ O RESULTADO ACEITÁVEL, e essa variável você só descobre no seu próprio código

No vídeo acima eu mostro esses testes rodando: dominós com física, a cidade 3D com modo de exploração, os SVGs, o JRPG e a comparação de página de portfólio contra o Gemini 3, onde o Claude veio mais ousado no design mas mal acabado, com fonte estourada, scroll esquisito e botão de voltar ao topo quebrado

Mostro também a leitura dos gráficos oficiais, incluindo o de engenharia de software com eixo cortado, que exagera visualmente uma vantagem pequena

Ah, e o que mais me incomodou no teste foi o limite de uso: bati no teto da conta várias vezes

Veredito: qual escolher em 2026

Se você já paga Opus e usa ele o dia inteiro: delega volume

Refactor mecânico, boilerplate, teste, triagem, loop agêntico repetitivo, leitura de base grande, tudo isso vai pro GLM-5.3-Flash sem dó

Guarda o Opus pro que ele faz melhor: julgamento em tarefa longa, debugging cabeludo, arquitetura e revisão onde o erro silencioso é o risco de verdade

E aqui vale repetir o que eu falei lá no começo: se o seu critério é capacidade máxima, o alvo hoje é o Claude Opus 5, que lidera o Artificial Analysis com 63,0 pontos e custa os mesmos US$ 5 e US$ 25 por milhão do 4.8

No Max ele já é o padrão, e no Pro é o mais forte disponível, enquanto o 4.8 segue na API como geração anterior

Se você paga do próprio bolso e a conta dói: começa pelo GLM-5.3-Flash e só sobe de modelo quando a tarefa provar que precisa

57 pontos no Artificial Analysis Intelligence Index contra 61,4 do Opus 4.8, com esse preço, é uma proposta muito difícil de recusar (e a mediana dos comparáveis é 27, então dá pra dimensionar o tamanho do salto)

O que eu NÃO posso afirmar: os números de coding dos dois lados são auto-reportados, com harness próprio de cada empresa, e eu não rodei teste independente com o GLM-5.3-Flash nem com o Opus 4.8

Conclusão

A decisão entre GLM-5.3-Flash e Claude Opus não se resolve olhando quem tem o número maior na tabela

Se resolve olhando o TIPO da tarefa: mecânica e verificável vai pro barato, julgamento e consequência ficam no caro

E o próximo passo é bem concreto: separa uma tarefa repetitiva real da sua semana, aquela que você faz toda segunda e já sabe de cor

Roda ela nos dois e anota quantos prompts cada um levou até o resultado aceitável

Esse número, e não o preço de tabela, é o que decide a sua conta

Se quiser afinar mais a escolha dentro do terminal, dá uma olhada nos conteúdos de Claude Code aqui do blog também

Me conta nos comentários qual tarefa você migrou pro modelo barato e qual você não teve coragem de tirar do Opus 😀

Até o próximo post!

Perguntas frequentes

Quanto o GLM-5.3-Flash é mais barato que o Claude Opus 4.8 por token?

Na entrada, US$ 0,15 contra US$ 5 por milhão de tokens. Na saída, US$ 0,50 contra US$ 25 por milhão. Com a promoção de lançamento (50% até 09/09/2026 às 24h, UTC+8), o preço no OpenRouter cai ainda mais, para US$ 0,075 de entrada e US$ 0,25 de saída.

O Claude Opus 4.8 ainda é o modelo mais forte da Anthropic?

Não. O Claude Opus 5 foi lançado em 24 de julho de 2026, também a US$ 5 / US$ 25 por milhão, e é o modelo padrão do plano Max e o mais forte no Pro. No Artificial Analysis Intelligence Index, o Opus 5 lidera com 63,0 pontos, contra 61,4 do Opus 4.8, que segue disponível na API como geração anterior.

Dá pra usar o GLM-5.3-Flash dentro do Claude Code?

Dá, segundo a documentação da própria Z.ai. Depois de instalar o Claude Code (npm install -g @anthropic-ai/claude-code), você configura o arquivo ~/.claude/settings.json com ANTHROPIC_BASE_URL=https://api.z.ai/api/anthropic e ANTHROPIC_AUTH_TOKEN com a sua API key da Z.ai. A documentação também cita API_TIMEOUT_MS e os mapeamentos ANTHROPIC_DEFAULT_HAIKU_MODEL, ANTHROPIC_DEFAULT_SONNET_MODEL e ANTHROPIC_DEFAULT_OPUS_MODEL.

O GLM-5.3-Flash aceita imagem como entrada?

Aceita. Ele é o primeiro modelo nativamente multimodal da família GLM-5, com entrada de texto e imagem e saída em texto. Ou seja: dá pra mandar imagem junto do prompt, mas a resposta volta sempre em texto.

Por que o preço do GLM-5.3-Flash aparece diferente no OpenRouter?

Porque o OpenRouter já mostra o modelo com o desconto de lançamento aplicado. O preço de lista na API da Z.ai é US$ 0,15 de entrada e US$ 0,50 de saída por milhão de tokens, mas a promoção de 50% (válida até 09/09/2026 às 24h, UTC+8) derruba isso para US$ 0,075 e US$ 0,25 no roteador.

Vale a pena usar o Batch API do Claude Opus 4.8 pra economizar?

Se a tarefa não precisa de resposta imediata, sim: o Batch API corta o preço pela metade, para US$ 2,50 de entrada e US$ 12,50 de saída por milhão de tokens. Prompt caching soma outra economia, de até 90% no custo de entrada. Só não dá pra combinar Batch com o Fast Mode, que aliás dobra o preço padrão (US$ 10 / US$ 50) e não tem suporte ao Batch API.




Escrito por | Matheus Battisti

Matheus Battisti
Fundador da Hora de Codar

Programador apaixonado pelo mundo das tecnologias, sempre buscando em aprender e se aprofundar em linguagens, frameworks e o que mais for necessário para executar um bom trabalho. Agora tem uma nova missão que é de passar seu conhecimento adiante para formar novos programadores e especializar mais os que já são.

Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares