GLM-5.3-Flash ou Claude Opus 4.8: em quais tarefas vale pagar mais?

GLM-5.3-Flash vs Claude Opus 4.8 é menos um duelo de benchmark e mais uma decisão por tipo de tarefa. O GLM-5.3-Flash, lançado pela Z.ai em 26 de agosto de 2026 com pesos abertos sob licença MIT, custa US$ 0,15 por milhão de tokens de entrada e US$ 0,50 de saída, contra US$ 5 e US$ 25 do Opus 4.8 na API da Anthropic. Na prática: delegue volume, boilerplate, testes e leitura de base grande ao modelo barato, e guarde o Opus para tarefa longa de código, debugging cabeludo e decisão de arquitetura, onde erro silencioso custa mais caro que token 🙂
Um milhão de tokens de saída sai por US$ 0,50 no GLM-5.3-Flash e por US$ 25 no Claude Opus 4.8
Mesmo com essa distância toda, a resposta certa não é "usa o barato sempre"
Fala aí, beleza? A Z.ai soltou no dia 26 de agosto de 2026 o GLM-5.3-Flash, o primeiro modelo nativamente multimodal da família GLM-5, que antes circulou de forma anônima como "Ox Alpha", segundo o anúncio da própria Z.ai
Ele veio com licença MIT e pesos abertos publicados no Hugging Face, ou seja: dá pra usar na API deles, dá pra usar em roteador e dá pra rodar fora da casa da Z.ai também
Antes de seguir, um aviso pra ninguém se perder: o Claude Opus 4.8 NÃO é mais o topo de linha da Anthropic
O Claude Opus 5 foi lançado em 24 de julho de 2026, pelo mesmo preço de US$ 5 e US$ 25 por milhão, é o modelo padrão do plano Max e o mais forte disponível no Pro, e lidera o Artificial Analysis Intelligence Index com 63,0 pontos, contra 61,4 do 4.8
O 4.8 segue na API como geração anterior, e é justamente ele que a Z.ai colocou na tabela do próprio anúncio, por isso é ele que aparece aqui do lado caro
Como o preço por milhão é o mesmo nos dois Opus, a conta de custo que vem a seguir não muda de forma alguma: o que muda é o quanto de capacidade você leva do lado caro
Então esse post não vai montar placar de benchmark
A pergunta que interessa pra quem já tem o Claude Code aberto o dia inteiro é outra: em QUAL tipo de tarefa a diferença de preço compensa, e em qual ela te cobra o dobro em retrabalho…
Formação Claude Code
Domine Claude Code do absoluto zero até o avançado
- 120 aulas
- 4 projetos
- 9h 45min
GLM-5.3-Flash e Claude Opus 4.8 lado a lado
| Item | GLM-5.3-Flash | Claude Opus 4.8 |
|---|---|---|
| Entrada (por milhão de tokens) | US$ 0,15 | US$ 5 |
| Saída (por milhão de tokens) | US$ 0,50 | US$ 25 |
| Entrada em cache | US$ 0,03 | economia de até 90% no custo de entrada com prompt caching |
| Promoção de lançamento | 50% até 09/09/2026 às 24:00 (UTC+8) | sem promoção |
| Preço no OpenRouter (com o desconto) | US$ 0,075 entrada / US$ 0,25 saída | não se aplica |
| Modo rápido | não se aplica | Fast Mode a US$ 10 / US$ 50, sem suporte ao Batch API |
| Batch API | não se aplica | US$ 2,50 entrada / US$ 12,50 saída |
| Arquitetura | MoE de 320B totais com 18B ativos por token (320B-A18B), atenção híbrida esparsa e linear | não divulgada |
| Entradas | texto e imagem, saída em texto | não se aplica aqui |
| Janela de contexto | 1M de tokens | não se aplica aqui |
| Artificial Analysis Intelligence Index | 57 pontos (mediana dos comparáveis: 27) | 61,4 pontos |
| Velocidade medida (API da Z.ai) | 48,7 tokens por segundo, abaixo da mediana de 67,0 t/s de pesos abertos de porte parecido, e classificado como muito verboso | não medida nesta comparação |
| Licença e portas de entrada | MIT, pesos no Hugging Face, GLM Coding Plan, AI Gateway da Vercel | API da Anthropic |
Pra referência, já que a geração nova existe: o Claude Opus 5 custa os mesmos US$ 5 de entrada e US$ 25 de saída por milhão e marca 63,0 pontos no mesmo índice
Repara numa coisa antes de olhar benchmark: o preço por token desses modelos muda de geração pra geração e vale entender o que mudou no preço do Opus antes de tomar a decisão só pelo número de hoje
Por que os números de coding não batem entre as duas empresas:
Cada fabricante roda o próprio harness e reporta o próprio número, então comparar as duas tabelas direto é armadilha
A Z.ai reporta pro GLM-5.3-Flash: Terminal-Bench 2.1 em 84,3 (e coloca o Claude Opus 4.8 em 85,0 na mesma tabela), DeepSWE v1.1 em 63,4 (contra 46,2 do GLM-5.2) e AutomationBench em 48,8 (contra 26,2 do GLM-5.2)
As condições estão publicadas no repositório zai-org/GLM-5.3-Flash: o Terminal-Bench 2.1 foi avaliado dentro do Claude Code 2.1.207, com temperature=1.0, top_p=1, max_new_tokens=65536 e timeout de 6h, e o DeepSWE rodou no harness mini-swe-agent, com temperature=0.95, top_p=1.0, timeout de 6h e contexto de 400K
Já a Anthropic reportou, no anúncio do Opus 4.8: SWE-bench Pro 69,2% (contra 64,3% do Opus 4.7), SWE-bench Verified 88,6%, Terminal-Bench 2.1 74,6% e OSWorld-Verified 83,4%
Olha o Terminal-Bench 2.1 nas duas tabelas: 85,0 na da Z.ai e 74,6% na da Anthropic, pro MESMO modelo
Não é alguém mentindo, é harness diferente
Por isso o critério aqui vai ser tarefa, não placar 😀
Em que tarefas o modelo barato resolve (e em quais o Opus se paga)
O jeito que eu penso nisso é simples: token é barato, retrabalho é caro
Se a tarefa tem resposta verificável rápido (o teste passa ou não passa, o build quebra ou não quebra), o modelo barato tende a ganhar, porque errar sai barato e você descobre o erro em segundos
Se a tarefa tem erro que só aparece três dias depois em produção, o cálculo vira outro
Delega pro GLM-5.3-Flash:
- refactor mecânico: renomear, extrair função, padronizar import, aplicar o mesmo ajuste em 40 arquivos
- boilerplate: CRUD, formulário, config, aquele arquivo que você já escreveu 200 vezes na vida
- geração de teste em cima de código que já existe e já está decidido
- tradução de código entre linguagens ou entre frameworks, onde a lógica já está definida e o trabalho é de transposição
- leitura de base grande: a janela de 1M de tokens deixa você jogar um monte de arquivo dentro e pedir mapa do território
- classificação e triagem em volume (issue, log, commit, ticket)
- loop agêntico de alto volume, onde o custo POR RODADA é o que domina a conta no fim do mês
- tarefa com imagem na entrada, já que ele aceita texto e imagem
Mantém no Claude Opus (4.8 ou 5):
- tarefa longa de código com muitos passos encadeados, onde o modelo precisa segurar o plano inteiro sem se perder no meio
- debugging de causa não óbvia, aquele bug que não está onde o stack trace aponta
- decisão de arquitetura: escolher abordagem, dizer o que NÃO fazer, apontar o custo escondido de um caminho
- revisão de código, principalmente quando o risco maior é o erro passar em silêncio
Se você está no Max, o Opus que responde por padrão já é o 5, e no Pro ele é o mais forte que tu tem à mão
Se você chama pela API, o 4.8 continua lá como geração anterior, pelo mesmo preço
Esse último ponto da lista é o argumento mais forte que a Anthropic deu pro Opus 4.8: segundo ela, o modelo tem cerca de 4x menos chance que o Opus 4.7 de deixar passar sem comentário falhas no código que ele mesmo escreve
E é exatamente aí que mora o dinheiro
Um modelo que entrega código errado E avisa que tem algo estranho te custa cinco minutos
Um modelo que entrega código errado calado te custa a tarde inteira
A regra prática (e a pegadinha da verbosidade):
Compare o custo do RETRABALHO com o custo do token, nunca o preço por milhão isolado
E tem um detalhe que muita gente esquece: você paga a saída
O Artificial Analysis classifica o GLM-5.3-Flash como muito verboso, e mediu 48,7 tokens por segundo na API da Z.ai, abaixo da mediana de 67,0 t/s de modelos de pesos abertos de porte semelhante
Modelo verboso gera mais token de saída, e token de saída é a parte cara da conta nos dois lados
Ou seja: a economia real quase nunca é a razão bruta entre os preços de tabela
Ainda é uma economia enorme, mas é menor do que a planilha ingênua diz
Se você já organiza seu trabalho pensando em qual modelo usar em cada tarefa, esse raciocínio aqui é a mesma lógica, só que atravessando a fronteira entre dois fornecedores
Como testar o GLM-5.3-Flash sem largar o Claude Code
O caminho de menor atrito é não trocar de ferramenta
A própria documentação da Z.ai descreve como apontar o Claude Code pra API deles
- Instale o Claude Code, se ainda não tiver:
npm install -g @anthropic-ai/claude-code
- Pegue uma API key da Z.ai na conta que você for usar
- Configure as variáveis no arquivo
~/.claude/settings.json, dentro do campoenv:
{
"env": {
"ANTHROPIC_BASE_URL": "https://api.z.ai/api/anthropic",
"ANTHROPIC_AUTH_TOKEN": "sua-api-key-da-zai"
}
}
O erro comum deste passo: mexer no arquivo errado ou deixar vírgula sobrando no JSON, aí o Claude Code simplesmente ignora sua config e você fica achando que a Z.ai está fora do ar
Tome cuidado também com a chave em si, ~/.claude/settings.json é arquivo de config, não é cofre
- Se precisar, ajuste o timeout e o mapeamento de modelos: a documentação cita
API_TIMEOUT_MSe as variáveisANTHROPIC_DEFAULT_HAIKU_MODEL,ANTHROPIC_DEFAULT_SONNET_MODELeANTHROPIC_DEFAULT_OPUS_MODEL, que é o que decide qual modelo da Z.ai responde quando o Claude Code pede cada tier
O erro comum deste passo: tarefa agêntica longa estourando timeout padrão e você concluindo que o modelo "travou"
- Rode uma tarefa de verdade, não um "oi"
Pega aquele refactor chato que você adiou e manda ver
E se você não quiser mexer em config de terminal, tem outras portas de entrada: o GLM Coding Plan (que lista GLM-5.3, GLM-5.3-Flash, GLM-5.2 e GLM-5-Turbo), o AI Gateway da Vercel com o modelo exposto como zai/glm-5.3-flash, ou os pesos MIT no Hugging Face pra quem quer rodar fora da API
O que aprendi testando o Opus na prática (e por que isso muda a conta)
Aqui eu preciso ser honesto com você sobre o que eu tenho e o que eu não tenho
Eu não testei o GLM-5.3-Flash ainda, e o teste completo que eu fiz foi com o Claude Opus 4.5, não com o 4.8 nem com o 5
Mas tem uma coisa daquele teste que vale MUITO pra essa conversa de preço, e o vídeo nem falava de preço
Quando testei, o que me chamou atenção foi o número de prompts até chegar num resultado aceitável
A simulação web de campo de dominós com física saiu em uns três prompts (eu mesmo fiquei na dúvida do número exato)
A cidade 3D com construções, veículos circulando, vista isométrica e até modo de exploração em primeira pessoa parecido com Street View saiu em UM prompt, mesmo com os controles ruins
Cada SVG que eu mostrei foi um prompt só, e eu escolhi de propósito um personagem menos mainstream pra fugir de cidade e lua, que é figura de quadrado, retângulo e círculo que todo modelo já domina
O JRPG estilo Final Fantasy foi o contrário: dois prompts e um resultado que eu achei bem pior que o do concorrente, com batalha ruim, controle trocando de teclado pra mouse e combate que só termina fugindo
No Gemini, em teste anterior, eu estimo ter gastado uns cinco prompts nesse mesmo JRPG, mas é estimativa vaga minha
Sacou onde isso encosta no preço?
Se uma tarefa sai em um prompt no modelo caro e em cinco no barato, o preço por milhão de tokens deixa de ser o número que decide
E o inverso também vale: se a tarefa é mecânica e sai de primeira em qualquer um dos dois, pagar o preço do Opus é queimar dinheiro por conforto
A variável que fecha a conta é PROMPTS ATÉ O RESULTADO ACEITÁVEL, e essa variável você só descobre no seu próprio código
No vídeo acima eu mostro esses testes rodando: dominós com física, a cidade 3D com modo de exploração, os SVGs, o JRPG e a comparação de página de portfólio contra o Gemini 3, onde o Claude veio mais ousado no design mas mal acabado, com fonte estourada, scroll esquisito e botão de voltar ao topo quebrado
Mostro também a leitura dos gráficos oficiais, incluindo o de engenharia de software com eixo cortado, que exagera visualmente uma vantagem pequena
Ah, e o que mais me incomodou no teste foi o limite de uso: bati no teto da conta várias vezes
Veredito: qual escolher em 2026
Se você já paga Opus e usa ele o dia inteiro: delega volume
Refactor mecânico, boilerplate, teste, triagem, loop agêntico repetitivo, leitura de base grande, tudo isso vai pro GLM-5.3-Flash sem dó
Guarda o Opus pro que ele faz melhor: julgamento em tarefa longa, debugging cabeludo, arquitetura e revisão onde o erro silencioso é o risco de verdade
E aqui vale repetir o que eu falei lá no começo: se o seu critério é capacidade máxima, o alvo hoje é o Claude Opus 5, que lidera o Artificial Analysis com 63,0 pontos e custa os mesmos US$ 5 e US$ 25 por milhão do 4.8
No Max ele já é o padrão, e no Pro é o mais forte disponível, enquanto o 4.8 segue na API como geração anterior
Se você paga do próprio bolso e a conta dói: começa pelo GLM-5.3-Flash e só sobe de modelo quando a tarefa provar que precisa
57 pontos no Artificial Analysis Intelligence Index contra 61,4 do Opus 4.8, com esse preço, é uma proposta muito difícil de recusar (e a mediana dos comparáveis é 27, então dá pra dimensionar o tamanho do salto)
O que eu NÃO posso afirmar: os números de coding dos dois lados são auto-reportados, com harness próprio de cada empresa, e eu não rodei teste independente com o GLM-5.3-Flash nem com o Opus 4.8
Conclusão
A decisão entre GLM-5.3-Flash e Claude Opus não se resolve olhando quem tem o número maior na tabela
Se resolve olhando o TIPO da tarefa: mecânica e verificável vai pro barato, julgamento e consequência ficam no caro
E o próximo passo é bem concreto: separa uma tarefa repetitiva real da sua semana, aquela que você faz toda segunda e já sabe de cor
Roda ela nos dois e anota quantos prompts cada um levou até o resultado aceitável
Esse número, e não o preço de tabela, é o que decide a sua conta
Se quiser afinar mais a escolha dentro do terminal, dá uma olhada nos conteúdos de Claude Code aqui do blog também
Me conta nos comentários qual tarefa você migrou pro modelo barato e qual você não teve coragem de tirar do Opus 😀
Até o próximo post!
Perguntas frequentes
Quanto o GLM-5.3-Flash é mais barato que o Claude Opus 4.8 por token?
Na entrada, US$ 0,15 contra US$ 5 por milhão de tokens. Na saída, US$ 0,50 contra US$ 25 por milhão. Com a promoção de lançamento (50% até 09/09/2026 às 24h, UTC+8), o preço no OpenRouter cai ainda mais, para US$ 0,075 de entrada e US$ 0,25 de saída.
O Claude Opus 4.8 ainda é o modelo mais forte da Anthropic?
Não. O Claude Opus 5 foi lançado em 24 de julho de 2026, também a US$ 5 / US$ 25 por milhão, e é o modelo padrão do plano Max e o mais forte no Pro. No Artificial Analysis Intelligence Index, o Opus 5 lidera com 63,0 pontos, contra 61,4 do Opus 4.8, que segue disponível na API como geração anterior.
Dá pra usar o GLM-5.3-Flash dentro do Claude Code?
Dá, segundo a documentação da própria Z.ai. Depois de instalar o Claude Code (npm install -g @anthropic-ai/claude-code), você configura o arquivo ~/.claude/settings.json com ANTHROPIC_BASE_URL=https://api.z.ai/api/anthropic e ANTHROPIC_AUTH_TOKEN com a sua API key da Z.ai. A documentação também cita API_TIMEOUT_MS e os mapeamentos ANTHROPIC_DEFAULT_HAIKU_MODEL, ANTHROPIC_DEFAULT_SONNET_MODEL e ANTHROPIC_DEFAULT_OPUS_MODEL.
O GLM-5.3-Flash aceita imagem como entrada?
Aceita. Ele é o primeiro modelo nativamente multimodal da família GLM-5, com entrada de texto e imagem e saída em texto. Ou seja: dá pra mandar imagem junto do prompt, mas a resposta volta sempre em texto.
Por que o preço do GLM-5.3-Flash aparece diferente no OpenRouter?
Porque o OpenRouter já mostra o modelo com o desconto de lançamento aplicado. O preço de lista na API da Z.ai é US$ 0,15 de entrada e US$ 0,50 de saída por milhão de tokens, mas a promoção de 50% (válida até 09/09/2026 às 24h, UTC+8) derruba isso para US$ 0,075 e US$ 0,25 no roteador.
Vale a pena usar o Batch API do Claude Opus 4.8 pra economizar?
Se a tarefa não precisa de resposta imediata, sim: o Batch API corta o preço pela metade, para US$ 2,50 de entrada e US$ 12,50 de saída por milhão de tokens. Prompt caching soma outra economia, de até 90% no custo de entrada. Só não dá pra combinar Batch com o Fast Mode, que aliás dobra o preço padrão (US$ 10 / US$ 50) e não tem suporte ao Batch API.
Formações
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Blog | Mais populares

Como instalar Claude Code: guia completo para iniciantes
Aprenda como instalar Claude Code, autenticar sua conta e usar o /init para configurar seu projeto. Veja requisitos e métodos nativo, Homebrew e WinGet. Pra […]

Claude Code Preço: quanto custa, planos Pro vs Max e API
Conheça detalhadamente o Claude Code preço, incluindo os planos Pro e Max, opções gratuitas, e os valores da API para diferentes níveis de uso e […]

Como gerenciar contexto no Claude Code: tokens, /compact e /clear
Descubra como gerenciar contexto no Claude Code utilizando tokens de modo eficiente, conheça os comandos /compact e /clear e mantenha a alta qualidade das suas […]
