GPT-6 Astra ou GLM: quando o modelo aberto resolve e quando você precisa do caro?

Comparativo GPT-6 Astra ou GLM mostrando diferença de score e preço entre os modelos
Resposta rápida

GPT-6 Astra ou GLM: a decisão não é de ranking, é de tarefa. No Artificial Analysis Intelligence Index o Astra (max) marca 61 e o GLM-5.3 (max) marca 60, um ponto de diferença, enquanto a saída da API custa US$ 50,00 por milhão de tokens no Astra contra US$ 4,40 no GLM-5.3. Para CRUD, refatoração guiada, testes e front-end, o modelo de pesos abertos já entrega. Para cibersegurança em nível Critical, entrada de imagem e sessão longa dentro do Codex, aí o caro se justifica. O melhor critério é rodar a mesma tarefa nos dois e medir tempo e cota

A escolha real nunca foi qual modelo é melhor

foi qual tarefa você está pagando pra resolver

Fala aí, beleza? Em menos de um mês o jogo mudou duas vezes: a Z.ai soltou o GLM-5.3 em 14 de agosto de 2026, posicionado como o modelo de pesos abertos mais forte pra código, e a OpenAI anunciou o GPT-6 Astra em 3 de setembro de 2026, apresentado como seu modelo mais capaz em uso de computador, código, cibersegurança e ciência

E aí vem o problema de decisão que ninguém resolve olhando ranking: os dois estão praticamente empatados em índice de inteligência, e MUITO longe um do outro em preço

Esse post é sobre isso: separar as tarefas em que o aberto já basta das que realmente exigem o caro 🙂

O que a OpenAI e a Z.ai lançaram em 2026

O GPT-6 Astra é o topo da linha da OpenAI hoje

A largada foi meio bagunçada, se liga: veículos como CNBC, Reuters e The Verge publicaram a notícia antes de a página oficial do Astra ficar acessível, e a página entrou no ar depois, no mesmo dia

Detalhe pequeno, mas dá o tom de quão apressada foi a corrida de anúncios em 2026 haha

Do outro lado, o GLM-5.3 não é um modelo novo do zero: ele reaproveita a mesma base Mixture-of-Experts do GLM-5.2, e os ganhos vieram de pós-treino ampliado

E o que é Mixture-of-Experts? É a arquitetura em que o modelo tem um monte de parâmetros no total, mas só ativa uma fatia deles por token. No GLM-5.3 são 753 bilhões de parâmetros totais com 40 bilhões ativos, o que explica como um modelo desse tamanho consegue ser servido a preço de modelo pequeno

Formação Claude Code
Formação Recomendada

Formação Claude Code

Domine Claude Code do absoluto zero até o avançado

  • 120 aulas
  • 4 projetos
  • 9h 45min

Os pesos estão publicados no repositório zai-org/GLM-5.3 no Hugging Face, sob a licença própria GLM-5.3 License (Copyright 2026 Z.AI), que permite usar, copiar, modificar, distribuir, sublicenciar e criar trabalhos derivados

Contexto de mercado que ajuda a entender o movimento: a Zhipu/Z.ai é a primeira empresa de modelos fundacionais de capital aberto, com IPO em Hong Kong em 8 de janeiro de 2026, levantando US$ 558 milhões a uma avaliação de US$ 7,1 bilhões

Ou seja, não é laboratório de fundo de quintal soltando peso aberto por diversão

GPT-6 Astra e GLM-5.3 lado a lado: preço, contexto e inteligência

Item GPT-6 Astra GLM-5.3
Entrada na API (por milhão de tokens) US$ 10,00 US$ 1,40
Saída na API (por milhão de tokens) US$ 50,00 US$ 4,40
Entrada em cache (por milhão de tokens) US$ 1,00 US$ 0,26
Janela de contexto 1.050.000 tokens 1M tokens
Saída máxima 128K tokens não consta na página viva
Modalidades de entrada texto e imagem texto (saída em texto)
Corte de conhecimento 30 de abril de 2026 não divulgado
Parâmetros não divulgado 753B totais, 40B ativos
Pesos abertos não sim, no Hugging Face sob a GLM-5.3 License
Intelligence Index (max) 61 (mediana dos comparáveis: 36) 60 (mediana dos pesos abertos de tamanho similar: 29)
Onde roda API e ChatGPT, como GPT-6 Pro nos planos Pro, Business e Enterprise API, GLM Coding Plan e self-hosting
Variação mais barata / mais cara modo Fast custa 2x o preço padrão GLM-5.3-Flash a US$ 0,15 de entrada e US$ 0,50 de saída

Agora lê a tabela comigo

A diferença de inteligência entre os dois no índice do Artificial Analysis é de 1 ponto (61 contra 60)

A diferença no preço de saída da API é de mais de 11 vezes

E vale registrar: no ranking vivo dos pesos abertos, o GLM-5.3 (max) divide o topo com o Kimi K3 (max), os dois com 60, seguidos pelo Qwen3.8 2.4T A95B com 58. O aberto encostou de vez

Se você curte ver esses modelos brigando em tarefa real em vez de tabela, tem um post aqui sobre o modelo anônimo que resolveu de primeira o DeepSWE que joga na mesma discussão

Quando o modelo aberto resolve: as tarefas em que o GLM-5.3 já basta

Aquele 1 ponto de diferença no índice não vira resultado diferente na maior parte do que a gente faz no dia

Tipos de tarefa em que o GLM-5.3 já entrega o suficiente:

  • CRUD e código de plumbing: rota, model, migration, formulário, validação. Tarefa com resposta conhecida, onde o modelo caro só gasta mais
  • Refatoração guiada: quando você já sabe o que quer e descreve o alvo, o trabalho é de execução, não de descoberta
  • Testes: escrever caso de teste em cima de código existente é leitura mais repetição de padrão
  • Scripts e automação: shell, migração de dados, one-off de terminal
  • Leitura de projeto grande: com 1M de tokens de contexto, dá pra jogar o projeto inteiro pra dentro e pedir mapa de arquitetura antes de mexer em qualquer coisa
  • Front-end e prototipagem: landing page, componente, tela de dashboard. Sai bonito e sai barato

Nos benchmarks divulgados no lançamento, o GLM-5.3 sobe no Terminal-Bench 3.0 de 4,6 para 28,3, no DeepSWE v1.1 de 46,2 para 66,9, e marca 84,5% no CyberGym

E tem um degrau ainda mais barato pra tarefa repetitiva: o GLM-5.3-Flash, com 320B de parâmetros totais e 18B ativos, licença MIT, contexto multimodal de 1M e API a US$ 0,15 de entrada e US$ 0,50 de saída por milhão de tokens

É o modelo que você deixa ligado no trabalho chato enquanto guarda cota do forte pro que importa

Se a dúvida é o contrário (você já paga o caro e quer saber onde ele é desperdício), esse ponto tá destrinchado em quando não usar o GPT-6 Astra

Quando você precisa do modelo caro: o que o GPT-6 Astra faz que o aberto não faz

Agora o outro lado do critério, porque não é tudo empate não

Cibersegurança em nível Critical. O GPT-6 Astra é o primeiro modelo da OpenAI a atingir o nível Critical de capacidade em cibersegurança no Preparedness Framework. Na prática isso significa que, com ferramentas e acesso adequados, o modelo pode encontrar falhas de segurança desconhecidas e desenvolver formas de explorá-las sem orientação humana passo a passo

Isso é outro patamar de autonomia. Se o teu trabalho é análise de segurança ofensiva séria, é capacidade, não preferência

Entrada de imagem. O Astra aceita texto e imagem. O GLM-5.3 principal é texto na entrada e na saída

Então print de erro, mockup de tela, diagrama de arquitetura fotografado no quadro: com o aberto principal, tu não joga isso dentro. (O Flash é multimodal, mas é o irmão menor da família)

Corte de conhecimento em 30 de abril de 2026. Pra stack que mudou recente, isso pesa mais do que benchmark

Sessão longa dentro do Codex. Com o Astra, o Codex ganhou uma forma nova de preservar e recuperar contexto quando a janela enche: em vez de comprimir tudo em um resumo único, o modelo mantém notas entre janelas

E aqui vale separar as coisas, porque muita gente mistura: cibersegurança em nível Critical e entrada de imagem são diferença de capacidade do modelo. A preservação de contexto do Codex é diferença de ferramenta

Uma tu não compra de outro jeito. A outra depende de onde tu roda

O custo escondido não é o token: é a cota

Aqui entra a parte que tabela nenhuma te conta

Quando testei a família GLM dentro do Claude Code, eu não fui de cobrança por token: contratei o plano mensal da própria fornecedora

A configuração dentro do Claude Code é a mesma nos dois casos, mesma chave e mesmo endpoint. O que muda é a conta: ou tu paga por token consumido, ou tu paga assinatura e trabalha dentro de uma cota

E na comparação com Opus, pagar por token pro tipo de uso que eu faço me pareceu pesado demais

Montei um projeto real de ponta a ponta pra valer o teste: um SaaS de estudos com flashcards e quiz gerados por IA, cobrindo front-end, autenticação e integração com IA

Comecei pedindo um PRD e um plano em markdown antes de qualquer linha de código. Quando o modelo não é topo de linha, eu prefiro guiar com documento de produto e ordem técnica em vez de sair pedindo feature solta

O modelo devolveu o PRD e o plano, e ainda deixou cinco decisões em aberto pra eu responder antes de implementar. Massa isso

Aí ele começou a codar o projeto sem eu pedir, e eu cancelei a execução pra não perder o controle das etapas. Particionei os prompts em pedaços menores e bem delimitados, e o resultado melhorou: na etapa seguinte ele respeitou o escopo e parou exatamente onde eu mandei parar

Agora os números que eu acompanhei ao vivo:

  • 16% da cota de 5 horas só na criação do projeto inicial mais a landing page
  • 26 minutos pra entregar a etapa de autenticação
  • 40% da cota já consumida com o projeto ainda longe da metade
  • pra comparar, o scaffolding inicial nos meus testes costuma levar cerca de 10 minutos

A landing page saiu bonita, com flashcards animados e explicação do fluxo, apesar do visual ter aquela cara de padrão de IA

A autenticação funcionou de verdade: criei conta e o login passou no teste

O que mais me incomodou foi a lentidão. Já tinha acontecido no meu teste anterior com GLM, e o consumo de cota nem foi proporcional ao tempo de espera

E é aí que a decisão muda de lugar: a conta da assinatura não estoura por preço de tabela, estoura por sessão longa

Modelo mais lento gasta o teu relógio, e cota medida em janela de tempo é relógio. Se o teu uso é maratona de projeto inteiro, o cálculo de plano contra cobrança por token não é o mesmo de quem usa em rajadas curtas ao longo do dia

Como testar o GLM dentro do Claude Code antes de decidir

Antes de trocar de modelo por opinião de post na internet (inclusive esse aqui haha), roda o teste na tua máquina

  1. Assine o GLM Coding Plan. São três níveis, Lite, Pro e Max, a partir de US$ 18 por mês, com Pro e Max oferecendo 6x e 14x a cota do Lite. A medição é por créditos, com limite semanal de uso, e dá pra pagar mensal, trimestral ou anual. Erro comum deste passo: achar que a assinatura e a cobrança por token da API são a mesma conta. São cobranças separadas
  1. Pegue a chave da Z.ai. É ela que vai no token de autenticação do passo seguinte
  1. Edite o arquivo ~/.claude/settings.json. A configuração oficial define a chave e o endpoint, mais o mapeamento dos modelos:
ANTHROPIC_AUTH_TOKEN=<sua chave da Z.ai>
ANTHROPIC_BASE_URL=https://api.z.ai/api/anthropic
ANTHROPIC_DEFAULT_HAIKU_MODEL=<modelo GLM>
ANTHROPIC_DEFAULT_SONNET_MODEL=<modelo GLM>
ANTHROPIC_DEFAULT_OPUS_MODEL=<modelo GLM>

O formato exato do arquivo e os nomes dos modelos estão na documentação da Z.ai, confere lá antes de colar

  1. Confira o endpoint pela ferramenta que tu usa. Claude Code e Goose usam https://api.z.ai/api/anthropic. As demais ferramentas usam https://api.z.ai/api/coding/paas/v4. Erro comum deste passo: copiar o endpoint de um tutorial de outra ferramenta e ficar batendo cabeça com erro de autenticação que não é de chave, é de URL. Tome cuidado!
  1. Use o mapeamento a teu favor. Foi o que eu fiz no teste: modelo mais forte da família nas tarefas pesadas, modelo mais leve nas tarefas simples, justamente pra não estourar a cota. É o ajuste que mais me economizou plano
  1. Se a ideia é self-hosting, olhe o custo real antes. O checkpoint FP8 oficial pede um nó de 8 GPUs H100 ou mais novas, sendo 8x H200 o patamar indicado pra uso de contexto longo, servido por vLLM ou SGLang. Pesos abertos são liberdade, não são de graça: sem o PC da Nasa (ou a nuvem equivalente), esse caminho não existe

O plano cobre GLM-5.3, GLM-5.3-Flash, GLM-5.2 e GLM-5-Turbo em Claude Code, Codex, ZCode, Kilo Code, Cline, OpenCode e outras ferramentas, funcionando pelos protocolos Anthropic e OpenAI

Veredito: o critério de escolha em uma frase

Aberto como padrão de trabalho, caro como exceção contratada

Quer a versão longa? Se a tarefa tem resposta conhecida e o teu trabalho é descrever bem o que quer (CRUD, refatoração, teste, script, tela, leitura de projeto), o GLM-5.3 resolve e te devolve mais de 11x no preço de saída

Se a tarefa exige autonomia longa sem tua supervisão, análise de segurança de verdade, ou entrada de imagem, aí tu tá comprando capacidade que o aberto principal não tem, e o GPT-6 Astra se paga

E agora o limite honesto desse post: os índices que eu usei são de páginas vivas do Artificial Analysis, que mudam de acordo com as rodadas de teste

Não existe número aqui que substitua o teu projeto. A diferença sentida depende do tipo de código que tu escreve

Conclusão

Recapitulando o critério: a decisão entre GPT-6 Astra ou GLM não sai de ranking, sai do tipo de tarefa que tu tá pagando pra resolver

Um ponto de diferença no índice de inteligência não justifica 11x no preço de saída pra trabalho de rotina, e nenhum desconto do mundo compra nível Critical em cibersegurança ou entrada de imagem

Próximo passo concreto: pega uma tarefa real do teu backlog, roda ela nos dois por uma semana, e anota duas coisas, tempo até a entrega e cota consumida. Foi medindo isso que eu descobri que o meu problema com o GLM não era qualidade de código, era relógio

E fica a lição que vale pros dois lados: com PRD, plano escrito e prompts particionados, a IA vai longe independente do modelo que tu escolher

até o próximo post! 😀

Perguntas frequentes

GPT-6 Astra está disponível no plano Plus do ChatGPT?

Não. O Astra aparece no ChatGPT como GPT-6 Pro e está nos planos Pro, Business e Enterprise. Quem usa o plano Plus no chat não tem acesso a ele.

Qual a diferença entre GLM-5.3 e GLM-5.3-Flash?

O GLM-5.3 tem 753 bilhões de parâmetros totais (40 bilhões ativos) e mira o topo de desempenho. O GLM-5.3-Flash é a versão mais leve, com 320 bilhões de parâmetros totais (18 bilhões ativos), licença MIT e API a US$ 0,15 de entrada e US$ 0,50 de saída por milhão de tokens.

Dá pra rodar o GLM-5.3 dentro do Claude Code?

Dá. O GLM Coding Plan da Z.ai cobre GLM-5.3, GLM-5.3-Flash, GLM-5.2 e GLM-5-Turbo dentro do Claude Code, e funciona pelos protocolos Anthropic e OpenAI. O passo a passo da configuração está na seção sobre como testar o GLM dentro do Claude Code, aqui no post.

Quanto custa a assinatura do GLM Coding Plan?

Os planos começam em US$ 18 por mês no nível Lite, com Pro e Max entregando 6x e 14x a cota do Lite. A medição é por créditos com limite semanal de uso, com opções de cobrança mensal, trimestral e anual.

É possível hospedar o GLM-5.3 na própria infraestrutura?

Sim, os pesos estão publicados no Hugging Face sob a GLM-5.3 License. Mas não é caminho de máquina pessoal: rodar o modelo exige um nó com múltiplas GPUs de data center, como está detalhado na seção sobre como testar o GLM dentro do Claude Code.

O GPT-6 Astra é mais arriscado por causa da capacidade em cibersegurança?

Ele é o primeiro modelo da OpenAI a atingir o nível Critical de capacidade em cibersegurança no Preparedness Framework. Isso significa que, com ferramentas e acesso adequados, ele pode encontrar falhas de segurança desconhecidas e desenvolver formas de explorá-las sem orientação humana passo a passo.




Escrito por | Matheus Battisti

Matheus Battisti
Fundador da Hora de Codar

Programador apaixonado pelo mundo das tecnologias, sempre buscando em aprender e se aprofundar em linguagens, frameworks e o que mais for necessário para executar um bom trabalho. Agora tem uma nova missão que é de passar seu conhecimento adiante para formar novos programadores e especializar mais os que já são.

Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares