GPT-6 Astra ou GLM: quando o modelo aberto resolve e quando você precisa do caro?

GPT-6 Astra ou GLM: a decisão não é de ranking, é de tarefa. No Artificial Analysis Intelligence Index o Astra (max) marca 61 e o GLM-5.3 (max) marca 60, um ponto de diferença, enquanto a saída da API custa US$ 50,00 por milhão de tokens no Astra contra US$ 4,40 no GLM-5.3. Para CRUD, refatoração guiada, testes e front-end, o modelo de pesos abertos já entrega. Para cibersegurança em nível Critical, entrada de imagem e sessão longa dentro do Codex, aí o caro se justifica. O melhor critério é rodar a mesma tarefa nos dois e medir tempo e cota
A escolha real nunca foi qual modelo é melhor
foi qual tarefa você está pagando pra resolver
Fala aí, beleza? Em menos de um mês o jogo mudou duas vezes: a Z.ai soltou o GLM-5.3 em 14 de agosto de 2026, posicionado como o modelo de pesos abertos mais forte pra código, e a OpenAI anunciou o GPT-6 Astra em 3 de setembro de 2026, apresentado como seu modelo mais capaz em uso de computador, código, cibersegurança e ciência
E aí vem o problema de decisão que ninguém resolve olhando ranking: os dois estão praticamente empatados em índice de inteligência, e MUITO longe um do outro em preço
Esse post é sobre isso: separar as tarefas em que o aberto já basta das que realmente exigem o caro 🙂
O que a OpenAI e a Z.ai lançaram em 2026
O GPT-6 Astra é o topo da linha da OpenAI hoje
A largada foi meio bagunçada, se liga: veículos como CNBC, Reuters e The Verge publicaram a notícia antes de a página oficial do Astra ficar acessível, e a página entrou no ar depois, no mesmo dia
Detalhe pequeno, mas dá o tom de quão apressada foi a corrida de anúncios em 2026 haha
Do outro lado, o GLM-5.3 não é um modelo novo do zero: ele reaproveita a mesma base Mixture-of-Experts do GLM-5.2, e os ganhos vieram de pós-treino ampliado
E o que é Mixture-of-Experts? É a arquitetura em que o modelo tem um monte de parâmetros no total, mas só ativa uma fatia deles por token. No GLM-5.3 são 753 bilhões de parâmetros totais com 40 bilhões ativos, o que explica como um modelo desse tamanho consegue ser servido a preço de modelo pequeno
Formação Claude Code
Domine Claude Code do absoluto zero até o avançado
- 120 aulas
- 4 projetos
- 9h 45min
Os pesos estão publicados no repositório zai-org/GLM-5.3 no Hugging Face, sob a licença própria GLM-5.3 License (Copyright 2026 Z.AI), que permite usar, copiar, modificar, distribuir, sublicenciar e criar trabalhos derivados
Contexto de mercado que ajuda a entender o movimento: a Zhipu/Z.ai é a primeira empresa de modelos fundacionais de capital aberto, com IPO em Hong Kong em 8 de janeiro de 2026, levantando US$ 558 milhões a uma avaliação de US$ 7,1 bilhões
Ou seja, não é laboratório de fundo de quintal soltando peso aberto por diversão
GPT-6 Astra e GLM-5.3 lado a lado: preço, contexto e inteligência
| Item | GPT-6 Astra | GLM-5.3 |
|---|---|---|
| Entrada na API (por milhão de tokens) | US$ 10,00 | US$ 1,40 |
| Saída na API (por milhão de tokens) | US$ 50,00 | US$ 4,40 |
| Entrada em cache (por milhão de tokens) | US$ 1,00 | US$ 0,26 |
| Janela de contexto | 1.050.000 tokens | 1M tokens |
| Saída máxima | 128K tokens | não consta na página viva |
| Modalidades de entrada | texto e imagem | texto (saída em texto) |
| Corte de conhecimento | 30 de abril de 2026 | não divulgado |
| Parâmetros | não divulgado | 753B totais, 40B ativos |
| Pesos abertos | não | sim, no Hugging Face sob a GLM-5.3 License |
| Intelligence Index (max) | 61 (mediana dos comparáveis: 36) | 60 (mediana dos pesos abertos de tamanho similar: 29) |
| Onde roda | API e ChatGPT, como GPT-6 Pro nos planos Pro, Business e Enterprise | API, GLM Coding Plan e self-hosting |
| Variação mais barata / mais cara | modo Fast custa 2x o preço padrão | GLM-5.3-Flash a US$ 0,15 de entrada e US$ 0,50 de saída |
Agora lê a tabela comigo
A diferença de inteligência entre os dois no índice do Artificial Analysis é de 1 ponto (61 contra 60)
A diferença no preço de saída da API é de mais de 11 vezes
E vale registrar: no ranking vivo dos pesos abertos, o GLM-5.3 (max) divide o topo com o Kimi K3 (max), os dois com 60, seguidos pelo Qwen3.8 2.4T A95B com 58. O aberto encostou de vez
Se você curte ver esses modelos brigando em tarefa real em vez de tabela, tem um post aqui sobre o modelo anônimo que resolveu de primeira o DeepSWE que joga na mesma discussão
Quando o modelo aberto resolve: as tarefas em que o GLM-5.3 já basta
Aquele 1 ponto de diferença no índice não vira resultado diferente na maior parte do que a gente faz no dia
Tipos de tarefa em que o GLM-5.3 já entrega o suficiente:
- CRUD e código de plumbing: rota, model, migration, formulário, validação. Tarefa com resposta conhecida, onde o modelo caro só gasta mais
- Refatoração guiada: quando você já sabe o que quer e descreve o alvo, o trabalho é de execução, não de descoberta
- Testes: escrever caso de teste em cima de código existente é leitura mais repetição de padrão
- Scripts e automação: shell, migração de dados, one-off de terminal
- Leitura de projeto grande: com 1M de tokens de contexto, dá pra jogar o projeto inteiro pra dentro e pedir mapa de arquitetura antes de mexer em qualquer coisa
- Front-end e prototipagem: landing page, componente, tela de dashboard. Sai bonito e sai barato
Nos benchmarks divulgados no lançamento, o GLM-5.3 sobe no Terminal-Bench 3.0 de 4,6 para 28,3, no DeepSWE v1.1 de 46,2 para 66,9, e marca 84,5% no CyberGym
E tem um degrau ainda mais barato pra tarefa repetitiva: o GLM-5.3-Flash, com 320B de parâmetros totais e 18B ativos, licença MIT, contexto multimodal de 1M e API a US$ 0,15 de entrada e US$ 0,50 de saída por milhão de tokens
É o modelo que você deixa ligado no trabalho chato enquanto guarda cota do forte pro que importa
Se a dúvida é o contrário (você já paga o caro e quer saber onde ele é desperdício), esse ponto tá destrinchado em quando não usar o GPT-6 Astra
Quando você precisa do modelo caro: o que o GPT-6 Astra faz que o aberto não faz
Agora o outro lado do critério, porque não é tudo empate não
Cibersegurança em nível Critical. O GPT-6 Astra é o primeiro modelo da OpenAI a atingir o nível Critical de capacidade em cibersegurança no Preparedness Framework. Na prática isso significa que, com ferramentas e acesso adequados, o modelo pode encontrar falhas de segurança desconhecidas e desenvolver formas de explorá-las sem orientação humana passo a passo
Isso é outro patamar de autonomia. Se o teu trabalho é análise de segurança ofensiva séria, é capacidade, não preferência
Entrada de imagem. O Astra aceita texto e imagem. O GLM-5.3 principal é texto na entrada e na saída
Então print de erro, mockup de tela, diagrama de arquitetura fotografado no quadro: com o aberto principal, tu não joga isso dentro. (O Flash é multimodal, mas é o irmão menor da família)
Corte de conhecimento em 30 de abril de 2026. Pra stack que mudou recente, isso pesa mais do que benchmark
Sessão longa dentro do Codex. Com o Astra, o Codex ganhou uma forma nova de preservar e recuperar contexto quando a janela enche: em vez de comprimir tudo em um resumo único, o modelo mantém notas entre janelas
E aqui vale separar as coisas, porque muita gente mistura: cibersegurança em nível Critical e entrada de imagem são diferença de capacidade do modelo. A preservação de contexto do Codex é diferença de ferramenta
Uma tu não compra de outro jeito. A outra depende de onde tu roda
O custo escondido não é o token: é a cota
Aqui entra a parte que tabela nenhuma te conta
Quando testei a família GLM dentro do Claude Code, eu não fui de cobrança por token: contratei o plano mensal da própria fornecedora
A configuração dentro do Claude Code é a mesma nos dois casos, mesma chave e mesmo endpoint. O que muda é a conta: ou tu paga por token consumido, ou tu paga assinatura e trabalha dentro de uma cota
E na comparação com Opus, pagar por token pro tipo de uso que eu faço me pareceu pesado demais
Montei um projeto real de ponta a ponta pra valer o teste: um SaaS de estudos com flashcards e quiz gerados por IA, cobrindo front-end, autenticação e integração com IA
Comecei pedindo um PRD e um plano em markdown antes de qualquer linha de código. Quando o modelo não é topo de linha, eu prefiro guiar com documento de produto e ordem técnica em vez de sair pedindo feature solta
O modelo devolveu o PRD e o plano, e ainda deixou cinco decisões em aberto pra eu responder antes de implementar. Massa isso
Aí ele começou a codar o projeto sem eu pedir, e eu cancelei a execução pra não perder o controle das etapas. Particionei os prompts em pedaços menores e bem delimitados, e o resultado melhorou: na etapa seguinte ele respeitou o escopo e parou exatamente onde eu mandei parar
Agora os números que eu acompanhei ao vivo:
- 16% da cota de 5 horas só na criação do projeto inicial mais a landing page
- 26 minutos pra entregar a etapa de autenticação
- 40% da cota já consumida com o projeto ainda longe da metade
- pra comparar, o scaffolding inicial nos meus testes costuma levar cerca de 10 minutos
A landing page saiu bonita, com flashcards animados e explicação do fluxo, apesar do visual ter aquela cara de padrão de IA
A autenticação funcionou de verdade: criei conta e o login passou no teste
O que mais me incomodou foi a lentidão. Já tinha acontecido no meu teste anterior com GLM, e o consumo de cota nem foi proporcional ao tempo de espera
E é aí que a decisão muda de lugar: a conta da assinatura não estoura por preço de tabela, estoura por sessão longa
Modelo mais lento gasta o teu relógio, e cota medida em janela de tempo é relógio. Se o teu uso é maratona de projeto inteiro, o cálculo de plano contra cobrança por token não é o mesmo de quem usa em rajadas curtas ao longo do dia
Como testar o GLM dentro do Claude Code antes de decidir
Antes de trocar de modelo por opinião de post na internet (inclusive esse aqui haha), roda o teste na tua máquina
- Assine o GLM Coding Plan. São três níveis, Lite, Pro e Max, a partir de US$ 18 por mês, com Pro e Max oferecendo 6x e 14x a cota do Lite. A medição é por créditos, com limite semanal de uso, e dá pra pagar mensal, trimestral ou anual. Erro comum deste passo: achar que a assinatura e a cobrança por token da API são a mesma conta. São cobranças separadas
- Pegue a chave da Z.ai. É ela que vai no token de autenticação do passo seguinte
- Edite o arquivo
~/.claude/settings.json. A configuração oficial define a chave e o endpoint, mais o mapeamento dos modelos:
ANTHROPIC_AUTH_TOKEN=<sua chave da Z.ai>
ANTHROPIC_BASE_URL=https://api.z.ai/api/anthropic
ANTHROPIC_DEFAULT_HAIKU_MODEL=<modelo GLM>
ANTHROPIC_DEFAULT_SONNET_MODEL=<modelo GLM>
ANTHROPIC_DEFAULT_OPUS_MODEL=<modelo GLM>
O formato exato do arquivo e os nomes dos modelos estão na documentação da Z.ai, confere lá antes de colar
- Confira o endpoint pela ferramenta que tu usa. Claude Code e Goose usam
https://api.z.ai/api/anthropic. As demais ferramentas usamhttps://api.z.ai/api/coding/paas/v4. Erro comum deste passo: copiar o endpoint de um tutorial de outra ferramenta e ficar batendo cabeça com erro de autenticação que não é de chave, é de URL. Tome cuidado!
- Use o mapeamento a teu favor. Foi o que eu fiz no teste: modelo mais forte da família nas tarefas pesadas, modelo mais leve nas tarefas simples, justamente pra não estourar a cota. É o ajuste que mais me economizou plano
- Se a ideia é self-hosting, olhe o custo real antes. O checkpoint FP8 oficial pede um nó de 8 GPUs H100 ou mais novas, sendo 8x H200 o patamar indicado pra uso de contexto longo, servido por vLLM ou SGLang. Pesos abertos são liberdade, não são de graça: sem o PC da Nasa (ou a nuvem equivalente), esse caminho não existe
O plano cobre GLM-5.3, GLM-5.3-Flash, GLM-5.2 e GLM-5-Turbo em Claude Code, Codex, ZCode, Kilo Code, Cline, OpenCode e outras ferramentas, funcionando pelos protocolos Anthropic e OpenAI
Veredito: o critério de escolha em uma frase
Aberto como padrão de trabalho, caro como exceção contratada
Quer a versão longa? Se a tarefa tem resposta conhecida e o teu trabalho é descrever bem o que quer (CRUD, refatoração, teste, script, tela, leitura de projeto), o GLM-5.3 resolve e te devolve mais de 11x no preço de saída
Se a tarefa exige autonomia longa sem tua supervisão, análise de segurança de verdade, ou entrada de imagem, aí tu tá comprando capacidade que o aberto principal não tem, e o GPT-6 Astra se paga
E agora o limite honesto desse post: os índices que eu usei são de páginas vivas do Artificial Analysis, que mudam de acordo com as rodadas de teste
Não existe número aqui que substitua o teu projeto. A diferença sentida depende do tipo de código que tu escreve
Conclusão
Recapitulando o critério: a decisão entre GPT-6 Astra ou GLM não sai de ranking, sai do tipo de tarefa que tu tá pagando pra resolver
Um ponto de diferença no índice de inteligência não justifica 11x no preço de saída pra trabalho de rotina, e nenhum desconto do mundo compra nível Critical em cibersegurança ou entrada de imagem
Próximo passo concreto: pega uma tarefa real do teu backlog, roda ela nos dois por uma semana, e anota duas coisas, tempo até a entrega e cota consumida. Foi medindo isso que eu descobri que o meu problema com o GLM não era qualidade de código, era relógio
E fica a lição que vale pros dois lados: com PRD, plano escrito e prompts particionados, a IA vai longe independente do modelo que tu escolher
até o próximo post! 😀
Perguntas frequentes
GPT-6 Astra está disponível no plano Plus do ChatGPT?
Não. O Astra aparece no ChatGPT como GPT-6 Pro e está nos planos Pro, Business e Enterprise. Quem usa o plano Plus no chat não tem acesso a ele.
Qual a diferença entre GLM-5.3 e GLM-5.3-Flash?
O GLM-5.3 tem 753 bilhões de parâmetros totais (40 bilhões ativos) e mira o topo de desempenho. O GLM-5.3-Flash é a versão mais leve, com 320 bilhões de parâmetros totais (18 bilhões ativos), licença MIT e API a US$ 0,15 de entrada e US$ 0,50 de saída por milhão de tokens.
Dá pra rodar o GLM-5.3 dentro do Claude Code?
Dá. O GLM Coding Plan da Z.ai cobre GLM-5.3, GLM-5.3-Flash, GLM-5.2 e GLM-5-Turbo dentro do Claude Code, e funciona pelos protocolos Anthropic e OpenAI. O passo a passo da configuração está na seção sobre como testar o GLM dentro do Claude Code, aqui no post.
Quanto custa a assinatura do GLM Coding Plan?
Os planos começam em US$ 18 por mês no nível Lite, com Pro e Max entregando 6x e 14x a cota do Lite. A medição é por créditos com limite semanal de uso, com opções de cobrança mensal, trimestral e anual.
É possível hospedar o GLM-5.3 na própria infraestrutura?
Sim, os pesos estão publicados no Hugging Face sob a GLM-5.3 License. Mas não é caminho de máquina pessoal: rodar o modelo exige um nó com múltiplas GPUs de data center, como está detalhado na seção sobre como testar o GLM dentro do Claude Code.
O GPT-6 Astra é mais arriscado por causa da capacidade em cibersegurança?
Ele é o primeiro modelo da OpenAI a atingir o nível Critical de capacidade em cibersegurança no Preparedness Framework. Isso significa que, com ferramentas e acesso adequados, ele pode encontrar falhas de segurança desconhecidas e desenvolver formas de explorá-las sem orientação humana passo a passo.
Formações
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Blog | Mais populares
GLM-5.3 é open source? Entenda a diferença para open-weights e quando os pesos serão liberados
GLM-5.3 open weights significa acesso aos pesos sob MIT, mas nao e open-source completo. Saiba quando os 743B parametros serao liberados pela Z.ai (previsto 28/08/2026).
GLM-5.3-Flash no GLM Coding Plan: o que muda no seu fluxo agora?
GLM-5.3-Flash chegou ao GLM Coding Plan (Lite, Pro e Max) sem custo extra e rende 3x mais quota. Veja como ativar no Claude Code e as ressalvas.
O que é o GLM-5.3-Flash, o primeiro modelo nativamente multimodal da série GLM-5?
O GLM-5.3-Flash é o primeiro modelo multimodal da série GLM-5, com MoE de 320B parâmetros, 1M de contexto e pesos abertos no Hugging Face. Entenda.
