Contexto de 1M de tokens no GLM-5.3-Flash: o que vale a pena colocar na entrada?

O contexto de 1M do GLM-5.3-Flash (1.048.576 tokens) muda a pergunta que você faz antes do prompt: não é mais "cabe?", e sim "o que vale a pena entrar aqui?". O modelo é um MoE de 320B totais com 18B ativos, pesos abertos sob licença MIT, nativamente multimodal (texto, imagem e vídeo na entrada, texto na saída). Só que a saída para em 131.072 tokens, bem abaixo da entrada. Na prática: monte um dossiê fixo no topo, um trecho variável embaixo e aproveite o cache, que custa US$ 0,03 por 1M contra US$ 0,15 da entrada normal
Existe uma tentação quase irresistível quando aparece uma janela gigante: jogar o projeto inteiro lá dentro e torcer
E olha, dá vontade mesmo 🙂
O GLM-5.3-Flash expõe 1M de tokens de contexto, e isso reformula a pergunta que a gente fazia antes de montar o prompt
Não é mais "será que cabe?"
Agora é "o que faz sentido colocar aqui dentro?", que é uma pergunta bem mais difícil e bem mais útil
O que é a janela de 1M do GLM-5.3-Flash (e como ela é servida):
Primeiro o básico, porque o modelo por trás da janela explica muita coisa
O GLM-5.3-Flash é um MoE de 320B de parâmetros totais com 18B ativos, publicado com pesos abertos sob licença MIT
Se você não é chegado em arquitetura: MoE significa que só uma fatia dos parâmetros é ativada por token, então o modelo é grande no papel e mais barato de rodar na prática
Ele é o primeiro nativamente multimodal da família GLM-5: aceita texto, imagem e vídeo na entrada, e devolve texto
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
E a janela de 1M não caiu do céu
A arquitetura combina atenção linear, que cuida das dependências locais, com atenção esparsa, que faz a recuperação de contexto longo
Comparado ao GLM-5.3, o Flash usa 3,0x menos computação de atenção e um cache KV 4,4x menor para sustentar contextos de até 1M
Traduzindo o porquê: servir 1M de tokens custa memória, e cache KV menor é literalmente o que torna a janela grande viável de servir
O pré-treino foi feito em um corpus multimodal de 30 trilhões de tokens
No Artificial Analysis Intelligence Index, que é uma página viva do próprio provedor do índice, ele marca 57
Um detalhe divertido: o modelo circulou antes do lançamento com o codinome ‘Ox Alpha’ em plataformas como OpenRouter e OpenCode, em 2026-08-20, e só foi revelado oficialmente como GLM-5.3-Flash em 2026-08-26
Onde tu encontra ele hoje:
- na OpenRouter, servido por um único provedor (a própria Z.ai), com os 1.048.576 tokens listados na página do modelo
- no Hugging Face, com os pesos publicados pela organização zai-org
- no LM Studio Bionic, que adicionou suporte com entrada de imagem e contexto de 1M
- na Cloudflare Workers AI, com o
glm-5.3-flashno catálogo
O que faz sentido colocar na entrada em projetos reais:
Aqui é onde a conversa fica boa
Janela grande não é depósito, é orçamento
Cada pedaço que entra precisa responder uma pergunta simples: por que este trecho está aqui para esta tarefa?
Código:
O que entra é o fluxo alvo, não o repositório
Os arquivos que a tarefa realmente toca, os tipos e contratos que definem as fronteiras (interfaces, schemas, assinaturas) e os testes que descrevem o comportamento esperado
Por que testes? Porque teste é especificação executável: ele diz o que não pode quebrar sem você escrever um parágrafo explicando isso
O que costuma NÃO precisar entrar: build, lockfile, migrations antigas, pasta de assets, código morto
Documentos longos:
Aqui a janela brilha de verdade
Contrato inteiro, edital completo, transcrição de reunião de duas horas, laudo técnico
São casos onde recortar é justamente o que gera erro, porque a resposta depende de uma cláusula que tu não sabia que existia
É o oposto do código: no documento, a íntegra costuma ser o ponto
Multimodal:
Como o modelo aceita imagem e vídeo nativamente, dá pra colocar o print da tela quebrada junto do trecho de código, ou o vídeo da gravação de tela junto da descrição do bug
Saída é sempre texto, então pense na imagem como evidência de entrada, nunca como formato de resposta
Automação com ferramentas:
O GLM-5.3-Flash aceita tools, tool_choice e response_format para saída JSON
Tome cuidado com um detalhe: não há imposição de JSON Schema
Ou seja, pedir JSON não garante JSON válido no formato exato que tu espera
Então valide a saída no teu lado, sempre, e trate o parse que falha como caso normal e não como exceção rara
Por que encher o contexto raramente melhora a resposta:
Os sintomas são sempre os mesmos, e provavelmente tu já viu todos
A resposta vem genérica, do tipo que serviria pra qualquer projeto
O modelo edita o arquivo errado, primo do arquivo certo
A instrução que tu colocou lá no comecinho do prompt some, como se nunca tivesse existido
E a entrega chega cortada no meio
A causa:
Entrada sem hierarquia
Quando tudo tem o mesmo peso, nada tem peso, e o ruído passa a competir de igual pra igual com o que importa
E tem um teto que quase ninguém olha: a saída máxima é de 131.072 tokens
Repara na assimetria: 1M de entrada contra 131.072 de saída
A janela de entrada cresceu, a resposta não acompanhou na mesma proporção, e vale entender quando o limite de resposta longa faz diferença antes de pedir uma entrega monstruosa numa tacada só
É o mesmo raciocínio que aparece em qualquer janela gigante da geração atual, inclusive na de contexto de 1M do Gemini 3.7 Flash
A solução:
Curadoria por tarefa: monte a entrada pra ESTA tarefa, não pro projeto em geral
Ordem deliberada: referência antes, instrução perto do pedido
Instrução importante enterrada no meio de 400 mil tokens é instrução perdida
E quebre entrega grande em várias saídas, respeitando o teto
Como prevenir:
Monta a entrada como dossiê fixo + trecho variável
O dossiê fixo é o que não muda entre as rodadas: PRD, plano, convenções, contratos
O trecho variável é o que muda: o arquivo da vez, o erro da vez, o pedido da vez
Essa separação não é estética, ela tem consequência direta na conta, como tu vai ver agora
Quanto custa encher a janela: entrada, cache e saída:
| Item (por 1M de tokens) | GLM-5.3-Flash (tabela) | GLM-5.3-Flash (50% off de lançamento) | GLM-5.3 de texto |
|---|---|---|---|
| Entrada | US$ 0,15 | US$ 0,075 | US$ 1,40 |
| Entrada em cache | US$ 0,03 | US$ 0,015 | não coberto por esta fonte |
| Saída | US$ 0,50 | US$ 0,25 | US$ 4,40 |
A promoção de lançamento corta os preços pela metade e segue válida até 2026-09-09 16:00 UTC
Agora a leitura prática, que é o que interessa
A entrada em cache custa US$ 0,03 contra US$ 0,15 da entrada normal, ou seja, 5x mais barato
Isso muda completamente a economia de prompt longo e repetido
Se a parte fixa da tua entrada fica estável no topo, rodada após rodada, ela deixa de ser o item caro da conta
Se tu embaralha a ordem a cada chamada, a parte fixa nunca estabiliza, e aí tu paga entrada cheia todas as vezes
Mesma janela, mesma tarefa, contas bem diferentes
O que aconteceu quando levei um projeto inteiro para o modelo:
Esse papo de organizar a entrada não é teoria minha de bar
No vídeo abaixo eu construo uma aplicação de flashcards do zero usando o GLM dentro de um fluxo de código, e a parte mais importante do teste aconteceu ANTES da primeira linha de código
A primeira coisa que pedi foi um PRD, e depois um plano em Markdown derivado dele, com estrutura de pastas e ordem técnica
A ideia era ter dois documentos de apoio pra colocar na entrada de todos os prompts seguintes (o tal dossiê fixo, na prática)
O modelo devolveu cinco dúvidas em aberto no PRD, e eu respondi uma a uma antes de deixar a implementação começar: quantidade de itens, banco, tipo de autenticação, monetização e biblioteca de componentes
Aí veio o primeiro susto: na primeira rodada ele começou a implementar sem eu pedir, e eu cancelei a execução na hora pra não perder o controle das etapas
Depois disso passei a particionar os prompts em pedaços menores e mais seccionados
No prompt de scaffolding pedi que ele seguisse os dois documentos e montasse o projeto com a stack que eu costumo indicar (Next, TypeScript e Tailwind)
E aqui o modelo me surpreendeu positivamente: ele entregou só o que foi pedido e PAROU, sem avançar sozinho pra próxima task
A landing page ficou bonita, apesar daquele visual padrão de IA, com explicação da proposta e flashcards animados, mas veio sem páginas de login e cadastro nessa etapa
Pedi a autenticação num prompt separado, citando o PRD e detalhando páginas e o cabeçalho que mostra o estado logado ou deslogado
Demorou 26 minutos
Criei uma conta na aplicação pra conferir e a autenticação funcionou direitinho
A lentidão me incomodou, é uma percepção que eu já tinha de antes: qualquer tarefa parece demorar mais do que em outros modelos
Depois veio a etapa de integração de IA dentro do projeto
E aí deu ruim: eu tinha configurado a chamada usando o mesmo acesso que eu já estava usando no fluxo de código, sem saber se aquilo era permitido, avisei que ia testar ao vivo e a chamada falhou com aviso de saldo
A interface retornou erro ao contatar o serviço de IA, conclui que aquele acesso provavelmente não cobre esse tipo de chamada e parti pra uma chave de outro provedor
No teste da aplicação pedi um deck sobre história de Londres, dificuldade fácil, 10 flashcards e 5 questões
A lição que amarra tudo isso ao tema do post: o custo real não cresce com o tamanho da janela disponível, ele cresce com o que tu repete a cada rodada
A janela de 1M ficou lá, parada, sem me cobrar nada por existir
Quem pesa mesmo é a sequência de rodadas carregando contexto
E a minha conclusão de lá continua valendo: com PRD e planejamento na entrada, a IA vai longe independente do modelo escolhido
No vídeo tu vê a construção acontecendo por etapas, rodada por rodada
Como montar sua próxima entrada:
A ideia central é essa: janela de 1M é margem de segurança, não meta a ser preenchida
Ter espaço pra 1.048.576 tokens significa que tu não precisa mais recortar documento com medo de estourar
Não significa que colocar tudo lá dentro seja a melhor jogada
O próximo passo prático é bem chato de tão simples: pega uma tarefa real, lista o que ela toca de verdade, monta o dossiê fixo mais o trecho variável e mede o resultado ANTES de aumentar a entrada
Se a resposta melhorar sem inchar o prompt, tu acabou de economizar dinheiro e tempo
Se piorar, aí sim tu adiciona contexto, sabendo exatamente o que adicionou e por quê
A promoção de lançamento ainda está de pé até 2026-09-09 16:00 UTC, então é uma janela boa (trocadilho intencional, haha) pra testar com calma e tirar tua própria conclusão
Bora ver na prática?
Até o próximo post!
Perguntas frequentes
Qual é o tamanho exato da janela de contexto do GLM-5.3-Flash?
São 1.048.576 tokens de entrada, o equivalente a 1M de tokens. O limite de saída é bem menor, 131.072 tokens no máximo, então a assimetria entre o que entra e o que sai precisa entrar no planejamento do prompt.
O GLM-5.3-Flash aceita vídeo como entrada, além de texto e imagem?
Aceita sim. É o primeiro modelo nativamente multimodal da família GLM-5, recebendo texto, imagem e vídeo na entrada. A saída, porém, é sempre em texto, então a imagem e o vídeo funcionam como evidência de entrada, não como formato de resposta.
Quanto custa usar o GLM-5.3-Flash com a promoção de lançamento ainda ativa?
Até 2026-09-09 16:00 UTC vale o desconto de 50% de lançamento: US$ 0,075 por 1M de tokens de entrada, US$ 0,015 por 1M de entrada em cache e US$ 0,25 por 1M de saída. Fora da promoção, a tabela cheia cobra US$ 0,15 de entrada, US$ 0,03 de cache e US$ 0,50 de saída.
Por que a entrada em cache sai tão mais barata no GLM-5.3-Flash?
Na tabela cheia, o token em cache custa US$ 0,03 por 1M contra US$ 0,15 do token normal, ou seja, 5x mais barato. Isso muda a economia de prompts longos e repetidos, principalmente quando tu usa o modelo de dossiê fixo mais trecho variável descrito no post.
O GLM-5.3-Flash garante que a saída em JSON siga o schema pedido?
Não. O modelo aceita tools, tool_choice e response_format para saída em JSON, mas não há imposição de JSON Schema. Por isso pedir JSON não garante JSON válido no formato exato esperado, e a validação da saída precisa ficar do teu lado.
Quanto custa o GLM-5.3 de texto comparado ao GLM-5.3-Flash?
O GLM-5.3 de texto, irmão maior do Flash, cobra US$ 1,40 por 1M de tokens de entrada e US$ 4,40 por 1M de saída. É bem mais caro que o GLM-5.3-Flash, que na tabela cheia cobra US$ 0,15 de entrada e US$ 0,50 de saída.
Formações
Formação SAAS com IA
Tire usas ideias do papel criando softwares com IA, integre pagamentos e lance seu projeto!
- 291 aulas
- 18 projetos
- 24h 17min
Blog | Mais populares
As diferenças de var, let e const
Como fazer redirecionamento com PHP
Neste artigo você vai aprender a como fazer redirecionamento com PHP, utilizaremos abordagens fáceis de entender e de aplicar Fala programador(a), beleza? Bora aprender mais […]
Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação
Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação A popularidade da automação de processos com o n8n está em alta, principalmente […]
