Contexto de 1M de tokens no GLM-5.3-Flash: o que vale a pena colocar na entrada?

Contexto de 1M de tokens do GLM-5.3-Flash em dossiê fixo e trecho variável no prompt
Resposta rápida

O contexto de 1M do GLM-5.3-Flash (1.048.576 tokens) muda a pergunta que você faz antes do prompt: não é mais "cabe?", e sim "o que vale a pena entrar aqui?". O modelo é um MoE de 320B totais com 18B ativos, pesos abertos sob licença MIT, nativamente multimodal (texto, imagem e vídeo na entrada, texto na saída). Só que a saída para em 131.072 tokens, bem abaixo da entrada. Na prática: monte um dossiê fixo no topo, um trecho variável embaixo e aproveite o cache, que custa US$ 0,03 por 1M contra US$ 0,15 da entrada normal

Existe uma tentação quase irresistível quando aparece uma janela gigante: jogar o projeto inteiro lá dentro e torcer

E olha, dá vontade mesmo 🙂

O GLM-5.3-Flash expõe 1M de tokens de contexto, e isso reformula a pergunta que a gente fazia antes de montar o prompt

Não é mais "será que cabe?"

Agora é "o que faz sentido colocar aqui dentro?", que é uma pergunta bem mais difícil e bem mais útil

O que é a janela de 1M do GLM-5.3-Flash (e como ela é servida):

Primeiro o básico, porque o modelo por trás da janela explica muita coisa

O GLM-5.3-Flash é um MoE de 320B de parâmetros totais com 18B ativos, publicado com pesos abertos sob licença MIT

Se você não é chegado em arquitetura: MoE significa que só uma fatia dos parâmetros é ativada por token, então o modelo é grande no papel e mais barato de rodar na prática

Ele é o primeiro nativamente multimodal da família GLM-5: aceita texto, imagem e vídeo na entrada, e devolve texto

Formação Vibe Coding
Formação Recomendada

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

E a janela de 1M não caiu do céu

A arquitetura combina atenção linear, que cuida das dependências locais, com atenção esparsa, que faz a recuperação de contexto longo

Comparado ao GLM-5.3, o Flash usa 3,0x menos computação de atenção e um cache KV 4,4x menor para sustentar contextos de até 1M

Traduzindo o porquê: servir 1M de tokens custa memória, e cache KV menor é literalmente o que torna a janela grande viável de servir

O pré-treino foi feito em um corpus multimodal de 30 trilhões de tokens

No Artificial Analysis Intelligence Index, que é uma página viva do próprio provedor do índice, ele marca 57

Um detalhe divertido: o modelo circulou antes do lançamento com o codinome ‘Ox Alpha’ em plataformas como OpenRouter e OpenCode, em 2026-08-20, e só foi revelado oficialmente como GLM-5.3-Flash em 2026-08-26

Onde tu encontra ele hoje:

  • na OpenRouter, servido por um único provedor (a própria Z.ai), com os 1.048.576 tokens listados na página do modelo
  • no Hugging Face, com os pesos publicados pela organização zai-org
  • no LM Studio Bionic, que adicionou suporte com entrada de imagem e contexto de 1M
  • na Cloudflare Workers AI, com o glm-5.3-flash no catálogo

O que faz sentido colocar na entrada em projetos reais:

Aqui é onde a conversa fica boa

Janela grande não é depósito, é orçamento

Cada pedaço que entra precisa responder uma pergunta simples: por que este trecho está aqui para esta tarefa?

Código:

O que entra é o fluxo alvo, não o repositório

Os arquivos que a tarefa realmente toca, os tipos e contratos que definem as fronteiras (interfaces, schemas, assinaturas) e os testes que descrevem o comportamento esperado

Por que testes? Porque teste é especificação executável: ele diz o que não pode quebrar sem você escrever um parágrafo explicando isso

O que costuma NÃO precisar entrar: build, lockfile, migrations antigas, pasta de assets, código morto

Documentos longos:

Aqui a janela brilha de verdade

Contrato inteiro, edital completo, transcrição de reunião de duas horas, laudo técnico

São casos onde recortar é justamente o que gera erro, porque a resposta depende de uma cláusula que tu não sabia que existia

É o oposto do código: no documento, a íntegra costuma ser o ponto

Multimodal:

Como o modelo aceita imagem e vídeo nativamente, dá pra colocar o print da tela quebrada junto do trecho de código, ou o vídeo da gravação de tela junto da descrição do bug

Saída é sempre texto, então pense na imagem como evidência de entrada, nunca como formato de resposta

Automação com ferramentas:

O GLM-5.3-Flash aceita tools, tool_choice e response_format para saída JSON

Tome cuidado com um detalhe: não há imposição de JSON Schema

Ou seja, pedir JSON não garante JSON válido no formato exato que tu espera

Então valide a saída no teu lado, sempre, e trate o parse que falha como caso normal e não como exceção rara

Por que encher o contexto raramente melhora a resposta:

Os sintomas são sempre os mesmos, e provavelmente tu já viu todos

A resposta vem genérica, do tipo que serviria pra qualquer projeto

O modelo edita o arquivo errado, primo do arquivo certo

A instrução que tu colocou lá no comecinho do prompt some, como se nunca tivesse existido

E a entrega chega cortada no meio

A causa:

Entrada sem hierarquia

Quando tudo tem o mesmo peso, nada tem peso, e o ruído passa a competir de igual pra igual com o que importa

E tem um teto que quase ninguém olha: a saída máxima é de 131.072 tokens

Repara na assimetria: 1M de entrada contra 131.072 de saída

A janela de entrada cresceu, a resposta não acompanhou na mesma proporção, e vale entender quando o limite de resposta longa faz diferença antes de pedir uma entrega monstruosa numa tacada só

É o mesmo raciocínio que aparece em qualquer janela gigante da geração atual, inclusive na de contexto de 1M do Gemini 3.7 Flash

A solução:

Curadoria por tarefa: monte a entrada pra ESTA tarefa, não pro projeto em geral

Ordem deliberada: referência antes, instrução perto do pedido

Instrução importante enterrada no meio de 400 mil tokens é instrução perdida

E quebre entrega grande em várias saídas, respeitando o teto

Como prevenir:

Monta a entrada como dossiê fixo + trecho variável

O dossiê fixo é o que não muda entre as rodadas: PRD, plano, convenções, contratos

O trecho variável é o que muda: o arquivo da vez, o erro da vez, o pedido da vez

Essa separação não é estética, ela tem consequência direta na conta, como tu vai ver agora

Quanto custa encher a janela: entrada, cache e saída:

Item (por 1M de tokens) GLM-5.3-Flash (tabela) GLM-5.3-Flash (50% off de lançamento) GLM-5.3 de texto
Entrada US$ 0,15 US$ 0,075 US$ 1,40
Entrada em cache US$ 0,03 US$ 0,015 não coberto por esta fonte
Saída US$ 0,50 US$ 0,25 US$ 4,40

A promoção de lançamento corta os preços pela metade e segue válida até 2026-09-09 16:00 UTC

Agora a leitura prática, que é o que interessa

A entrada em cache custa US$ 0,03 contra US$ 0,15 da entrada normal, ou seja, 5x mais barato

Isso muda completamente a economia de prompt longo e repetido

Se a parte fixa da tua entrada fica estável no topo, rodada após rodada, ela deixa de ser o item caro da conta

Se tu embaralha a ordem a cada chamada, a parte fixa nunca estabiliza, e aí tu paga entrada cheia todas as vezes

Mesma janela, mesma tarefa, contas bem diferentes

O que aconteceu quando levei um projeto inteiro para o modelo:

Esse papo de organizar a entrada não é teoria minha de bar

No vídeo abaixo eu construo uma aplicação de flashcards do zero usando o GLM dentro de um fluxo de código, e a parte mais importante do teste aconteceu ANTES da primeira linha de código

A primeira coisa que pedi foi um PRD, e depois um plano em Markdown derivado dele, com estrutura de pastas e ordem técnica

A ideia era ter dois documentos de apoio pra colocar na entrada de todos os prompts seguintes (o tal dossiê fixo, na prática)

O modelo devolveu cinco dúvidas em aberto no PRD, e eu respondi uma a uma antes de deixar a implementação começar: quantidade de itens, banco, tipo de autenticação, monetização e biblioteca de componentes

Aí veio o primeiro susto: na primeira rodada ele começou a implementar sem eu pedir, e eu cancelei a execução na hora pra não perder o controle das etapas

Depois disso passei a particionar os prompts em pedaços menores e mais seccionados

No prompt de scaffolding pedi que ele seguisse os dois documentos e montasse o projeto com a stack que eu costumo indicar (Next, TypeScript e Tailwind)

E aqui o modelo me surpreendeu positivamente: ele entregou só o que foi pedido e PAROU, sem avançar sozinho pra próxima task

A landing page ficou bonita, apesar daquele visual padrão de IA, com explicação da proposta e flashcards animados, mas veio sem páginas de login e cadastro nessa etapa

Pedi a autenticação num prompt separado, citando o PRD e detalhando páginas e o cabeçalho que mostra o estado logado ou deslogado

Demorou 26 minutos

Criei uma conta na aplicação pra conferir e a autenticação funcionou direitinho

A lentidão me incomodou, é uma percepção que eu já tinha de antes: qualquer tarefa parece demorar mais do que em outros modelos

Depois veio a etapa de integração de IA dentro do projeto

E aí deu ruim: eu tinha configurado a chamada usando o mesmo acesso que eu já estava usando no fluxo de código, sem saber se aquilo era permitido, avisei que ia testar ao vivo e a chamada falhou com aviso de saldo

A interface retornou erro ao contatar o serviço de IA, conclui que aquele acesso provavelmente não cobre esse tipo de chamada e parti pra uma chave de outro provedor

No teste da aplicação pedi um deck sobre história de Londres, dificuldade fácil, 10 flashcards e 5 questões

A lição que amarra tudo isso ao tema do post: o custo real não cresce com o tamanho da janela disponível, ele cresce com o que tu repete a cada rodada

A janela de 1M ficou lá, parada, sem me cobrar nada por existir

Quem pesa mesmo é a sequência de rodadas carregando contexto

E a minha conclusão de lá continua valendo: com PRD e planejamento na entrada, a IA vai longe independente do modelo escolhido

No vídeo tu vê a construção acontecendo por etapas, rodada por rodada

Como montar sua próxima entrada:

A ideia central é essa: janela de 1M é margem de segurança, não meta a ser preenchida

Ter espaço pra 1.048.576 tokens significa que tu não precisa mais recortar documento com medo de estourar

Não significa que colocar tudo lá dentro seja a melhor jogada

O próximo passo prático é bem chato de tão simples: pega uma tarefa real, lista o que ela toca de verdade, monta o dossiê fixo mais o trecho variável e mede o resultado ANTES de aumentar a entrada

Se a resposta melhorar sem inchar o prompt, tu acabou de economizar dinheiro e tempo

Se piorar, aí sim tu adiciona contexto, sabendo exatamente o que adicionou e por quê

A promoção de lançamento ainda está de pé até 2026-09-09 16:00 UTC, então é uma janela boa (trocadilho intencional, haha) pra testar com calma e tirar tua própria conclusão

Bora ver na prática?

Até o próximo post!

Perguntas frequentes

Qual é o tamanho exato da janela de contexto do GLM-5.3-Flash?

São 1.048.576 tokens de entrada, o equivalente a 1M de tokens. O limite de saída é bem menor, 131.072 tokens no máximo, então a assimetria entre o que entra e o que sai precisa entrar no planejamento do prompt.

O GLM-5.3-Flash aceita vídeo como entrada, além de texto e imagem?

Aceita sim. É o primeiro modelo nativamente multimodal da família GLM-5, recebendo texto, imagem e vídeo na entrada. A saída, porém, é sempre em texto, então a imagem e o vídeo funcionam como evidência de entrada, não como formato de resposta.

Quanto custa usar o GLM-5.3-Flash com a promoção de lançamento ainda ativa?

Até 2026-09-09 16:00 UTC vale o desconto de 50% de lançamento: US$ 0,075 por 1M de tokens de entrada, US$ 0,015 por 1M de entrada em cache e US$ 0,25 por 1M de saída. Fora da promoção, a tabela cheia cobra US$ 0,15 de entrada, US$ 0,03 de cache e US$ 0,50 de saída.

Por que a entrada em cache sai tão mais barata no GLM-5.3-Flash?

Na tabela cheia, o token em cache custa US$ 0,03 por 1M contra US$ 0,15 do token normal, ou seja, 5x mais barato. Isso muda a economia de prompts longos e repetidos, principalmente quando tu usa o modelo de dossiê fixo mais trecho variável descrito no post.

O GLM-5.3-Flash garante que a saída em JSON siga o schema pedido?

Não. O modelo aceita tools, tool_choice e response_format para saída em JSON, mas não há imposição de JSON Schema. Por isso pedir JSON não garante JSON válido no formato exato esperado, e a validação da saída precisa ficar do teu lado.

Quanto custa o GLM-5.3 de texto comparado ao GLM-5.3-Flash?

O GLM-5.3 de texto, irmão maior do Flash, cobra US$ 1,40 por 1M de tokens de entrada e US$ 4,40 por 1M de saída. É bem mais caro que o GLM-5.3-Flash, que na tabela cheia cobra US$ 0,15 de entrada e US$ 0,50 de saída.




Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação SAAS com IA

Formação SAAS com IA

Tire usas ideias do papel criando softwares com IA, integre pagamentos e lance seu projeto!

  • 291 aulas
  • 18 projetos
  • 24h 17min

Blog | Mais populares