Contexto de 1M de tokens no Hy4 preview: o que isso muda na prática?

O Hy4 preview é o modelo de nova geração que a Tencent lançou e abriu o código em 28/08/2026: um MoE do Tencent Hy Team com 770B de parâmetros totais, 49B ativados por token e janela de 1.048.576 tokens de contexto, com até 64.000 tokens de saída. Na prática isso significa manter contexto espalhado em muitos arquivos, tarefas longas e vários documentos numa sessão só. O preço de API é US$ 0,834 por milhão de tokens de entrada e US$ 2,501 de saída. Os pesos estão no Hugging Face sob Apache 2.0
Um modelo aberto que enxerga 1.048.576 tokens de uma vez só
Fala aí, beleza? A Tencent anunciou em 28/08/2026 o lançamento e a abertura do código do Hy4 preview, o modelo de nova geração dela, e o número que mais chama atenção não é o de parâmetros, é o da janela de contexto
Aqui a gente vai destrinchar duas coisas: o que é janela de contexto (pra quem nunca parou pra entender direito) e o que muda mesmo no teu dia a dia de quem programa quando o modelo consegue segurar um projeto inteiro na cabeça 😀
O que é janela de contexto (e por que 1 milhão de tokens é diferente)
Janela de contexto é tudo que o modelo consegue enxergar de uma vez
Entra ali dentro: tuas instruções, os arquivos que você mandou, o histórico da conversa e também o que ele escreve de volta
Se você conhece a memória RAM da máquina, a analogia é boa o suficiente: é o espaço de trabalho do modelo naquela sessão, não o HD dele
Que fique claro: contexto grande não é memória permanente
A janela vale enquanto a sessão existe
Abriu sessão nova, o modelo não lembra do que vocês combinaram ontem, por mais que a janela seja gigante
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Entrada e saída não são a mesma coisa:
Esse é o ponto que mais confunde gente boa
No Hy4 a janela toda é de 1.048.576 tokens, mas o limite máximo de saída (completion) é de até 64.000 tokens
Ou seja: você pode empurrar um caminhão de código pra dentro, só que a resposta de UMA tacada tem teto
Essa diferença entre o que cabe na entrada e onde está o teto da resposta é o que separa quem usa janela grande com cabeça de quem só joga arquivo dentro e reza
O que a Tencent lançou no Hy4 preview
Pelo model card publicado no Hugging Face, é um modelo Mixture-of-Experts (MoE) desenvolvido pelo Tencent Hy Team
São 770B de parâmetros totais, com 49B ativados por token
Que raio é MoE? É uma arquitetura em que só uma parte do modelo é acionada a cada token, em vez do bicho inteiro
O posicionamento declarado pela empresa é bem específico: agentes de código, fluxos complexos de uso de ferramentas e tarefas de produtividade que exigem planejamento, continuidade de contexto e execução multi-etapa sustentada
A Tencent diz ter melhorado o modelo em tarefas reais de produtividade em programação, trabalho de escritório e pesquisa científica
E aí vêm os números, todos informados pela própria Tencent (isso importa, se liga):
| Avaliação | Resultado informado pela Tencent |
|---|---|
| Terminal Bench 2.1 | 85,4, superando o DeepSeek V4 Pro |
| DeepSWE | salto de 28,0 para 64,3 em relação à geração anterior |
| Avaliação cega interna (163 especialistas, 203 tarefas de engenharia) | 2,99 de 4, contra 2,94 do Kimi K3 e 2,92 do GLM-5.3 |
Nenhum desses números veio de teste independente até agora, então trate como o que é: alegação da fabricante, não veredito de terceiro
O que muda na prática com 1M de tokens de contexto
Janela grande resolve três dores bem chatas
Contexto espalhado em vários arquivos. Aquele momento em que a IA conserta o service e quebra o controller porque nunca viu o controller? Com janela larga você não precisa ficar escolhendo qual pedaço do projeto sacrificar
Tarefa de longo horizonte. Sessão que dura horas, com dez etapas encadeadas, tende a perder o fio no meio do caminho
Muitos documentos numa sessão só. Especificação, changelog, log de erro e três PRs abertos ao mesmo tempo, sem cortar em pedacinhos
A Tencent também mostrou uma demonstração de trabalho de longo horizonte: segundo ela, o Hy4 coordenou várias sessões do Codex em paralelo, avaliou os resultados e ajustou a direção da pesquisa, superando o Codex sozinho em oito benchmarks
De novo: número informado pela empresa
Mas é uma pista boa de onde eles querem que o modelo brilhe, o papel de maestro e não só de peão que escreve função
Onde a janela de 1M realmente ajuda (e onde não faz diferença)
1. Refatoração que cruza dezenas de arquivos
Trocar um padrão de nomeação, migrar uma camada de acesso a dados, mexer em contrato de API que meio mundo consome
Aqui o modelo precisa VER o mundo todo, não um recorte
2. Base legada sem documentação
Aquele projeto que ninguém sabe explicar e o cara que escreveu saiu da empresa em 2019
Jogar o repositório inteiro e pedir um mapa é o caso de uso mais óbvio de contexto grande
3. Agente que executa várias etapas com ferramentas
Segundo a ficha do modelo no OpenRouter, ele aceita tools e tool_choice para function calling e suporta saídas estruturadas via JSON schema em response_format
Traduzindo: dá pra montar agente que chama tua ferramenta e devolve JSON no formato que o teu código espera, sem parser gambiarra no meio
4. Lote de documentos
Analisar vinte contratos, cem tickets de suporte ou um monte de relatório numa passada só
E onde não muda nada:
Tarefa curta e bem delimitada não fica melhor porque a janela é maior
Corrigir um bug de uma função continua sendo corrigir um bug de uma função
E tem o detalhe que dói no bolso: contexto é token, e token é dinheiro
Enfiar o projeto inteiro em toda mensagem por preguiça de selecionar arquivo é a forma mais rápida de queimar cota, e pensar o que vale a pena colocar na entrada continua sendo trabalho teu
Quanto custa encher 1 milhão de tokens de contexto
Os preços de API do Hy4 preview são estes:
| Tipo de token | Preço por milhão |
|---|---|
| Entrada | US$ 0,834 |
| Saída | US$ 2,501 |
| Leitura de cache | US$ 0,042 |
Repare no terceiro item, porque é ele que muda o jogo
Numa sessão longa você reenvia o mesmo contextão a cada mensagem: o mesmo projeto, as mesmas instruções, o mesmo PRD
Se esse pedaço bate no cache, ele sai por US$ 0,042 por milhão em vez de US$ 0,834, ou seja, uma fração do que custaria mandar tudo de novo como entrada nova
É a diferença entre uma sessão de agente ser viável e ser um luxo
E não esqueça do teto de 64.000 tokens de saída
Se você pedir "escreva o sistema inteiro agora", a resposta bate no limite e você vai ter que continuar em pedaços de qualquer jeito
Fatiar a tarefa não é frescura, é a forma correta de trabalhar com esses modelos
Como é trabalhar com uma janela de 1M num projeto de verdade
Aviso na cara, sem enrolação: o teste de primeira mão abaixo NÃO foi com o Hy4 preview
Foi com o GLM 5.2, outro modelo com janela de 1M, num projeto do zero que eu levei de ponta a ponta
Coloco aqui porque o comportamento de sessão longa e o consumo de cota valem mais que qualquer benchmark de slide, e serve pra você calibrar expectativa antes de plugar o Hy4 no teu fluxo
Antes de gerar qualquer código eu pedi um PRD, porque quando o modelo não é o topo de linha eu prefiro guiar a IA com um documento de escopo bem amarrado
Aí veio a primeira lição: o modelo começou a criar o projeto sem eu pedir, ainda na etapa de planejamento, e eu cancelei a execução pra não perder o controle das etapas
Passei a fatiar os prompts em etapas menores (scaffold, landing page, autenticação, integração de IA) e o resultado melhorou na hora
Na etapa seguinte ele respeitou o recorte pedido e parou exatamente onde eu mandei, o que me surpreendeu positivamente
O consumo da cota de 5 horas ficou assim:
- Depois do scaffold do projeto mais a landing page: 16%
- Etapa de autenticação: 26 minutos de trabalho, chegando a 40%
- Etapa de integração com IA: 74%
A landing page me agradou, visual bonito (com aquela cara padrão de IA, né?), com explicação do fluxo e flashcards animados
A autenticação com e-mail e senha funcionou: criei uma conta na aplicação e o login passou numa boa
A reclamação principal foi lentidão
Qualquer coisa que eu pedia parecia demorar mais do que em outros modelos, e isso se repetiu etapa após etapa
E teve a rasteira do final: ao integrar a IA dentro da própria aplicação usando o mesmo endpoint da assinatura, a chamada falhou com aviso de problema de saldo, e a tela do app retornou erro de falha ao contatar o serviço de IA
Minha leitura foi que a assinatura não cobre chamadas de API feitas de dentro da aplicação, só o uso pra programar, então migrei essa parte pra outro provedor
Tome cuidado com isso, porque é o tipo de detalhe que só aparece quando o app já está de pé
No teste final eu pedi um deck de história de Londres em dificuldade fácil e ele gerou 10 flashcards e 5 questões, redondinho
Balanço parcial: entrega código bom e respeita etapas bem prompt-adas, mas é lento e come cota rápido
No vídeo abaixo eu mostro esse teste inteiro, é dele que saíram as medições de cota acima:
E a moral que vale pra qualquer modelo, inclusive pro Hy4: com PRD e planejamento a IA vai longe, independente de qual você escolher
Como testar o Hy4 preview hoje
Dá pra usar sem rodar o bicho na tua máquina
- Use dentro dos produtos da Tencent. O modelo está disponível no WorkBuddy, no CodeBuddy, no Yuanbao e no ima. O erro comum aqui: assumir que ele já aparece no teu agente favorito. Essa é a lista oficial, não estenda por conta própria
- Aproveite o período gratuito. Ele está gratuito por duas semanas no WorkBuddy e no CodeBuddy a partir do lançamento, ou seja, dá pra testar antes de pagar qualquer coisa
- Plugue via API. O acesso por API é via Tencent Cloud TokenHub e via OpenRouter. Se o teu código já usa function calling, a ficha no OpenRouter informa que o modelo aceita
toolsetool_choice, e devolve saída estruturada por JSON schema emresponse_format - Rode por conta própria, se quiser. Os pesos do modelo e da versão Hy4 preview-FP8 estão publicados no Hugging Face em tencent/Hy4-preview e em
tencent/Hy4-preview-FP8, sob licença Apache 2.0. O código do projeto está em github.com/Tencent-Hunyuan/Hy4-preview e existe uma página de deploy na documentação do SGLang, referenciada a partir do model card
Não vou te passar comando de instalação nem tabela de VRAM aqui, porque não consegui confirmar isso na documentação oficial
Prefiro te mandar direto na fonte a te ensinar o passo errado 🙂
Vale a pena olhar para o Hy4 preview?
O pacote é bem atraente no papel: 1.048.576 tokens de janela, licença Apache 2.0 nos pesos e entrada a US$ 0,834 por milhão de tokens
Pra agente de código e tarefa longa, é exatamente o tipo de combinação que interessa
O porém honesto: todos os benchmarks que circulam por aí no lançamento são da própria Tencent, e ainda não existe teste independente de recuperação em contexto longo pra dizer se o modelo aproveita bem a janela perto do limite ou se degrada no meio do caminho
Janela anunciada e janela útil não são sinônimos, e quem já brincou com contexto grande sabe disso
Próximo passo que eu faria: pegar a janela gratuita de duas semanas no CodeBuddy ou plugar via OpenRouter num projeto real, medir custo e velocidade numa tarefa que você já conhece bem, e só depois pensar em migrar fluxo de trabalho
Benchmark de slide é fácil, o teu projeto é que decide…
Até o próximo post! 😀
Perguntas frequentes
O Hy4 preview é open source?
Sim, a Tencent publicou os pesos no Hugging Face em tencent/Hy4-preview e também numa versão tencent/Hy4-preview-FP8, ambas sob licença Apache 2.0. O código do projeto também está aberto no GitHub, em github.com/Tencent-Hunyuan/Hy4-preview, como aparece na seção de como testar o modelo.
O Hy4 preview é gratuito para usar?
No lançamento, sim: o modelo ficou gratuito por duas semanas no WorkBuddy e no CodeBuddy, dois produtos da própria Tencent. Fora desse período, o acesso via API segue a tabela normal de preços, com entrada a US$ 0,834 por milhão de tokens.
Dá para fazer deploy do Hy4 preview na própria infraestrutura?
Dá, já que os pesos estão abertos sob licença Apache 2.0. Existe uma página de deploy do modelo na documentação do SGLang, referenciada a partir do model card no Hugging Face, e é o caminho pra quem quer rodar por conta própria em vez de acessar via API.
Onde posso usar o Hy4 preview sem instalar nada?
O modelo já está disponível dentro dos produtos WorkBuddy, CodeBuddy, Yuanbao e ima. Se preferir integrar via API, o acesso é feito pela Tencent Cloud TokenHub ou pelo OpenRouter, os mesmos caminhos citados no post.
Qual a diferença entre o Hy4 preview e o Hy4 preview-FP8?
As duas versões foram publicadas juntas no Hugging Face, sob a mesma licença Apache 2.0. A FP8 é a variante em ponto flutuante de 8 bits, pensada pra quem quer rodar o modelo consumindo menos memória de GPU.
O Hy4 preview supera modelos como Kimi K3 e GLM-5.3?
Segundo avaliação cega interna da própria Tencent, com 163 especialistas julgando 203 tarefas de engenharia, o modelo tirou média 2,99 de 4, contra 2,94 do Kimi K3 e 2,92 do GLM-5.3. Vale lembrar que esse número saiu da fabricante, não de um teste independente.
Formações
Formação SAAS com IA
Tire usas ideias do papel criando softwares com IA, integre pagamentos e lance seu projeto!
- 291 aulas
- 18 projetos
- 24h 17min
Blog | Mais populares
As diferenças de var, let e const
Como fazer redirecionamento com PHP
Neste artigo você vai aprender a como fazer redirecionamento com PHP, utilizaremos abordagens fáceis de entender e de aplicar Fala programador(a), beleza? Bora aprender mais […]
Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação
Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação A popularidade da automação de processos com o n8n está em alta, principalmente […]
