Contexto de 1M de tokens no Hy4 preview: o que isso muda na prática?

janela de contexto de 1 milhão de tokens do Hy4 preview da Tencent
Resposta rápida

O Hy4 preview é o modelo de nova geração que a Tencent lançou e abriu o código em 28/08/2026: um MoE do Tencent Hy Team com 770B de parâmetros totais, 49B ativados por token e janela de 1.048.576 tokens de contexto, com até 64.000 tokens de saída. Na prática isso significa manter contexto espalhado em muitos arquivos, tarefas longas e vários documentos numa sessão só. O preço de API é US$ 0,834 por milhão de tokens de entrada e US$ 2,501 de saída. Os pesos estão no Hugging Face sob Apache 2.0

Um modelo aberto que enxerga 1.048.576 tokens de uma vez só

Fala aí, beleza? A Tencent anunciou em 28/08/2026 o lançamento e a abertura do código do Hy4 preview, o modelo de nova geração dela, e o número que mais chama atenção não é o de parâmetros, é o da janela de contexto

Aqui a gente vai destrinchar duas coisas: o que é janela de contexto (pra quem nunca parou pra entender direito) e o que muda mesmo no teu dia a dia de quem programa quando o modelo consegue segurar um projeto inteiro na cabeça 😀

O que é janela de contexto (e por que 1 milhão de tokens é diferente)

Janela de contexto é tudo que o modelo consegue enxergar de uma vez

Entra ali dentro: tuas instruções, os arquivos que você mandou, o histórico da conversa e também o que ele escreve de volta

Se você conhece a memória RAM da máquina, a analogia é boa o suficiente: é o espaço de trabalho do modelo naquela sessão, não o HD dele

Que fique claro: contexto grande não é memória permanente

A janela vale enquanto a sessão existe

Abriu sessão nova, o modelo não lembra do que vocês combinaram ontem, por mais que a janela seja gigante

Formação Vibe Coding
Formação Recomendada

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Entrada e saída não são a mesma coisa:

Esse é o ponto que mais confunde gente boa

No Hy4 a janela toda é de 1.048.576 tokens, mas o limite máximo de saída (completion) é de até 64.000 tokens

Ou seja: você pode empurrar um caminhão de código pra dentro, só que a resposta de UMA tacada tem teto

Essa diferença entre o que cabe na entrada e onde está o teto da resposta é o que separa quem usa janela grande com cabeça de quem só joga arquivo dentro e reza

O que a Tencent lançou no Hy4 preview

Pelo model card publicado no Hugging Face, é um modelo Mixture-of-Experts (MoE) desenvolvido pelo Tencent Hy Team

São 770B de parâmetros totais, com 49B ativados por token

Que raio é MoE? É uma arquitetura em que só uma parte do modelo é acionada a cada token, em vez do bicho inteiro

O posicionamento declarado pela empresa é bem específico: agentes de código, fluxos complexos de uso de ferramentas e tarefas de produtividade que exigem planejamento, continuidade de contexto e execução multi-etapa sustentada

A Tencent diz ter melhorado o modelo em tarefas reais de produtividade em programação, trabalho de escritório e pesquisa científica

E aí vêm os números, todos informados pela própria Tencent (isso importa, se liga):

Avaliação Resultado informado pela Tencent
Terminal Bench 2.1 85,4, superando o DeepSeek V4 Pro
DeepSWE salto de 28,0 para 64,3 em relação à geração anterior
Avaliação cega interna (163 especialistas, 203 tarefas de engenharia) 2,99 de 4, contra 2,94 do Kimi K3 e 2,92 do GLM-5.3

Nenhum desses números veio de teste independente até agora, então trate como o que é: alegação da fabricante, não veredito de terceiro

O que muda na prática com 1M de tokens de contexto

Janela grande resolve três dores bem chatas

Contexto espalhado em vários arquivos. Aquele momento em que a IA conserta o service e quebra o controller porque nunca viu o controller? Com janela larga você não precisa ficar escolhendo qual pedaço do projeto sacrificar

Tarefa de longo horizonte. Sessão que dura horas, com dez etapas encadeadas, tende a perder o fio no meio do caminho

Muitos documentos numa sessão só. Especificação, changelog, log de erro e três PRs abertos ao mesmo tempo, sem cortar em pedacinhos

A Tencent também mostrou uma demonstração de trabalho de longo horizonte: segundo ela, o Hy4 coordenou várias sessões do Codex em paralelo, avaliou os resultados e ajustou a direção da pesquisa, superando o Codex sozinho em oito benchmarks

De novo: número informado pela empresa

Mas é uma pista boa de onde eles querem que o modelo brilhe, o papel de maestro e não só de peão que escreve função

Onde a janela de 1M realmente ajuda (e onde não faz diferença)

1. Refatoração que cruza dezenas de arquivos

Trocar um padrão de nomeação, migrar uma camada de acesso a dados, mexer em contrato de API que meio mundo consome

Aqui o modelo precisa VER o mundo todo, não um recorte

2. Base legada sem documentação

Aquele projeto que ninguém sabe explicar e o cara que escreveu saiu da empresa em 2019

Jogar o repositório inteiro e pedir um mapa é o caso de uso mais óbvio de contexto grande

3. Agente que executa várias etapas com ferramentas

Segundo a ficha do modelo no OpenRouter, ele aceita tools e tool_choice para function calling e suporta saídas estruturadas via JSON schema em response_format

Traduzindo: dá pra montar agente que chama tua ferramenta e devolve JSON no formato que o teu código espera, sem parser gambiarra no meio

4. Lote de documentos

Analisar vinte contratos, cem tickets de suporte ou um monte de relatório numa passada só

E onde não muda nada:

Tarefa curta e bem delimitada não fica melhor porque a janela é maior

Corrigir um bug de uma função continua sendo corrigir um bug de uma função

E tem o detalhe que dói no bolso: contexto é token, e token é dinheiro

Enfiar o projeto inteiro em toda mensagem por preguiça de selecionar arquivo é a forma mais rápida de queimar cota, e pensar o que vale a pena colocar na entrada continua sendo trabalho teu

Quanto custa encher 1 milhão de tokens de contexto

Os preços de API do Hy4 preview são estes:

Tipo de token Preço por milhão
Entrada US$ 0,834
Saída US$ 2,501
Leitura de cache US$ 0,042

Repare no terceiro item, porque é ele que muda o jogo

Numa sessão longa você reenvia o mesmo contextão a cada mensagem: o mesmo projeto, as mesmas instruções, o mesmo PRD

Se esse pedaço bate no cache, ele sai por US$ 0,042 por milhão em vez de US$ 0,834, ou seja, uma fração do que custaria mandar tudo de novo como entrada nova

É a diferença entre uma sessão de agente ser viável e ser um luxo

E não esqueça do teto de 64.000 tokens de saída

Se você pedir "escreva o sistema inteiro agora", a resposta bate no limite e você vai ter que continuar em pedaços de qualquer jeito

Fatiar a tarefa não é frescura, é a forma correta de trabalhar com esses modelos

Como é trabalhar com uma janela de 1M num projeto de verdade

Aviso na cara, sem enrolação: o teste de primeira mão abaixo NÃO foi com o Hy4 preview

Foi com o GLM 5.2, outro modelo com janela de 1M, num projeto do zero que eu levei de ponta a ponta

Coloco aqui porque o comportamento de sessão longa e o consumo de cota valem mais que qualquer benchmark de slide, e serve pra você calibrar expectativa antes de plugar o Hy4 no teu fluxo

Antes de gerar qualquer código eu pedi um PRD, porque quando o modelo não é o topo de linha eu prefiro guiar a IA com um documento de escopo bem amarrado

Aí veio a primeira lição: o modelo começou a criar o projeto sem eu pedir, ainda na etapa de planejamento, e eu cancelei a execução pra não perder o controle das etapas

Passei a fatiar os prompts em etapas menores (scaffold, landing page, autenticação, integração de IA) e o resultado melhorou na hora

Na etapa seguinte ele respeitou o recorte pedido e parou exatamente onde eu mandei, o que me surpreendeu positivamente

O consumo da cota de 5 horas ficou assim:

  • Depois do scaffold do projeto mais a landing page: 16%
  • Etapa de autenticação: 26 minutos de trabalho, chegando a 40%
  • Etapa de integração com IA: 74%

A landing page me agradou, visual bonito (com aquela cara padrão de IA, né?), com explicação do fluxo e flashcards animados

A autenticação com e-mail e senha funcionou: criei uma conta na aplicação e o login passou numa boa

A reclamação principal foi lentidão

Qualquer coisa que eu pedia parecia demorar mais do que em outros modelos, e isso se repetiu etapa após etapa

E teve a rasteira do final: ao integrar a IA dentro da própria aplicação usando o mesmo endpoint da assinatura, a chamada falhou com aviso de problema de saldo, e a tela do app retornou erro de falha ao contatar o serviço de IA

Minha leitura foi que a assinatura não cobre chamadas de API feitas de dentro da aplicação, só o uso pra programar, então migrei essa parte pra outro provedor

Tome cuidado com isso, porque é o tipo de detalhe que só aparece quando o app já está de pé

No teste final eu pedi um deck de história de Londres em dificuldade fácil e ele gerou 10 flashcards e 5 questões, redondinho

Balanço parcial: entrega código bom e respeita etapas bem prompt-adas, mas é lento e come cota rápido

No vídeo abaixo eu mostro esse teste inteiro, é dele que saíram as medições de cota acima:

E a moral que vale pra qualquer modelo, inclusive pro Hy4: com PRD e planejamento a IA vai longe, independente de qual você escolher

Como testar o Hy4 preview hoje

Dá pra usar sem rodar o bicho na tua máquina

  1. Use dentro dos produtos da Tencent. O modelo está disponível no WorkBuddy, no CodeBuddy, no Yuanbao e no ima. O erro comum aqui: assumir que ele já aparece no teu agente favorito. Essa é a lista oficial, não estenda por conta própria
  2. Aproveite o período gratuito. Ele está gratuito por duas semanas no WorkBuddy e no CodeBuddy a partir do lançamento, ou seja, dá pra testar antes de pagar qualquer coisa
  3. Plugue via API. O acesso por API é via Tencent Cloud TokenHub e via OpenRouter. Se o teu código já usa function calling, a ficha no OpenRouter informa que o modelo aceita tools e tool_choice, e devolve saída estruturada por JSON schema em response_format
  4. Rode por conta própria, se quiser. Os pesos do modelo e da versão Hy4 preview-FP8 estão publicados no Hugging Face em tencent/Hy4-preview e em tencent/Hy4-preview-FP8, sob licença Apache 2.0. O código do projeto está em github.com/Tencent-Hunyuan/Hy4-preview e existe uma página de deploy na documentação do SGLang, referenciada a partir do model card

Não vou te passar comando de instalação nem tabela de VRAM aqui, porque não consegui confirmar isso na documentação oficial

Prefiro te mandar direto na fonte a te ensinar o passo errado 🙂

Vale a pena olhar para o Hy4 preview?

O pacote é bem atraente no papel: 1.048.576 tokens de janela, licença Apache 2.0 nos pesos e entrada a US$ 0,834 por milhão de tokens

Pra agente de código e tarefa longa, é exatamente o tipo de combinação que interessa

O porém honesto: todos os benchmarks que circulam por aí no lançamento são da própria Tencent, e ainda não existe teste independente de recuperação em contexto longo pra dizer se o modelo aproveita bem a janela perto do limite ou se degrada no meio do caminho

Janela anunciada e janela útil não são sinônimos, e quem já brincou com contexto grande sabe disso

Próximo passo que eu faria: pegar a janela gratuita de duas semanas no CodeBuddy ou plugar via OpenRouter num projeto real, medir custo e velocidade numa tarefa que você já conhece bem, e só depois pensar em migrar fluxo de trabalho

Benchmark de slide é fácil, o teu projeto é que decide…

Até o próximo post! 😀

Perguntas frequentes

O Hy4 preview é open source?

Sim, a Tencent publicou os pesos no Hugging Face em tencent/Hy4-preview e também numa versão tencent/Hy4-preview-FP8, ambas sob licença Apache 2.0. O código do projeto também está aberto no GitHub, em github.com/Tencent-Hunyuan/Hy4-preview, como aparece na seção de como testar o modelo.

O Hy4 preview é gratuito para usar?

No lançamento, sim: o modelo ficou gratuito por duas semanas no WorkBuddy e no CodeBuddy, dois produtos da própria Tencent. Fora desse período, o acesso via API segue a tabela normal de preços, com entrada a US$ 0,834 por milhão de tokens.

Dá para fazer deploy do Hy4 preview na própria infraestrutura?

Dá, já que os pesos estão abertos sob licença Apache 2.0. Existe uma página de deploy do modelo na documentação do SGLang, referenciada a partir do model card no Hugging Face, e é o caminho pra quem quer rodar por conta própria em vez de acessar via API.

Onde posso usar o Hy4 preview sem instalar nada?

O modelo já está disponível dentro dos produtos WorkBuddy, CodeBuddy, Yuanbao e ima. Se preferir integrar via API, o acesso é feito pela Tencent Cloud TokenHub ou pelo OpenRouter, os mesmos caminhos citados no post.

Qual a diferença entre o Hy4 preview e o Hy4 preview-FP8?

As duas versões foram publicadas juntas no Hugging Face, sob a mesma licença Apache 2.0. A FP8 é a variante em ponto flutuante de 8 bits, pensada pra quem quer rodar o modelo consumindo menos memória de GPU.

O Hy4 preview supera modelos como Kimi K3 e GLM-5.3?

Segundo avaliação cega interna da própria Tencent, com 163 especialistas julgando 203 tarefas de engenharia, o modelo tirou média 2,99 de 4, contra 2,94 do Kimi K3 e 2,92 do GLM-5.3. Vale lembrar que esse número saiu da fabricante, não de um teste independente.




Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação SAAS com IA

Formação SAAS com IA

Tire usas ideias do papel criando softwares com IA, integre pagamentos e lance seu projeto!

  • 291 aulas
  • 18 projetos
  • 24h 17min

Blog | Mais populares