O que é o Hy4 preview, o modelo de 770B da Tencent?

Hy4 preview, modelo de linguagem de 770 bilhões de parâmetros da Tencent
Resposta rápida

O Hy4 preview é o modelo de linguagem de nova geração da Tencent, lançado e com pesos abertos em 28 de agosto de 2026 pelo Tencent Hy Team. É um Mixture-of-Experts de 770 bilhões de parâmetros totais com 49 bilhões ativos por token, janela de contexto de 1.048.576 tokens e saída máxima de 64.000 tokens na listagem da OpenRouter. Os pesos saíram sob licença Apache 2.0 no Hugging Face, ModelScope, GitCode e CNB, incluindo versão FP8. O foco declarado é engenharia de software de longo horizonte: entender, planejar, depurar e validar tarefas longas de desenvolvimento

Um modelo aberto de 770 bilhões de parâmetros caiu no colo de todo mundo hoje, com licença Apache 2.0 e 1 milhão de tokens de contexto 😀

O nome é Hy4 preview, vem do Tencent Hy Team (o pessoal do Hunyuan) e foi lançado e aberto em 28 de agosto de 2026

O foco declarado dele não é ficar bonito em demo de chat, e sim engenharia de software de longo horizonte: aquelas tarefas de desenvolvimento que não acabam em um prompt só

Aqui eu te conto o essencial, sem enrolação e sem inventar número

Ficha técnica do Hy4 preview: arquitetura, camadas e contexto de 1M

Ele é um modelo Mixture-of-Experts (MoE) com 770 bilhões de parâmetros no total e 49 bilhões ativos por token

Formação Claude Code
Formação Recomendada

Formação Claude Code

Domine Claude Code do absoluto zero até o avançado

  • 114 aulas
  • 4 projetos
  • 9h 18min

E o que significa isso? Se você já viu aquele monte de bilhões em ficha de modelo e ficou perdido, vale a analogia: pensa num escritório gigante com centenas de especialistas contratados

O total (770B) é o tamanho da folha de pagamento

O ativo (49B) é quem realmente senta na mesa pra resolver cada token que o modelo gera

A espinha dorsal tem 78 camadas: a primeira usa FFN densa e as outras 77 usam MoE, com 256 experts roteados mais 1 expert compartilhado

Por token, o roteamento ativa os top-8 roteados mais o compartilhado

Tem também Gated DeepSeek Sparse Attention (Gated DSA) com IndexCache, que reusa o índice esparso entre camadas, e uma camada MTP nativa pra decodificação especulativa

A janela de contexto é o número que chama atenção: 1.048.576 tokens, com saída máxima de 64.000 tokens conforme a listagem da OpenRouter

Ou seja, dá pra jogar repositório inteiro dentro e ainda sobra espaço, beleza?

Modelo aberto: licença, pesos e repositórios oficiais

Aqui mora a parte massa: os pesos foram publicados sob licença Apache 2.0

Não é aquele "open source com asterisco" que a gente vê por aí de vez em quando

O modelo está no Hugging Face em tencent/Hy4-preview, e também tem a versão quantizada tencent/Hy4-preview-FP8

Além do Hugging Face, os pesos estão no ModelScope, no GitCode e no CNB

O repositório oficial de código fica no GitHub, em Tencent-Hunyuan/Hy4-preview

E se tu pensa em rodar isso em servidor próprio, existem receitas oficiais de deploy: uma no vLLM Recipes e outra no cookbook da documentação do SGLang

Os números divulgados: Terminal Bench, DeepSWE e comparação com Kimi K3 e GLM-5.3

Agora, os números… e já aviso: TODOS eles vêm da própria Tencent

É resultado de fornecedor, não é teste independente, então lê com a régua ajustada

Avaliação Resultado Referência
Terminal Bench 2.1 85,4 reportado pela Tencent
DeepSWE 64,3 (era 28,0 na geração anterior) reportado pela Tencent
Avaliação cega interna (163 especialistas, 203 tarefas de engenharia) 2,99 de 4,00 Kimi K3: 2,94 / GLM-5.3: 2,92

O salto no DeepSWE, de 28,0 pra 64,3, é o número mais gritante da lista

Já a avaliação cega interna é aquela que pede mais cautela: 2,99 contra 2,94 e 2,92 é uma diferença bem apertada, e quem montou o teste foi a empresa dona do modelo

Pra situar o cenário dos modelos abertos chineses que aparecem nessa comparação, se liga neste vídeo:

Para que serve na prática

A Tencent listou os casos de uso oficiais e eles são bem pé no chão: programação, trabalho de escritório, análise de dados, desenvolvimento de jogos e pesquisa científica

Repara que não tem promessa de AGI nem papo de fórmula mágica, é produtividade do mundo real

O destaque do posicionamento é engenharia de software de longo horizonte

O que a empresa diz que melhorou nesse eixo: compreensão, planejamento, depuração e verificação de tarefas longas de desenvolvimento

Traduzindo pro seu dia: não é a tarefa de trocar uma cor de botão, é a que envolve entender o contexto, montar um plano, executar, quebrar, consertar e conferir se ficou de pé

Tem também melhora declarada em front-end, tanto na qualidade visual quanto na parte de interação

Como acessar o Hy4 preview hoje e quanto custa

Tu não precisa de um PC da Nasa pra experimentar, porque o modelo já está rodando dentro de produtos da Tencent

Ele está disponível no WorkBuddy e no CodeBuddy (versões chinesa e internacional), além do Yuanbao e do ima

E se liga nisso: no lançamento, ele ficou liberado de graça no WorkBuddy e no CodeBuddy por duas semanas

Quem prefere API tem dois caminhos oficiais: o Tencent Cloud TokenHub e a OpenRouter

Os preços na OpenRouter são estes:

  • Entrada: US$ 0,834 por milhão de tokens
  • Saída: US$ 2,501 por milhão de tokens
  • Leitura de cache: US$ 0,042 por milhão de tokens

A diferença entre US$ 0,834 de entrada e US$ 0,042 de cache hit é enorme, então quem for plugar isso em fluxo repetitivo faz bem em olhar o cache com carinho

Vale a pena olhar agora? O que a própria Tencent admite

Aqui vai o veredito honesto: o nome tem "preview" e não é decoração

A própria Tencent reconhece que é uma versão inicial com problemas conhecidos

Dois deles estão declarados no lançamento: o modelo gasta mais tempo do que o necessário raciocinando em tarefas complexas, e tem tendência a verificar demais o próprio trabalho

A empresa optou por lançar cedo justamente pra colher feedback, o que é uma escolha legítima, mas muda quem deve entrar agora

Faz sentido testar já se tu curte modelo aberto, quer avaliar Apache 2.0 pra uso próprio, tem tarefa longa de engenharia pra jogar nele ou simplesmente quer aproveitar a janela gratuita antes que ela feche

Convém esperar se tu depende de latência previsível em produção, porque raciocínio longo demais e auto verificação em excesso batem exatamente aí

E vale repetir: até agora os números que existem são os do fornecedor

Conclusão

O Hy4 preview é um MoE de 770B totais com 49B ativos, 78 camadas, contexto de mais de 1 milhão de tokens e pesos abertos sob Apache 2.0, mirando engenharia de software de longo horizonte

Os resultados divulgados são animadores, mas vieram da própria Tencent, e a empresa admite que essa é uma versão inicial

O próximo passo é simples: experimenta pela janela gratuita no WorkBuddy ou no CodeBuddy, ou plugue a API da OpenRouter num fluxo seu, e deixa o repositório oficial no radar pra quando sair a versão estável

Bora ver na prática? 😀

até o próximo post!

Perguntas frequentes

Quantos parâmetros o Hy4 preview ativa por token, do total de 770B?

São 770 bilhões de parâmetros no total, mas só 49 bilhões ativos por token. Isso porque é um modelo Mixture-of-Experts: por token, o roteamento liga os top-8 experts roteados mais o expert compartilhado, entre os 256 experts roteados disponíveis.

O Hy4 preview realmente roda com mais de 1 milhão de tokens de contexto?

Sim, a janela de contexto é de 1.048.576 tokens, conforme a listagem da OpenRouter. A saída máxima nessa mesma listagem é de 64.000 tokens.

Dá pra baixar os pesos e rodar em servidor próprio?

Dá, os pesos estão sob licença Apache 2.0 no Hugging Face, ModelScope, GitCode e CNB. Pra deploy existem receitas oficiais no vLLM Recipes e no cookbook de documentação do SGLang.

Existe uma versão quantizada do Hy4 preview?

Sim, além do repositório principal tencent/Hy4-preview no Hugging Face, tem a versão tencent/Hy4-preview-FP8, quantizada em FP8.

O Hy4 preview venceu o Kimi K3 e o GLM-5.3 em algum teste independente?

Não. A comparação com esses dois modelos veio de uma avaliação cega interna da própria Tencent, com 163 especialistas e 203 tarefas de engenharia, onde o modelo marcou 2,99 de 4,00 contra 2,94 do Kimi K3 e 2,92 do GLM-5.3. É uma diferença apertada e o teste foi montado pela empresa dona do modelo, então não é benchmark independente.

É possível usar o Hy4 preview de graça agora?

No lançamento, em 28 de agosto de 2026, ele ficou liberado de graça no WorkBuddy e no CodeBuddy por duas semanas. Fora esse período promocional, o acesso por API passa pelo Tencent Cloud TokenHub ou pela OpenRouter, com cobrança por token.




Escrito por | Matheus Battisti

Matheus Battisti
Fundador da Hora de Codar

Programador apaixonado pelo mundo das tecnologias, sempre buscando em aprender e se aprofundar em linguagens, frameworks e o que mais for necessário para executar um bom trabalho. Agora tem uma nova missão que é de passar seu conhecimento adiante para formar novos programadores e especializar mais os que já são.

Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares