Hy4 preview vale a pena para quem programa? Veredito honesto por perfil de dev

veredito sobre o Hy4 preview da Tencent para quem programa
Resposta rápida

O Hy4 preview é o modelo aberto que a Tencent lançou e liberou o código em 28 de agosto de 2026, sob Apache License 2.0: MoE de 770 bilhões de parâmetros com 49 bilhões ativos por token, contexto de 1.048.576 tokens e saída máxima de 64.000. A API sai por US$ 0,834 por milhão de tokens de entrada e US$ 2,501 na saída. Faz sentido para tarefas longas, protótipos de jogos e times que precisam de pesos abertos. Não faz sentido para tarefa curta e repetitiva, já que a própria Tencent admite que o modelo raciocina mais que o necessário

Fala aí, beleza? Mais um modelo aberto chegando com a promessa de escrever código melhor que o vizinho, e a pergunta continua exatamente a mesma: isso muda alguma coisa no teu dia ou é só barulho?

A Tencent lançou e abriu o código do Hy4 preview em 28 de agosto de 2026, com os pesos publicados sob Apache License 2.0

Aqui não vai ter nem hype nem desprezo

A ideia é olhar a ficha técnica, o preço, o que o próprio fabricante admite que o modelo faz de errado, e fechar com um veredito por perfil de dev: trocar, testar em paralelo ou ignorar por enquanto

O que é o Hy4 preview e o que ele traz na ficha técnica

Ele é um modelo Mixture-of-Experts (MoE) de 770 bilhões de parâmetros no total, com 49 bilhões ativados por token

Que significa isso na prática? Que o modelo é gigante no papel, mas só acende uma fatia dele a cada token gerado

Se você conhece a ideia de carregar só o módulo que a rota precisa em vez de subir o sistema inteiro, é mais ou menos essa a lógica: capacidade grande armazenada, custo de inferência menor que o número total sugere

Formação Vibe Coding
Formação Recomendada

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

A arquitetura tem 78 camadas, sendo a primeira com FFN densa e as outras 77 em MoE

Cada camada MoE tem 256 experts roteados mais 1 compartilhado, com top-8 experts ativados por token

A atenção é Gated DeepSeek Sparse Attention (Gated DSA) com IndexCache, o pedaço que sustenta contexto longo sem estourar o custo de atenção

Contexto de 1M e saída de 64k: o que isso libera:

O contexto é de 1.048.576 tokens (1M) e a saída máxima é de 64.000 tokens

Pra quem programa, contexto de 1M é a diferença entre explicar o projeto em pedacinhos e simplesmente jogar o módulo inteiro, os testes, o schema e a documentação na mesa

E saída de 64.000 tokens dá espaço pra refactor grande sair em uma tacada só, sem aquele "continua…" no meio do arquivo

E o "preview" no nome? 🙂

Esse detalhe não é enfeite

A própria Tencent trata a versão como early, com headroom em pré-treino e pós-treino

Ou seja: o fabricante está dizendo, com todas as letras, que ainda tem melhoria pela frente

Tome cuidado ao ler qualquer resultado desse modelo como estado final, porque não é

Hy4 preview na comparação: preço, contexto e resultado em tarefas de engenharia

Bora aos números verificados, sem achismo

Item Hy4 preview
Parâmetros 770 bilhões no total, 49 bilhões ativos por token
Contexto 1.048.576 tokens (1M)
Saída máxima 64.000 tokens
Entrada (API, OpenRouter) US$ 0,834 por milhão de tokens
Saída (API, OpenRouter) US$ 2,501 por milhão de tokens
Leitura de cache US$ 0,042 por milhão de tokens
Preço em yuan (Tencent Cloud) 6 por milhão na entrada, 18 por milhão na saída
Licença dos pesos Apache License 2.0
Recursos de agente na API tools, tool_choice e JSON schema em response_format

Agora a parte que todo mundo quer ver, a comparação em tarefa de engenharia

Modelo Média (escala de 0,00 a 4,00)
Hy4 preview 2,99
Kimi K3 2,94
GLM-5.3 2,92

Essa avaliação é cega e interna da Tencent, com 163 especialistas e 203 tarefas de engenharia

E aqui vale a leitura honesta: a diferença entre 2,99 e 2,94 é magrinha

É avaliação do próprio fabricante, com metodologia dele, então trata como sinal de que o modelo está na mesma faixa dos concorrentes abertos, e não como prova de superioridade

O contraponto do outro lado do mercado também precisa entrar: o Claude Opus 5 segue na posição #1 do Artificial Analysis Intelligence Index (v4.1.1), com índice 63

Ou seja, o modelo da Tencent brigando de igual pra igual com Kimi e GLM é uma coisa

Brigar pelo topo absoluto é outra conversa, e essa conversa a avaliação interna não resolve

Em quais cenários esse modelo faz sentido de verdade

Se liga nos casos onde o perfil dele joga a teu favor

1. Tarefa longa de desenvolvimento

Contexto de 1M é o argumento mais concreto da ficha

Migração de legado, leitura de repositório inteiro, refactor que precisa enxergar dez arquivos ao mesmo tempo: é aqui que contexto grande deixa de ser número de marketing e vira menos retrabalho

2. Front-end e prototipagem de jogos

A Tencent posiciona o modelo para programação, trabalho de escritório, análise de dados, desenvolvimento de jogos e pesquisa científica

E afirma que ele gera um protótipo jogável a partir de um pedido em linguagem natural, além de refinar projetos complexos em interações de múltiplos turnos

Esse ciclo de pedir, ver rodando e ajustar é justamente o que mais aproxima quem quer criar sem saber codar de um resultado que existe na tela

3. Fluxo de agente

A API aceita tools e tool_choice para function calling, e saídas estruturadas via JSON schema em response_format

Pra quem monta agente, isso é o mínimo que precisa existir: chamar ferramenta e receber JSON que valida

Sem isso, todo agente vira parser de texto na unha, e ninguém merece

4. Time que precisa de pesos abertos

Apache License 2.0 é licença permissiva, e os pesos estão publicados de verdade

Pra empresa que tem exigência de dado não sair de casa, ter o peso na mão muda o jogo de "não posso usar IA aqui" pra "posso, se eu tiver a infra"

Guarda esse "se", porque a próxima seção é sobre ele

Quando não há motivo nenhum para trocar de modelo

Agora o outro lado, sem suavizar nada

Tarefa curta e repetitiva sai cara

A própria Tencent admite a limitação: o modelo tende a raciocinar por mais tempo que o necessário e a sobre-verificar o próprio trabalho, o que aumenta latência e consumo de tokens

E o modo de raciocínio padrão é high

Repara na conta: preço baixo por token não serve de nada se a tarefa gasta um monte de token pensando

Pra renomear variável, escrever commit e ajustar CSS de um botão, um modelo que se auto-audita três vezes é desperdício puro

Fluxo estável em ferramenta que não oferece o modelo

Hoje ele está nas versões chinesa e internacional do WorkBuddy e do CodeBuddy, além do Yuanbao e do ima, e via API pelo Tencent Cloud TokenHub e pelo OpenRouter

Se o teu dia acontece dentro de uma ferramenta que não está nessa lista, trocar de modelo significa trocar de ambiente inteiro

E trocar ambiente por 0,05 ponto numa avaliação interna do fabricante é péssimo negócio

A ilusão do self-host

Aqui a conta bate na porta

O deploy recomendado é com vLLM ou SGLang usando 8 GPUs (tensor parallel 8), e a versão quantizada FP8 tem cerca de 760 GB de pesos

Ou seja: "é open source, vou rodar em casa" não existe nesse caso, a não ser que a tua casa seja um datacenter

Pesos abertos aqui valem pra empresa com infra, não pro PC da Nasa que você acha que tem

Veredito por perfil de dev: trocar, testar ou ignorar

Compliance e infra própria: TROCAR

É o único perfil que ganha veredito de troca aqui, e o motivo não é ranking

Apache License 2.0 mais pesos publicados resolve um problema que dinheiro sozinho não resolve

Se você tem as 8 GPUs e o time de infra, troca mesmo: sai da API fechada e traz o modelo pra dentro de casa, porque nenhum concorrente proprietário te dá isso

Se não tem a infra, o veredito deixa de ser trocar e vira testar pela API

Workflow consolidado em outro modelo: IGNORAR por enquanto

Sem números públicos de benchmark independente, com o modelo em status de preview assumido pelo fabricante e com diferença mínima na avaliação interna, não existe argumento pra desmontar o que já funciona

Deixa amadurecer, volta quando sair a versão que não tem "preview" no nome

Dev solo e freela: testar em paralelo

O custo de experimentar é baixo, ainda mais porque o modelo está gratuito por duas semanas no WorkBuddy e no CodeBuddy a partir do lançamento

Mas não migra teu fluxo de trabalho por causa de um lançamento

Roda a mesma tarefa que você já sabe resolver e compara o resultado, é o teste mais honesto que existe

Dev de produto em time: testar, com escopo fechado

Pega uma tarefa longa de verdade, dessas que se beneficiam do contexto de 1M, e mede

O que corrói a vantagem de preço não é a tabela, é o excesso de raciocínio que o próprio fabricante admite

Se o time já tem processo montado em cima de outro modelo, vale antes revisitar se o Claude Code vale a pena pro teu caso, e só então comparar de igual pra igual

Quem faz jogos e protótipos: testar, e com bastante vontade

É o cenário que a Tencent posiciona explicitamente, incluindo protótipo jogável a partir de linguagem natural e refino em múltiplos turnos

Protótipo é o lugar onde "quase certo" já entrega valor, então o perfil casa

Conclusão

"Preview" é a palavra mais importante do nome, e ela pede teste controlado, não migração 🙂

Só dois perfis fogem disso: quem tem infra e exigência de compliance troca, e quem tem workflow redondo em outro modelo ignora por enquanto

O caminho mais barato pra formar opinião própria é usar as duas semanas gratuitas no WorkBuddy e no CodeBuddy a partir do lançamento (e o acesso gratuito ao Hy3 nessas ferramentas foi estendido até 30 de setembro de 2026, então dá pra comparar geração contra geração)

Quem prefere plugar direto na API tem o Tencent Cloud TokenHub e o OpenRouter, com os parâmetros recomendados pelo model card: temperature 0.9 e top_p 1.0

E quem quer os pesos encontra o modelo no Hugging Face (tencent/Hy4-preview e a versão quantizada tencent/Hy4-preview-FP8), no ModelScope, no GitCode, no CNB e no repositório oficial

No fim, ranking nenhum decide por você

Pega a tarefa mais chata do teu projeto real, roda nos dois modelos e compara o resultado, é assim que a decisão para de ser opinião e vira dado

Me conta depois qual perfil é o teu e como foi o teste, até o próximo post!

Perguntas frequentes

Quanto custa usar o Hy4 preview pela API?

No OpenRouter, a entrada sai a US$ 0,834 por milhão de tokens e a saída a US$ 2,501 por milhão, com leitura de cache a US$ 0,042 por milhão. Na Tencent Cloud, em yuan, o preço é 6 por milhão na entrada e 18 por milhão na saída.

O Hy4 preview é gratuito para testar?

Sim, a Tencent liberou o modelo de graça por duas semanas no WorkBuddy e no CodeBuddy a partir do lançamento em 28 de agosto de 2026. Quem prefere ficar no modelo anterior também tem opção: o acesso gratuito ao Hy3 nesses mesmos produtos foi estendido até 30 de setembro de 2026.

Onde dá para usar o Hy4 preview além da API?

O modelo está disponível nas versões chinesa e internacional do WorkBuddy e do CodeBuddy, além do Yuanbao e do ima. Para quem quer integrar via código, o acesso é pelo Tencent Cloud TokenHub ou pelo OpenRouter.

Dá para rodar o Hy4 preview localmente, sem depender de API?

Dá, mas exige infraestrutura pesada: o deploy recomendado é com vLLM ou SGLang usando 8 GPUs em paralelo. Mesmo a versão quantizada FP8 tem cerca de 760 GB de pesos, então não é algo pra rodar em máquina comum.

O Hy4 preview é melhor que o Claude Opus 5 para programar?

Não dá pra afirmar isso. O Claude Opus 5 segue na posição #1 do Artificial Analysis Intelligence Index (v4.1.1), com índice 63, enquanto o resultado do modelo da Tencent vem de uma avaliação cega interna da própria empresa, com 163 especialistas e 203 tarefas de engenharia. São métricas diferentes, então brigar de igual pra igual com Kimi K3 e GLM-5.3 não equivale a brigar pelo topo do ranking geral.

Posso usar o Hy4 preview em projeto comercial fechado?

Os pesos foram publicados sob Apache License 2.0, que é uma licença permissiva, então o uso comercial é possível. Isso vale principalmente para quem tem exigência de manter os dados na própria infraestrutura, já que os pesos estão disponíveis para baixar e rodar por conta própria.



Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação SAAS com IA

Formação SAAS com IA

Tire usas ideias do papel criando softwares com IA, integre pagamentos e lance seu projeto!

  • 291 aulas
  • 18 projetos
  • 24h 17min

Blog | Mais populares