Hy4 preview vale a pena para quem programa? Veredito honesto por perfil de dev

O Hy4 preview é o modelo aberto que a Tencent lançou e liberou o código em 28 de agosto de 2026, sob Apache License 2.0: MoE de 770 bilhões de parâmetros com 49 bilhões ativos por token, contexto de 1.048.576 tokens e saída máxima de 64.000. A API sai por US$ 0,834 por milhão de tokens de entrada e US$ 2,501 na saída. Faz sentido para tarefas longas, protótipos de jogos e times que precisam de pesos abertos. Não faz sentido para tarefa curta e repetitiva, já que a própria Tencent admite que o modelo raciocina mais que o necessário
Fala aí, beleza? Mais um modelo aberto chegando com a promessa de escrever código melhor que o vizinho, e a pergunta continua exatamente a mesma: isso muda alguma coisa no teu dia ou é só barulho?
A Tencent lançou e abriu o código do Hy4 preview em 28 de agosto de 2026, com os pesos publicados sob Apache License 2.0
Aqui não vai ter nem hype nem desprezo
A ideia é olhar a ficha técnica, o preço, o que o próprio fabricante admite que o modelo faz de errado, e fechar com um veredito por perfil de dev: trocar, testar em paralelo ou ignorar por enquanto
O que é o Hy4 preview e o que ele traz na ficha técnica
Ele é um modelo Mixture-of-Experts (MoE) de 770 bilhões de parâmetros no total, com 49 bilhões ativados por token
Que significa isso na prática? Que o modelo é gigante no papel, mas só acende uma fatia dele a cada token gerado
Se você conhece a ideia de carregar só o módulo que a rota precisa em vez de subir o sistema inteiro, é mais ou menos essa a lógica: capacidade grande armazenada, custo de inferência menor que o número total sugere
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
A arquitetura tem 78 camadas, sendo a primeira com FFN densa e as outras 77 em MoE
Cada camada MoE tem 256 experts roteados mais 1 compartilhado, com top-8 experts ativados por token
A atenção é Gated DeepSeek Sparse Attention (Gated DSA) com IndexCache, o pedaço que sustenta contexto longo sem estourar o custo de atenção
Contexto de 1M e saída de 64k: o que isso libera:
O contexto é de 1.048.576 tokens (1M) e a saída máxima é de 64.000 tokens
Pra quem programa, contexto de 1M é a diferença entre explicar o projeto em pedacinhos e simplesmente jogar o módulo inteiro, os testes, o schema e a documentação na mesa
E saída de 64.000 tokens dá espaço pra refactor grande sair em uma tacada só, sem aquele "continua…" no meio do arquivo
E o "preview" no nome? 🙂
Esse detalhe não é enfeite
A própria Tencent trata a versão como early, com headroom em pré-treino e pós-treino
Ou seja: o fabricante está dizendo, com todas as letras, que ainda tem melhoria pela frente
Tome cuidado ao ler qualquer resultado desse modelo como estado final, porque não é
Hy4 preview na comparação: preço, contexto e resultado em tarefas de engenharia
Bora aos números verificados, sem achismo
| Item | Hy4 preview |
|---|---|
| Parâmetros | 770 bilhões no total, 49 bilhões ativos por token |
| Contexto | 1.048.576 tokens (1M) |
| Saída máxima | 64.000 tokens |
| Entrada (API, OpenRouter) | US$ 0,834 por milhão de tokens |
| Saída (API, OpenRouter) | US$ 2,501 por milhão de tokens |
| Leitura de cache | US$ 0,042 por milhão de tokens |
| Preço em yuan (Tencent Cloud) | 6 por milhão na entrada, 18 por milhão na saída |
| Licença dos pesos | Apache License 2.0 |
| Recursos de agente na API | tools, tool_choice e JSON schema em response_format |
Agora a parte que todo mundo quer ver, a comparação em tarefa de engenharia
| Modelo | Média (escala de 0,00 a 4,00) |
|---|---|
| Hy4 preview | 2,99 |
| Kimi K3 | 2,94 |
| GLM-5.3 | 2,92 |
Essa avaliação é cega e interna da Tencent, com 163 especialistas e 203 tarefas de engenharia
E aqui vale a leitura honesta: a diferença entre 2,99 e 2,94 é magrinha
É avaliação do próprio fabricante, com metodologia dele, então trata como sinal de que o modelo está na mesma faixa dos concorrentes abertos, e não como prova de superioridade
O contraponto do outro lado do mercado também precisa entrar: o Claude Opus 5 segue na posição #1 do Artificial Analysis Intelligence Index (v4.1.1), com índice 63
Ou seja, o modelo da Tencent brigando de igual pra igual com Kimi e GLM é uma coisa
Brigar pelo topo absoluto é outra conversa, e essa conversa a avaliação interna não resolve
Em quais cenários esse modelo faz sentido de verdade
Se liga nos casos onde o perfil dele joga a teu favor
1. Tarefa longa de desenvolvimento
Contexto de 1M é o argumento mais concreto da ficha
Migração de legado, leitura de repositório inteiro, refactor que precisa enxergar dez arquivos ao mesmo tempo: é aqui que contexto grande deixa de ser número de marketing e vira menos retrabalho
2. Front-end e prototipagem de jogos
A Tencent posiciona o modelo para programação, trabalho de escritório, análise de dados, desenvolvimento de jogos e pesquisa científica
E afirma que ele gera um protótipo jogável a partir de um pedido em linguagem natural, além de refinar projetos complexos em interações de múltiplos turnos
Esse ciclo de pedir, ver rodando e ajustar é justamente o que mais aproxima quem quer criar sem saber codar de um resultado que existe na tela
3. Fluxo de agente
A API aceita tools e tool_choice para function calling, e saídas estruturadas via JSON schema em response_format
Pra quem monta agente, isso é o mínimo que precisa existir: chamar ferramenta e receber JSON que valida
Sem isso, todo agente vira parser de texto na unha, e ninguém merece
4. Time que precisa de pesos abertos
Apache License 2.0 é licença permissiva, e os pesos estão publicados de verdade
Pra empresa que tem exigência de dado não sair de casa, ter o peso na mão muda o jogo de "não posso usar IA aqui" pra "posso, se eu tiver a infra"
Guarda esse "se", porque a próxima seção é sobre ele
Quando não há motivo nenhum para trocar de modelo
Agora o outro lado, sem suavizar nada
Tarefa curta e repetitiva sai cara
A própria Tencent admite a limitação: o modelo tende a raciocinar por mais tempo que o necessário e a sobre-verificar o próprio trabalho, o que aumenta latência e consumo de tokens
E o modo de raciocínio padrão é high
Repara na conta: preço baixo por token não serve de nada se a tarefa gasta um monte de token pensando
Pra renomear variável, escrever commit e ajustar CSS de um botão, um modelo que se auto-audita três vezes é desperdício puro
Fluxo estável em ferramenta que não oferece o modelo
Hoje ele está nas versões chinesa e internacional do WorkBuddy e do CodeBuddy, além do Yuanbao e do ima, e via API pelo Tencent Cloud TokenHub e pelo OpenRouter
Se o teu dia acontece dentro de uma ferramenta que não está nessa lista, trocar de modelo significa trocar de ambiente inteiro
E trocar ambiente por 0,05 ponto numa avaliação interna do fabricante é péssimo negócio
A ilusão do self-host
Aqui a conta bate na porta
O deploy recomendado é com vLLM ou SGLang usando 8 GPUs (tensor parallel 8), e a versão quantizada FP8 tem cerca de 760 GB de pesos
Ou seja: "é open source, vou rodar em casa" não existe nesse caso, a não ser que a tua casa seja um datacenter
Pesos abertos aqui valem pra empresa com infra, não pro PC da Nasa que você acha que tem
Veredito por perfil de dev: trocar, testar ou ignorar
Compliance e infra própria: TROCAR
É o único perfil que ganha veredito de troca aqui, e o motivo não é ranking
Apache License 2.0 mais pesos publicados resolve um problema que dinheiro sozinho não resolve
Se você tem as 8 GPUs e o time de infra, troca mesmo: sai da API fechada e traz o modelo pra dentro de casa, porque nenhum concorrente proprietário te dá isso
Se não tem a infra, o veredito deixa de ser trocar e vira testar pela API
Workflow consolidado em outro modelo: IGNORAR por enquanto
Sem números públicos de benchmark independente, com o modelo em status de preview assumido pelo fabricante e com diferença mínima na avaliação interna, não existe argumento pra desmontar o que já funciona
Deixa amadurecer, volta quando sair a versão que não tem "preview" no nome
Dev solo e freela: testar em paralelo
O custo de experimentar é baixo, ainda mais porque o modelo está gratuito por duas semanas no WorkBuddy e no CodeBuddy a partir do lançamento
Mas não migra teu fluxo de trabalho por causa de um lançamento
Roda a mesma tarefa que você já sabe resolver e compara o resultado, é o teste mais honesto que existe
Dev de produto em time: testar, com escopo fechado
Pega uma tarefa longa de verdade, dessas que se beneficiam do contexto de 1M, e mede
O que corrói a vantagem de preço não é a tabela, é o excesso de raciocínio que o próprio fabricante admite
Se o time já tem processo montado em cima de outro modelo, vale antes revisitar se o Claude Code vale a pena pro teu caso, e só então comparar de igual pra igual
Quem faz jogos e protótipos: testar, e com bastante vontade
É o cenário que a Tencent posiciona explicitamente, incluindo protótipo jogável a partir de linguagem natural e refino em múltiplos turnos
Protótipo é o lugar onde "quase certo" já entrega valor, então o perfil casa
Conclusão
"Preview" é a palavra mais importante do nome, e ela pede teste controlado, não migração 🙂
Só dois perfis fogem disso: quem tem infra e exigência de compliance troca, e quem tem workflow redondo em outro modelo ignora por enquanto
O caminho mais barato pra formar opinião própria é usar as duas semanas gratuitas no WorkBuddy e no CodeBuddy a partir do lançamento (e o acesso gratuito ao Hy3 nessas ferramentas foi estendido até 30 de setembro de 2026, então dá pra comparar geração contra geração)
Quem prefere plugar direto na API tem o Tencent Cloud TokenHub e o OpenRouter, com os parâmetros recomendados pelo model card: temperature 0.9 e top_p 1.0
E quem quer os pesos encontra o modelo no Hugging Face (tencent/Hy4-preview e a versão quantizada tencent/Hy4-preview-FP8), no ModelScope, no GitCode, no CNB e no repositório oficial
No fim, ranking nenhum decide por você
Pega a tarefa mais chata do teu projeto real, roda nos dois modelos e compara o resultado, é assim que a decisão para de ser opinião e vira dado
Me conta depois qual perfil é o teu e como foi o teste, até o próximo post!
Perguntas frequentes
Quanto custa usar o Hy4 preview pela API?
No OpenRouter, a entrada sai a US$ 0,834 por milhão de tokens e a saída a US$ 2,501 por milhão, com leitura de cache a US$ 0,042 por milhão. Na Tencent Cloud, em yuan, o preço é 6 por milhão na entrada e 18 por milhão na saída.
O Hy4 preview é gratuito para testar?
Sim, a Tencent liberou o modelo de graça por duas semanas no WorkBuddy e no CodeBuddy a partir do lançamento em 28 de agosto de 2026. Quem prefere ficar no modelo anterior também tem opção: o acesso gratuito ao Hy3 nesses mesmos produtos foi estendido até 30 de setembro de 2026.
Onde dá para usar o Hy4 preview além da API?
O modelo está disponível nas versões chinesa e internacional do WorkBuddy e do CodeBuddy, além do Yuanbao e do ima. Para quem quer integrar via código, o acesso é pelo Tencent Cloud TokenHub ou pelo OpenRouter.
Dá para rodar o Hy4 preview localmente, sem depender de API?
Dá, mas exige infraestrutura pesada: o deploy recomendado é com vLLM ou SGLang usando 8 GPUs em paralelo. Mesmo a versão quantizada FP8 tem cerca de 760 GB de pesos, então não é algo pra rodar em máquina comum.
O Hy4 preview é melhor que o Claude Opus 5 para programar?
Não dá pra afirmar isso. O Claude Opus 5 segue na posição #1 do Artificial Analysis Intelligence Index (v4.1.1), com índice 63, enquanto o resultado do modelo da Tencent vem de uma avaliação cega interna da própria empresa, com 163 especialistas e 203 tarefas de engenharia. São métricas diferentes, então brigar de igual pra igual com Kimi K3 e GLM-5.3 não equivale a brigar pelo topo do ranking geral.
Posso usar o Hy4 preview em projeto comercial fechado?
Os pesos foram publicados sob Apache License 2.0, que é uma licença permissiva, então o uso comercial é possível. Isso vale principalmente para quem tem exigência de manter os dados na própria infraestrutura, já que os pesos estão disponíveis para baixar e rodar por conta própria.
Formações
Formação SAAS com IA
Tire usas ideias do papel criando softwares com IA, integre pagamentos e lance seu projeto!
- 291 aulas
- 18 projetos
- 24h 17min
Blog | Mais populares
As diferenças de var, let e const
Como fazer redirecionamento com PHP
Neste artigo você vai aprender a como fazer redirecionamento com PHP, utilizaremos abordagens fáceis de entender e de aplicar Fala programador(a), beleza? Bora aprender mais […]
Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação
Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação A popularidade da automação de processos com o n8n está em alta, principalmente […]
