O que é o DeepSeek V4 e o que mudou nessa versão?

O DeepSeek V4 não é um modelo só: é uma família com dois modelos Mixture-of-Experts, o DeepSeek-V4-Pro (1,6T de parâmetros totais, 49B ativados) e o DeepSeek-V4-Flash (284B totais, 13B ativados), os dois com janela de 1 milhão de tokens. A novidade da versão é um mecanismo de atenção híbrido que combina CSA e HCA, com ramo local de janela deslizante: em contexto de 1M, o V4-Pro usa 27% dos FLOPs de inferência por token e 10% do KV cache do V3.2. A família estreou como preview em 24/04/2026 e o V4-Flash-0731 virou versão oficial em 31/07/2026, com pesos abertos sob licença MIT
Fala aí, beleza? A DeepSeek soltou uma família nova de modelos e o detalhe mais interessante não é o tamanho deles: é o preço da API e o fato de um deles ter os pesos publicados abertamente
Se você só ouviu o nome DeepSeek V4 passar na timeline e quer entender o que é antes de sair colocando crédito na API, esse post é a porta de entrada
A ideia aqui é simples: o que é essa família, o que mudou de verdade nessa versão, quanto custa e onde ela encaixa no dia a dia de quem programa com IA
O que é o DeepSeek V4
Primeiro ponto que confunde todo mundo: o V4 não é um modelo só
É uma família com dois modelos, o DeepSeek-V4-Pro e o DeepSeek-V4-Flash, ambos Mixture-of-Experts (MoE)
Os tamanhos são bem diferentes entre eles:
- V4-Pro: 1,6T de parâmetros totais, com 49B ativados
- V4-Flash: 284B de parâmetros totais, com 13B ativados
E os dois suportam janela de contexto de 1 milhão de tokens
O que significa "parâmetros ativados"?
Aqui vale a parada pra explicar, porque esse número muda tudo na conta
Em um modelo MoE, nem todo parâmetro trabalha em cada token gerado
O modelo é dividido em especialistas e um roteador escolhe quais entram em ação naquele momento
É como ter uma empresa com 1.600 funcionários e chamar só os 49 que entendem daquele assunto pra resolver o chamado: o quadro é gigante, mas a folha de cada tarefa é bem menor
Na prática pra você que programa: o total dita o quanto de máquina você precisa pra hospedar, e o ativado dita o custo e a velocidade de cada resposta
Por isso o Flash, com 13B ativados, é o barato da família, e o Pro, com 49B ativados, é o caro
O que mudou nessa versão: atenção híbrida e o checkpoint 0731
Duas coisas mudaram, e elas são de naturezas diferentes: uma é arquitetura, a outra é calendário 😀
A mudança de arquitetura: atenção híbrida
A novidade técnica da versão é um mecanismo de atenção híbrido, que alterna dois esquemas de compressão: Compressed Sparse Attention (CSA) combinada com Heavily Compressed Attention (HCA), com um ramo local de janela deslizante pra cuidar dos tokens recentes
Traduzindo o porquê disso existir: contexto longo é caro, e a conta explode justamente na atenção e no cache
O ganho medido aparece na comparação com o V3.2 em contexto de 1 milhão de tokens: o V4-Pro usa 27% dos FLOPs de inferência por token e 10% do KV cache do V3.2
Ou seja, o pulo aqui não foi só "ficar mais esperto", foi ficar muito mais barato de rodar em contexto grande
Se você quiser comparar com o passo anterior da casa, dá uma olhada nas novidades técnicas do DeepSeek 3.1
A linha do tempo: de preview a versão oficial
A família V4 não nasceu final, ela estreou como preview
- 24/04/2026: preview do V4-Pro e do V4-Flash publicado
- 31/07/2026: o checkpoint DeepSeek-V4-Flash-0731 é publicado e substitui o preview do Flash
E aqui vem a parte que muita gente leu errado: o 0731 não mudou arquitetura nem tamanho
É a mesma estrutura e o mesmo tamanho do V4-Flash preview (284B, backbone CSA+HCA)
O que foi refeito foi o pós-treino, com foco em uso agêntico
E o resultado disso apareceu: na página do Artificial Analysis, o V4-Flash 0731 marca 50 pontos no Intelligence Index, 10 pontos acima do V4 Flash de abril (que estava em 40) e 6 pontos acima do V4 Pro
Tem mais: segundo os nove benchmarks de agente reportados pela própria DeepSeek, o V4-Flash-0731 supera o V4-Pro (Preview) em todos eles, mesmo ativando muito menos parâmetros
O modelo menor passando o maior é o tipo de coisa que só acontece quando o pós-treino era o gargalo, não a capacidade bruta
V4-Flash e V4-Pro: qual é a diferença na prática
| DeepSeek-V4-Flash | DeepSeek-V4-Pro | |
|---|---|---|
| Tamanho | 284B totais / 13B ativados | 1,6T totais / 49B ativados |
| Contexto | 1 milhão de tokens | 1 milhão de tokens |
| Status hoje | Oficial desde o checkpoint 0731 (31/07/2026) | Ainda em preview em 01/08/2026, com versão oficial prometida em seguida |
| Pesos abertos | Sim, licença MIT no repositório deepseek-ai/DeepSeek-V4-Flash-0731 | Não consta pesos publicados nas mesmas condições |
| Entrada por 1M tokens (cache miss) | US$ 0,14 | US$ 0,435 |
| Entrada por 1M tokens (cache hit) | US$ 0,0028 | US$ 0,003625 |
| Saída por 1M tokens | US$ 0,28 | US$ 0,87 |
Lendo a tabela de cima pra baixo, a conclusão é meio anti-intuitiva: hoje o modelo menor é o mais recomendável
Ele é o único que já saiu do preview, é o que tem pesos abertos sob licença MIT, custa cerca de um terço do Pro na saída e ainda ganha dele nos benchmarks agênticos publicados
O Pro continua sendo o topo de linha em tamanho, mas comprar tamanho não é o mesmo que comprar resultado, né?
O que muda pra quem já usa a API da DeepSeek
Essa parte é operacional e pega gente desprevenida
Os nomes antigos de modelo foram aposentados: deepseek-chat e deepseek-reasoner pararam de resolver em 24/07/2026
Os IDs válidos hoje são deepseek-v4-flash e deepseek-v4-pro
Se sua integração parou de responder do nada nessa data, é quase certo que é isso, e não bug do seu lado
Outras mudanças que vieram junto do 0731:
- Suporte nativo à Responses API e adaptação explícita pra Codex no
deepseek-v4-flash - O mesmo suporte pro
deepseek-v4-proestava previsto pro começo de agosto de 2026 - O preço do Flash não subiu com a versão oficial: ficou igual ao do preview
E tem um detalhe de conta pra ficar no radar: foi anunciada uma cobrança 2x em horário de pico, das 9h às 12h e das 14h às 18h no horário de Pequim (UTC+8), com data de vigência a confirmar
Em 02/08/2026 essa sobretaxa ainda não estava ativa, mas ela existe no papel, então vale acompanhar a tabela oficial de preços antes de fechar orçamento de algo que roda em volume
Como o DeepSeek V4 se comportou no uso real
Aqui saio da documentação e falo do que eu vi
Eu criei uma chave de API da DeepSeek, coloquei crédito e apontei o Claude Code pro modelo, usando a versão Pro em todos os testes
Gerei 5 projetos, um prompt só pra cada, começando por uma landing page do próprio DeepSeek que buscava dados na internet pra montar um comparativo
O que eu achei do resultado, sem passar a mão na cabeça:
- O design saiu mais pobre que o mesmo tipo de projeto feito no GPT 5.5: o header com animação não apareceu direito e os elementos ficaram mais simples
- Em um teste anterior, o projeto saiu funcional, mas um pouco pior que o do GPT, que pareceu mais polido
- Montei um sistema completo com autenticação, criação de conta, likes e comentários, e esse ficou bom mesmo, foi a exceção da bateria
- Na maioria dos projetos, porém, o padrão foi o mesmo: o modelo entrega quase pronto, para perto do fim e deixa ponta solta
Na minha avaliação, ele costumava entregar de 80% a 85% do projeto
Ou seja, sobra ajuste humano, o que já era esperado, mas é bom saber disso antes e não no meio do desespero 🙂
Teve também o clássico da IA teimosa: pedi correção de um erro, ele disse que corrigiu e não tinha corrigido nada; na segunda tentativa apareceu um erro diferente e só depois resolveu
E o ponto que mais me impressionou foi o custo: cada execução dos projetos menores ficou em 20 a 30 centavos de dólar, quase não movia o saldo
O gasto maior veio do projeto com muito contexto acumulado, que usou 50% da janela de contexto
Tome cuidado com isso: a Pro custa mais que a Flash, e dá pra se surpreender com a conta se você sair usando Pro sem prestar atenção no contexto que está empilhando
Uma ressalva minha: todos esses testes foram projeto novo, do zero, então eu não tenho como te dizer como ele se vira continuando um projeto que outro modelo criou inteiro
Se for tentar esse caminho, vá com pé atrás e teste em coisa pequena antes
No vídeo abaixo eu mostro essa bateria de testes na tela, com os projetos rodando e o consumo de crédito aparecendo:
Onde o V4 se encaixa no seu dia a dia
Bora aos cenários concretos, amarrados só no que dá pra checar
Agente de código no terminal
O model card oficial do 0731 reporta 82,7 no Terminal-Bench 2.1, medido com o DeepSeek Harness em modo minimal, esforço máximo, top_p 0,95 e temperatura 1,0
Ressalva honesta: esse harness ainda não foi liberado, então pesquisador de fora não consegue reproduzir o setup completo hoje
É um bom sinal, não é prova independente
Tarefa de contexto muito longo
Com 1 milhão de tokens de janela e KV cache reduzido a 10% do V3.2 nesse regime, análise de base de código grande e documentação extensa entra bem aqui
É exatamente o tipo de tarefa que fica proibitiva por custo em outros modelos
Rodar local ou self-host
O V4-Flash-0731 tem pesos abertos sob licença MIT no repositório deepseek-ai/DeepSeek-V4-Flash-0731
Se o seu problema é dado que não pode sair de casa, essa é a variante que te interessa
(e sim, 284B totais pede infra séria, não é rodar no notebook do trabalho)
Volume alto com prompt repetido
A entrada com cache hit do Flash sai por US$ 0,0028 por 1 milhão de tokens
Pra fluxo que repete o mesmo bloco de instrução milhares de vezes, isso muda a natureza do projeto: coisa que não fechava a conta passa a fechar
Vale usar o DeepSeek V4 hoje?
Veredito curto: o V4-Flash-0731 é a escolha padrão hoje
Ele é oficial, tem pesos abertos, é o mais barato da família e ainda é o melhor nos benchmarks agênticos publicados
O V4-Pro pesa contra pra quem precisa de estabilidade, porque em 01/08/2026 ele seguia rotulado como preview, com a versão oficial prometida pra depois
Agora as ressalvas que eu faço questão de deixar na mesa:
- O DeepSeek Harness não foi publicado, então aquele 82,7 do Terminal-Bench 2.1 não é reproduzível por terceiros hoje
- Os nove benchmarks agênticos em que o Flash supera o Pro são reportados pela própria DeepSeek
- A sobretaxa de horário de pico já foi anunciada e pode mudar a sua conta quando entrar em vigor
Nada disso invalida o modelo, mas benchmark de fabricante é ponto de partida, não veredito
O veredito quem dá é o seu projeto rodando
Conclusão
A família V4 é uma dupla MoE com 1 milhão de tokens de contexto, e a mudança real da versão foi a atenção híbrida CSA+HCA, que derrubou o custo de rodar contexto longo
Depois disso, o checkpoint 0731 tirou o Flash do preview mexendo só no pós-treino, e colocou o modelo menor na frente do maior nos testes agênticos da casa
Próximo passo concreto, se você já tem integração de pé: troque o ID do modelo pra deepseek-v4-flash e rode um projeto pequeno medindo custo e qualidade no seu próprio fluxo antes de migrar de vez
É barato o bastante pra esse teste sair por trocado, e é a única forma de saber se ele serve pro seu caso…
até o próximo post! 😀
Perguntas frequentes
O DeepSeek V4 já saiu oficialmente ou ainda é uma versão de teste?
Depende do modelo. O V4-Flash deixou de ser preview em 31/07/2026, quando o checkpoint DeepSeek-V4-Flash-0731 foi publicado e virou a versão oficial. Já o V4-Pro seguia em preview em 01/08/2026, com a DeepSeek prometendo a versão oficial em seguida.
Dá pra baixar os pesos do DeepSeek V4?
Do V4-Flash-0731 sim: os pesos estão publicados no Hugging Face, no repositório deepseek-ai/DeepSeek-V4-Flash-0731, sob licença MIT. O V4-Pro não tem pesos publicados nessas mesmas condições.
Por que o V4-Flash pontua mais que o V4-Pro em benchmarks de agente?
Porque o que mudou no checkpoint 0731 foi o pós-treino, focado em uso agêntico, e não a arquitetura ou o tamanho do modelo. O resultado apareceu nos números: o V4-Flash-0731 marca 50 pontos no Artificial Analysis Intelligence Index, 6 acima do V4-Pro, e supera o V4-Pro (Preview) nos nove benchmarks de agente publicados pela própria DeepSeek.
Como o DeepSeek V4 se sai rodando dentro do Claude Code?
Em uma rodada prática, foram criados 5 projetos com esse modelo dentro do Claude Code, um prompt pra cada um, todos do zero. Os projetos menores custaram entre 20 e 30 centavos de dólar por execução, e no mais pesado o uso da janela de contexto chegou a 50%. Nessas execuções, o modelo costumava entregar de 80% a 85% do projeto já pronto.
Existe horário mais caro pra usar a API do DeepSeek V4?
Foi anunciada uma cobrança 2x em horário de pico, das 9h às 12h e das 14h às 18h no horário de Pequim (UTC+8), mas ainda sem data de vigência confirmada. Em 02/08/2026 essa sobretaxa ainda não estava ativa, então vale acompanhar a tabela oficial de preços antes de rodar algo em volume.
Formações
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Blog | Mais populares

As diferenças de var, let e const

Como fazer redirecionamento com PHP
Neste artigo você vai aprender a como fazer redirecionamento com PHP, utilizaremos abordagens fáceis de entender e de aplicar Fala programador(a), beleza? Bora aprender mais […]

Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação
Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação A popularidade da automação de processos com o n8n está em alta, principalmente […]
