O que é o DeepSeek V4 e o que mudou nessa versão?

modelos DeepSeek V4 Pro e Flash com janela de contexto de 1 milhão de tokens
Resposta rápida

O DeepSeek V4 não é um modelo só: é uma família com dois modelos Mixture-of-Experts, o DeepSeek-V4-Pro (1,6T de parâmetros totais, 49B ativados) e o DeepSeek-V4-Flash (284B totais, 13B ativados), os dois com janela de 1 milhão de tokens. A novidade da versão é um mecanismo de atenção híbrido que combina CSA e HCA, com ramo local de janela deslizante: em contexto de 1M, o V4-Pro usa 27% dos FLOPs de inferência por token e 10% do KV cache do V3.2. A família estreou como preview em 24/04/2026 e o V4-Flash-0731 virou versão oficial em 31/07/2026, com pesos abertos sob licença MIT

Fala aí, beleza? A DeepSeek soltou uma família nova de modelos e o detalhe mais interessante não é o tamanho deles: é o preço da API e o fato de um deles ter os pesos publicados abertamente

Se você só ouviu o nome DeepSeek V4 passar na timeline e quer entender o que é antes de sair colocando crédito na API, esse post é a porta de entrada

A ideia aqui é simples: o que é essa família, o que mudou de verdade nessa versão, quanto custa e onde ela encaixa no dia a dia de quem programa com IA

O que é o DeepSeek V4

Primeiro ponto que confunde todo mundo: o V4 não é um modelo só

É uma família com dois modelos, o DeepSeek-V4-Pro e o DeepSeek-V4-Flash, ambos Mixture-of-Experts (MoE)

Os tamanhos são bem diferentes entre eles:

  • V4-Pro: 1,6T de parâmetros totais, com 49B ativados
  • V4-Flash: 284B de parâmetros totais, com 13B ativados

E os dois suportam janela de contexto de 1 milhão de tokens

O que significa "parâmetros ativados"?

Aqui vale a parada pra explicar, porque esse número muda tudo na conta

Em um modelo MoE, nem todo parâmetro trabalha em cada token gerado

O modelo é dividido em especialistas e um roteador escolhe quais entram em ação naquele momento

É como ter uma empresa com 1.600 funcionários e chamar só os 49 que entendem daquele assunto pra resolver o chamado: o quadro é gigante, mas a folha de cada tarefa é bem menor

Na prática pra você que programa: o total dita o quanto de máquina você precisa pra hospedar, e o ativado dita o custo e a velocidade de cada resposta

Por isso o Flash, com 13B ativados, é o barato da família, e o Pro, com 49B ativados, é o caro

O que mudou nessa versão: atenção híbrida e o checkpoint 0731

Duas coisas mudaram, e elas são de naturezas diferentes: uma é arquitetura, a outra é calendário 😀

A mudança de arquitetura: atenção híbrida

A novidade técnica da versão é um mecanismo de atenção híbrido, que alterna dois esquemas de compressão: Compressed Sparse Attention (CSA) combinada com Heavily Compressed Attention (HCA), com um ramo local de janela deslizante pra cuidar dos tokens recentes

Traduzindo o porquê disso existir: contexto longo é caro, e a conta explode justamente na atenção e no cache

O ganho medido aparece na comparação com o V3.2 em contexto de 1 milhão de tokens: o V4-Pro usa 27% dos FLOPs de inferência por token e 10% do KV cache do V3.2

Ou seja, o pulo aqui não foi só "ficar mais esperto", foi ficar muito mais barato de rodar em contexto grande

Se você quiser comparar com o passo anterior da casa, dá uma olhada nas novidades técnicas do DeepSeek 3.1

A linha do tempo: de preview a versão oficial

A família V4 não nasceu final, ela estreou como preview

  1. 24/04/2026: preview do V4-Pro e do V4-Flash publicado
  2. 31/07/2026: o checkpoint DeepSeek-V4-Flash-0731 é publicado e substitui o preview do Flash

E aqui vem a parte que muita gente leu errado: o 0731 não mudou arquitetura nem tamanho

É a mesma estrutura e o mesmo tamanho do V4-Flash preview (284B, backbone CSA+HCA)

O que foi refeito foi o pós-treino, com foco em uso agêntico

E o resultado disso apareceu: na página do Artificial Analysis, o V4-Flash 0731 marca 50 pontos no Intelligence Index, 10 pontos acima do V4 Flash de abril (que estava em 40) e 6 pontos acima do V4 Pro

Tem mais: segundo os nove benchmarks de agente reportados pela própria DeepSeek, o V4-Flash-0731 supera o V4-Pro (Preview) em todos eles, mesmo ativando muito menos parâmetros

O modelo menor passando o maior é o tipo de coisa que só acontece quando o pós-treino era o gargalo, não a capacidade bruta

V4-Flash e V4-Pro: qual é a diferença na prática

DeepSeek-V4-Flash DeepSeek-V4-Pro
Tamanho 284B totais / 13B ativados 1,6T totais / 49B ativados
Contexto 1 milhão de tokens 1 milhão de tokens
Status hoje Oficial desde o checkpoint 0731 (31/07/2026) Ainda em preview em 01/08/2026, com versão oficial prometida em seguida
Pesos abertos Sim, licença MIT no repositório deepseek-ai/DeepSeek-V4-Flash-0731 Não consta pesos publicados nas mesmas condições
Entrada por 1M tokens (cache miss) US$ 0,14 US$ 0,435
Entrada por 1M tokens (cache hit) US$ 0,0028 US$ 0,003625
Saída por 1M tokens US$ 0,28 US$ 0,87

Lendo a tabela de cima pra baixo, a conclusão é meio anti-intuitiva: hoje o modelo menor é o mais recomendável

Ele é o único que já saiu do preview, é o que tem pesos abertos sob licença MIT, custa cerca de um terço do Pro na saída e ainda ganha dele nos benchmarks agênticos publicados

O Pro continua sendo o topo de linha em tamanho, mas comprar tamanho não é o mesmo que comprar resultado, né?

O que muda pra quem já usa a API da DeepSeek

Essa parte é operacional e pega gente desprevenida

Os nomes antigos de modelo foram aposentados: deepseek-chat e deepseek-reasoner pararam de resolver em 24/07/2026

Os IDs válidos hoje são deepseek-v4-flash e deepseek-v4-pro

Se sua integração parou de responder do nada nessa data, é quase certo que é isso, e não bug do seu lado

Outras mudanças que vieram junto do 0731:

  • Suporte nativo à Responses API e adaptação explícita pra Codex no deepseek-v4-flash
  • O mesmo suporte pro deepseek-v4-pro estava previsto pro começo de agosto de 2026
  • O preço do Flash não subiu com a versão oficial: ficou igual ao do preview

E tem um detalhe de conta pra ficar no radar: foi anunciada uma cobrança 2x em horário de pico, das 9h às 12h e das 14h às 18h no horário de Pequim (UTC+8), com data de vigência a confirmar

Em 02/08/2026 essa sobretaxa ainda não estava ativa, mas ela existe no papel, então vale acompanhar a tabela oficial de preços antes de fechar orçamento de algo que roda em volume

Como o DeepSeek V4 se comportou no uso real

Aqui saio da documentação e falo do que eu vi

Eu criei uma chave de API da DeepSeek, coloquei crédito e apontei o Claude Code pro modelo, usando a versão Pro em todos os testes

Gerei 5 projetos, um prompt só pra cada, começando por uma landing page do próprio DeepSeek que buscava dados na internet pra montar um comparativo

O que eu achei do resultado, sem passar a mão na cabeça:

  • O design saiu mais pobre que o mesmo tipo de projeto feito no GPT 5.5: o header com animação não apareceu direito e os elementos ficaram mais simples
  • Em um teste anterior, o projeto saiu funcional, mas um pouco pior que o do GPT, que pareceu mais polido
  • Montei um sistema completo com autenticação, criação de conta, likes e comentários, e esse ficou bom mesmo, foi a exceção da bateria
  • Na maioria dos projetos, porém, o padrão foi o mesmo: o modelo entrega quase pronto, para perto do fim e deixa ponta solta

Na minha avaliação, ele costumava entregar de 80% a 85% do projeto

Ou seja, sobra ajuste humano, o que já era esperado, mas é bom saber disso antes e não no meio do desespero 🙂

Teve também o clássico da IA teimosa: pedi correção de um erro, ele disse que corrigiu e não tinha corrigido nada; na segunda tentativa apareceu um erro diferente e só depois resolveu

E o ponto que mais me impressionou foi o custo: cada execução dos projetos menores ficou em 20 a 30 centavos de dólar, quase não movia o saldo

O gasto maior veio do projeto com muito contexto acumulado, que usou 50% da janela de contexto

Tome cuidado com isso: a Pro custa mais que a Flash, e dá pra se surpreender com a conta se você sair usando Pro sem prestar atenção no contexto que está empilhando

Uma ressalva minha: todos esses testes foram projeto novo, do zero, então eu não tenho como te dizer como ele se vira continuando um projeto que outro modelo criou inteiro

Se for tentar esse caminho, vá com pé atrás e teste em coisa pequena antes

No vídeo abaixo eu mostro essa bateria de testes na tela, com os projetos rodando e o consumo de crédito aparecendo:

Onde o V4 se encaixa no seu dia a dia

Bora aos cenários concretos, amarrados só no que dá pra checar

Agente de código no terminal

O model card oficial do 0731 reporta 82,7 no Terminal-Bench 2.1, medido com o DeepSeek Harness em modo minimal, esforço máximo, top_p 0,95 e temperatura 1,0

Ressalva honesta: esse harness ainda não foi liberado, então pesquisador de fora não consegue reproduzir o setup completo hoje

É um bom sinal, não é prova independente

Tarefa de contexto muito longo

Com 1 milhão de tokens de janela e KV cache reduzido a 10% do V3.2 nesse regime, análise de base de código grande e documentação extensa entra bem aqui

É exatamente o tipo de tarefa que fica proibitiva por custo em outros modelos

Rodar local ou self-host

O V4-Flash-0731 tem pesos abertos sob licença MIT no repositório deepseek-ai/DeepSeek-V4-Flash-0731

Se o seu problema é dado que não pode sair de casa, essa é a variante que te interessa

(e sim, 284B totais pede infra séria, não é rodar no notebook do trabalho)

Volume alto com prompt repetido

A entrada com cache hit do Flash sai por US$ 0,0028 por 1 milhão de tokens

Pra fluxo que repete o mesmo bloco de instrução milhares de vezes, isso muda a natureza do projeto: coisa que não fechava a conta passa a fechar

Vale usar o DeepSeek V4 hoje?

Veredito curto: o V4-Flash-0731 é a escolha padrão hoje

Ele é oficial, tem pesos abertos, é o mais barato da família e ainda é o melhor nos benchmarks agênticos publicados

O V4-Pro pesa contra pra quem precisa de estabilidade, porque em 01/08/2026 ele seguia rotulado como preview, com a versão oficial prometida pra depois

Agora as ressalvas que eu faço questão de deixar na mesa:

  • O DeepSeek Harness não foi publicado, então aquele 82,7 do Terminal-Bench 2.1 não é reproduzível por terceiros hoje
  • Os nove benchmarks agênticos em que o Flash supera o Pro são reportados pela própria DeepSeek
  • A sobretaxa de horário de pico já foi anunciada e pode mudar a sua conta quando entrar em vigor

Nada disso invalida o modelo, mas benchmark de fabricante é ponto de partida, não veredito

O veredito quem dá é o seu projeto rodando

Conclusão

A família V4 é uma dupla MoE com 1 milhão de tokens de contexto, e a mudança real da versão foi a atenção híbrida CSA+HCA, que derrubou o custo de rodar contexto longo

Depois disso, o checkpoint 0731 tirou o Flash do preview mexendo só no pós-treino, e colocou o modelo menor na frente do maior nos testes agênticos da casa

Próximo passo concreto, se você já tem integração de pé: troque o ID do modelo pra deepseek-v4-flash e rode um projeto pequeno medindo custo e qualidade no seu próprio fluxo antes de migrar de vez

É barato o bastante pra esse teste sair por trocado, e é a única forma de saber se ele serve pro seu caso…

até o próximo post! 😀

Perguntas frequentes

O DeepSeek V4 já saiu oficialmente ou ainda é uma versão de teste?

Depende do modelo. O V4-Flash deixou de ser preview em 31/07/2026, quando o checkpoint DeepSeek-V4-Flash-0731 foi publicado e virou a versão oficial. Já o V4-Pro seguia em preview em 01/08/2026, com a DeepSeek prometendo a versão oficial em seguida.

Dá pra baixar os pesos do DeepSeek V4?

Do V4-Flash-0731 sim: os pesos estão publicados no Hugging Face, no repositório deepseek-ai/DeepSeek-V4-Flash-0731, sob licença MIT. O V4-Pro não tem pesos publicados nessas mesmas condições.

Por que o V4-Flash pontua mais que o V4-Pro em benchmarks de agente?

Porque o que mudou no checkpoint 0731 foi o pós-treino, focado em uso agêntico, e não a arquitetura ou o tamanho do modelo. O resultado apareceu nos números: o V4-Flash-0731 marca 50 pontos no Artificial Analysis Intelligence Index, 6 acima do V4-Pro, e supera o V4-Pro (Preview) nos nove benchmarks de agente publicados pela própria DeepSeek.

Como o DeepSeek V4 se sai rodando dentro do Claude Code?

Em uma rodada prática, foram criados 5 projetos com esse modelo dentro do Claude Code, um prompt pra cada um, todos do zero. Os projetos menores custaram entre 20 e 30 centavos de dólar por execução, e no mais pesado o uso da janela de contexto chegou a 50%. Nessas execuções, o modelo costumava entregar de 80% a 85% do projeto já pronto.

Existe horário mais caro pra usar a API do DeepSeek V4?

Foi anunciada uma cobrança 2x em horário de pico, das 9h às 12h e das 14h às 18h no horário de Pequim (UTC+8), mas ainda sem data de vigência confirmada. Em 02/08/2026 essa sobretaxa ainda não estava ativa, então vale acompanhar a tabela oficial de preços antes de rodar algo em volume.




Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted
Inline Feedbacks
View all comments

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares