DeepSeek V4 Pro: o que é e quando compensa usar em vez do V4 Flash?

DeepSeek V4 Pro rodando com janela de contexto de 1 milhão de tokens
Resposta rápida

O DeepSeek V4 Pro é o modelo maior da linha V4: Mixture-of-Experts com 1,6 trilhão de parâmetros totais, 49 bilhões ativos por token, janela de 1 milhão de tokens e saída máxima de 384 mil tokens, com pesos abertos sob licença MIT. Na API oficial ele sai por US$ 0,435 por 1M de tokens de entrada sem cache e US$ 0,87 na saída, o triplo do custo combinado medido no V4 Flash 0731. Só que o Flash marca 50 no Intelligence Index do Artificial Analysis contra 44 do Pro. Resumo: o Pro compensa em contexto gigante, saída muito longa e infra própria, não como padrão pra código

Fala aí, beleza? A DeepSeek soltou o modelo mais gigante da linha V4 e, mesmo sendo o maior de todos, ele NÃO é a escolha óbvia pra quem quer codar hoje

O DeepSeek V4 Pro chegou como preview em 24 de abril de 2026, junto do V4 Flash, os dois com pesos abertos sob licença MIT

Esse post aqui é sobre decisão de custo, não sobre hype: o que o modelo é de fato, o que os números medidos mostram e em que situação faz sentido pagar o Pro em vez de ficar no Flash 🙂

O que é o DeepSeek V4 Pro

A ficha técnica dele é insana, vamos por partes

O V4 Pro é um modelo Mixture-of-Experts com 1,6 trilhão de parâmetros totais e 49 bilhões ativos por token

Se você nunca mexeu com MoE, pensa nele como um time enorme de especialistas onde só uma parte é chamada pra responder cada token: o modelo é gigante no total, mas o que roda de fato por token é uma fatia

A janela de contexto é de 1 milhão de tokens e a saída máxima chega a 384 mil tokens

Na API oficial o nome do modelo é deepseek-v4-pro, e os pesos estão publicados no repositório deepseek-ai/DeepSeek-V4-Pro no Hugging Face, sob licença MIT

Por que a série V4 aguenta contexto longo sem explodir o custo:

A série V4 usa um mecanismo híbrido de atenção, combinando Compressed Sparse Attention (CSA) e Heavily Compressed Attention (HCA)

E o efeito prático é o que interessa: em contexto de 1 milhão de tokens, o V4 Pro usa 27% dos FLOPs de inferência por token e 10% do cache KV do V3.2

"Cache KV?" É a memória que o modelo carrega do que já leu na conversa, e é ela que costuma pesar quando o contexto cresce

Ou seja, contexto longo aqui não é só um número grande na caixinha de especificação, é uma mudança de arquitetura pra sustentar esse número

E qual é o status dele hoje:

Preview, ainda

O changelog de 31 de julho de 2026 atualizou apenas o V4 Flash e registrou que a versão oficial do V4-Pro viria depois

Tome cuidado com isso na hora de encostar produção em cima dele

DeepSeek V4 Pro x V4 Flash: preço, inteligência e velocidade

Agora a parte que decide a conta

ItemV4 Pro (deepseek-v4-pro)V4 Flash 0731 (deepseek-v4-flash)
Parâmetros1,6T totais / 49B ativos284B totais / 13B ativos
Entrada sem cache (1M tokens)US$ 0,435US$ 0,14
Entrada com cache (1M tokens)US$ 0,003625sem dado verificado aqui
Saída (1M tokens)US$ 0,87US$ 0,28
Custo combinado medido (Artificial Analysis, mistura 7:2:1)US$ 0,18 por 1M tokensUS$ 0,06 por 1M tokens
Intelligence Index (Reasoning, Max Effort)4450
Intelligence Index (High Effort)43sem dado verificado aqui
Intelligence Index sem raciocínio39sem dado verificado aqui
Velocidade de saída (Max Effort)55 tokens/s (média medida: 63)sem dado verificado aqui
Tokens gerados na rodada do índice180M (mediana: 100M)sem dado verificado aqui

Lendo a tabela sem passar a mão na cabeça de ninguém: o modelo maior e mais caro está mais lento que a média medida, mais falante no raciocínio e ATRÁS do irmão menor no índice vivo

A mediana dos modelos comparáveis no Intelligence Index é 25, então os 44 do Pro não são pouco

Só que o Flash 0731 marca 50 custando um terço do custo combinado, e isso muda tudo na decisão

Em quais situações o V4 Pro faz sentido

Existe caso pro Pro, sim, ele só não é "o melhor pra tudo"

1. Contexto gigante em uma tomada só. Quando você precisa jogar um monte de material junto e ler tudo de uma vez, o 1 milhão de tokens de contexto entra em jogo, e o CSA+HCA derruba o custo desse contexto longo (27% dos FLOPs por token e 10% do cache KV do V3.2). É o tipo de tarefa que aparece muito em automação de documento, tipo quando alguém resolve automatizar processos seletivos com IA e precisa passar pilha de arquivo de uma vez

2. Resposta única muito longa. A saída máxima é de 384 mil tokens. Se o que você quer é UMA resposta enorme, e não vinte trocas curtas, aqui o teto ajuda

3. Prompt repetido com cache quente. A entrada com cache hit cai pra US$ 0,003625 por 1M de tokens. Isso favorece pipeline com prompt fixo e grande repetido muitas vezes, tipo aqueles fluxos de qualificação de leads no n8n onde a mesma base de instrução vai junto em toda chamada

4. Rodar em infra própria. Os pesos estão no Hugging Face sob MIT. Aí a decisão não é preço de API, é soberania: os dados não saem de casa e o modelo é seu

O contraponto que você precisa ouvir antes de escolher:

Se a sua tarefa é agêntica, terminal, ferramenta, loop de execução, o Flash 0731 leva

O V4 Flash 0731 superou o V4 Pro preview em todos os nove benchmarks agênticos publicados pela DeepSeek

No Terminal Bench 2.1 foi 82,7 do Flash contra 72,1 do Pro preview

E isso vindo de um modelo de 284B totais / 13B ativos contra um de 1,6T totais / 49B ativos… se liga nisso

O que muda no seu código e na sua conta

Tem uns detalhes operacionais que mordem quem já usa a API, então bora listar

  1. Os nomes antigos morreram. deepseek-chat e deepseek-reasoner foram aposentados em 24/07/2026 às 15:59 UTC e ficaram inacessíveis. O erro comum aqui é achar que código velho "só ficou lento": ele simplesmente não acha mais o modelo
  1. Quem já chamava o Flash não precisou mexer em nada. Na atualização de 31 de julho, o V4 Flash 0731 manteve arquitetura e tamanho do preview: o que mudou foi o pós-treino. Mesmo endpoint, mesma chave, mesmo nome de modelo (deepseek-v4-flash)
  1. O Flash ganhou formato novo. O deepseek-v4-flash passou a suportar nativamente o formato da Responses API e foi adaptado para o Codex. Tome cuidado pra não assumir que isso vale automaticamente pro Pro: a confirmação de 31/07 é explicitamente sobre o Flash
  1. Preço de pico foi anunciado. A DeepSeek anunciou uma política de preço dobrado nos horários de pico, de 9:00 às 12:00 e de 14:00 às 18:00 no horário de Pequim (UTC+8), aplicável a todos os itens cobrados. Foi anunciada como mudança futura, sem data de vigência divulgada, então vale acompanhar antes de fechar planilha de custo

Quanto custou na prática rodar projetos com a API

Aqui eu falo do meu bolso, não de benchmark

No vídeo eu coloco 7 dólares de crédito na API e saio rodando projeto

No fim dos testes o gasto acumulado foi de 6,13 dólares, e cerca de 80% disso foi um projeto só, um clone de Instagram full stack (essa parte é estimativa minha, olhando o consumo)

Durante aquele teste do clone eu cheguei a ficar com 86 centavos de dólar de saldo, ou seja, dá pra ver o crédito derretendo em tempo real haha

Foram 5 projetos criados com um prompt só, e na minha avaliação eles chegaram em algo entre 80% e 85% de conclusão: perto de fechar, sem fechar os últimos detalhes

O recado do dado é simples: projeto pequeno gasta quase nada, projeto grande com muita interação e contexto crescendo é onde o dinheiro vai

E é exatamente aí que o triplo de custo do Pro pesa na decisão

No vídeo acima tu vê os testes rodando de verdade, projeto por projeto, com o gasto aparecendo na tela

Veredito: pagar pelo Pro ou ficar no Flash?

Sem ficar em cima do muro: pra código e tarefa agêntica, hoje o V4 Flash 0731 é a escolha padrão

No ranking vivo de modelos de pesos abertos do Artificial Analysis, o topo é Kimi K3 (max) com 57, GLM-5.2 (max) com 51 e DeepSeek V4 Flash 0731 (max) com 50

O V4 Pro não aparece entre os três primeiros

E o Flash custa um terço do custo combinado medido: US$ 0,06 contra US$ 0,18 por 1M de tokens

Agora, é justo dizer que a própria DeepSeek divulgou números fortes do Pro no anúncio do preview: SWE-bench Verified 80,6%, LiveCodeBench 93,5, Codeforces 3206 e GPQA Diamond 90,1

São dados do fabricante, e eu trato como tal: servem de indicação, não de veredito

Somando as duas coisas: o Pro segue em preview, e a versão oficial pode muito bem mudar essa conta…

Conclusão

O DeepSeek V4 Pro é o modelo maior da linha, com 1,6 trilhão de parâmetros totais, 1 milhão de tokens de contexto e 384 mil tokens de saída máxima, tudo com pesos abertos sob MIT

Mas maior não é sinônimo de melhor pro seu caso

O próximo passo prático é simples: comece no deepseek-v4-flash, meça o gasto real numa tarefa SUA (não em benchmark de ninguém) e só depois suba pro deepseek-v4-pro se a conta justificar

Reserve o Pro pro cenário onde ele é feito pra brilhar: contexto de 1M numa tomada só, saída muito longa, ou infra própria com os pesos na sua mão

E fica de olho na saída da versão oficial do V4 Pro, porque o Pro ainda está em preview e essa história tem continuação

Até o próximo post! 😀

Perguntas frequentes

Quanto custa usar o DeepSeek V4 Pro pela API oficial?

O DeepSeek V4 Pro sai por US$ 0,435 por milhão de tokens de entrada sem cache, US$ 0,003625 por milhão de tokens de entrada com cache e US$ 0,87 por milhão de tokens de saída. Pra comparar, o V4 Flash 0731 custa US$ 0,14 na entrada e US$ 0,28 na saída, por 1M de tokens. No custo combinado medido pelo Artificial Analysis, o Pro sai US$ 0,18 por 1M de tokens contra US$ 0,06 do Flash, ou seja, o triplo.

O DeepSeek V4 Pro é mais inteligente que o V4 Flash?

Não, pelo menos não no índice vivo do Artificial Analysis. O V4 Pro em esforço máximo marca 44 pontos no Intelligence Index, enquanto o V4 Flash 0731 marca 50 no mesmo modo. A mediana dos modelos comparáveis é 25, então os 44 do Pro ainda são bons, só que o irmão menor pontua mais alto e custa um terço.

O DeepSeek V4 Pro já saiu da fase de preview?

Não, em 3 de agosto de 2026 ele continua em preview. O changelog de 31 de julho de 2026 atualizou só o V4 Flash e registrou que a versão oficial do V4-Pro viria depois, então vale cuidado antes de colocar ele em produção.

Dá pra rodar o DeepSeek V4 Pro localmente com pesos abertos?

Dá sim. Os pesos do V4 Pro estão publicados no repositório deepseek-ai/DeepSeek-V4-Pro no Hugging Face, sob licença MIT. É a mesma licença aberta do V4 Flash, lançados juntos como preview em 24 de abril de 2026.

O V4 Flash é melhor que o V4 Pro em tarefas de código e terminal?

Sim, nos benchmarks agênticos publicados pela própria DeepSeek. O V4 Flash 0731, com 284B de parâmetros totais e 13B ativos, superou o V4 Pro preview (1,6T totais e 49B ativos) nos nove benchmarks agênticos divulgados. No Terminal Bench 2.1, por exemplo, foi 82,7 do Flash contra 72,1 do Pro.

Qual é o nome do modelo DeepSeek V4 Pro pra chamar na API?

É deepseek-v4-pro. Vale lembrar que os nomes antigos deepseek-chat e deepseek-reasoner foram aposentados em 24/07/2026 às 15:59 UTC e ficaram inacessíveis, então quem ainda usa esses nomes precisa migrar pro deepseek-v4-pro ou pro deepseek-v4-flash.




Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted
Inline Feedbacks
View all comments

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares