DeepSeek V4 Pro: o que é e quando compensa usar em vez do V4 Flash?

DeepSeek V4 Pro rodando com janela de contexto de 1 milhão de tokens
Resposta rápida

O DeepSeek V4 Pro é o modelo maior da linha V4: Mixture-of-Experts com 1,6 trilhão de parâmetros totais, 49 bilhões ativos por token, janela de 1 milhão de tokens e saída máxima de 384 mil tokens, com pesos abertos sob licença MIT. Na API oficial ele sai por US$ 0,435 por 1M de tokens de entrada sem cache e US$ 0,87 na saída, o triplo do custo combinado medido no V4 Flash 0731. Só que o Flash marca 50 no Intelligence Index do Artificial Analysis contra 44 do Pro. Resumo: o Pro compensa em contexto gigante, saída muito longa e infra própria, não como padrão pra código

Fala aí, beleza? A DeepSeek soltou o modelo mais gigante da linha V4 e, mesmo sendo o maior de todos, ele NÃO é a escolha óbvia pra quem quer codar hoje

O DeepSeek V4 Pro chegou como preview em 24 de abril de 2026, junto do V4 Flash, os dois com pesos abertos sob licença MIT

Esse post aqui é sobre decisão de custo, não sobre hype: o que o modelo é de fato, o que os números medidos mostram e em que situação faz sentido pagar o Pro em vez de ficar no Flash 🙂

O que é o DeepSeek V4 Pro

A ficha técnica dele é insana, vamos por partes

O V4 Pro é um modelo Mixture-of-Experts com 1,6 trilhão de parâmetros totais e 49 bilhões ativos por token

Se você nunca mexeu com MoE, pensa nele como um time enorme de especialistas onde só uma parte é chamada pra responder cada token: o modelo é gigante no total, mas o que roda de fato por token é uma fatia

A janela de contexto é de 1 milhão de tokens e a saída máxima chega a 384 mil tokens

Na API oficial o nome do modelo é deepseek-v4-pro, e os pesos estão publicados no repositório deepseek-ai/DeepSeek-V4-Pro no Hugging Face, sob licença MIT

Por que a série V4 aguenta contexto longo sem explodir o custo:

A série V4 usa um mecanismo híbrido de atenção, combinando Compressed Sparse Attention (CSA) e Heavily Compressed Attention (HCA)

E o efeito prático é o que interessa: em contexto de 1 milhão de tokens, o V4 Pro usa 27% dos FLOPs de inferência por token e 10% do cache KV do V3.2

"Cache KV?" É a memória que o modelo carrega do que já leu na conversa, e é ela que costuma pesar quando o contexto cresce

Ou seja, contexto longo aqui não é só um número grande na caixinha de especificação, é uma mudança de arquitetura pra sustentar esse número

E qual é o status dele hoje:

Preview, ainda

O changelog de 31 de julho de 2026 atualizou apenas o V4 Flash e registrou que a versão oficial do V4-Pro viria depois

Tome cuidado com isso na hora de encostar produção em cima dele

DeepSeek V4 Pro x V4 Flash: preço, inteligência e velocidade

Agora a parte que decide a conta

Item V4 Pro (deepseek-v4-pro) V4 Flash 0731 (deepseek-v4-flash)
Parâmetros 1,6T totais / 49B ativos 284B totais / 13B ativos
Entrada sem cache (1M tokens) US$ 0,435 US$ 0,14
Entrada com cache (1M tokens) US$ 0,003625 sem dado verificado aqui
Saída (1M tokens) US$ 0,87 US$ 0,28
Custo combinado medido (Artificial Analysis, mistura 7:2:1) US$ 0,18 por 1M tokens US$ 0,06 por 1M tokens
Intelligence Index (Reasoning, Max Effort) 44 50
Intelligence Index (High Effort) 43 sem dado verificado aqui
Intelligence Index sem raciocínio 39 sem dado verificado aqui
Velocidade de saída (Max Effort) 55 tokens/s (média medida: 63) sem dado verificado aqui
Tokens gerados na rodada do índice 180M (mediana: 100M) sem dado verificado aqui

Lendo a tabela sem passar a mão na cabeça de ninguém: o modelo maior e mais caro está mais lento que a média medida, mais falante no raciocínio e ATRÁS do irmão menor no índice vivo

A mediana dos modelos comparáveis no Intelligence Index é 25, então os 44 do Pro não são pouco

Só que o Flash 0731 marca 50 custando um terço do custo combinado, e isso muda tudo na decisão

Em quais situações o V4 Pro faz sentido

Existe caso pro Pro, sim, ele só não é "o melhor pra tudo"

1. Contexto gigante em uma tomada só. Quando você precisa jogar um monte de material junto e ler tudo de uma vez, o 1 milhão de tokens de contexto entra em jogo, e o CSA+HCA derruba o custo desse contexto longo (27% dos FLOPs por token e 10% do cache KV do V3.2). É o tipo de tarefa que aparece muito em automação de documento, tipo quando alguém resolve automatizar processos seletivos com IA e precisa passar pilha de arquivo de uma vez

2. Resposta única muito longa. A saída máxima é de 384 mil tokens. Se o que você quer é UMA resposta enorme, e não vinte trocas curtas, aqui o teto ajuda

3. Prompt repetido com cache quente. A entrada com cache hit cai pra US$ 0,003625 por 1M de tokens. Isso favorece pipeline com prompt fixo e grande repetido muitas vezes, tipo aqueles fluxos de qualificação de leads no n8n onde a mesma base de instrução vai junto em toda chamada

4. Rodar em infra própria. Os pesos estão no Hugging Face sob MIT. Aí a decisão não é preço de API, é soberania: os dados não saem de casa e o modelo é seu

O contraponto que você precisa ouvir antes de escolher:

Se a sua tarefa é agêntica, terminal, ferramenta, loop de execução, o Flash 0731 leva

O V4 Flash 0731 superou o V4 Pro preview em todos os nove benchmarks agênticos publicados pela DeepSeek

No Terminal Bench 2.1 foi 82,7 do Flash contra 72,1 do Pro preview

E isso vindo de um modelo de 284B totais / 13B ativos contra um de 1,6T totais / 49B ativos… se liga nisso

O que muda no seu código e na sua conta

Tem uns detalhes operacionais que mordem quem já usa a API, então bora listar

  1. Os nomes antigos morreram. deepseek-chat e deepseek-reasoner foram aposentados em 24/07/2026 às 15:59 UTC e ficaram inacessíveis. O erro comum aqui é achar que código velho "só ficou lento": ele simplesmente não acha mais o modelo
  1. Quem já chamava o Flash não precisou mexer em nada. Na atualização de 31 de julho, o V4 Flash 0731 manteve arquitetura e tamanho do preview: o que mudou foi o pós-treino. Mesmo endpoint, mesma chave, mesmo nome de modelo (deepseek-v4-flash)
  1. O Flash ganhou formato novo. O deepseek-v4-flash passou a suportar nativamente o formato da Responses API e foi adaptado para o Codex. Tome cuidado pra não assumir que isso vale automaticamente pro Pro: a confirmação de 31/07 é explicitamente sobre o Flash
  1. Preço de pico foi anunciado. A DeepSeek anunciou uma política de preço dobrado nos horários de pico, de 9:00 às 12:00 e de 14:00 às 18:00 no horário de Pequim (UTC+8), aplicável a todos os itens cobrados. Foi anunciada como mudança futura, sem data de vigência divulgada, então vale acompanhar antes de fechar planilha de custo

Quanto custou na prática rodar projetos com a API

Aqui eu falo do meu bolso, não de benchmark

No vídeo eu coloco 7 dólares de crédito na API e saio rodando projeto

No fim dos testes o gasto acumulado foi de 6,13 dólares, e cerca de 80% disso foi um projeto só, um clone de Instagram full stack (essa parte é estimativa minha, olhando o consumo)

Durante aquele teste do clone eu cheguei a ficar com 86 centavos de dólar de saldo, ou seja, dá pra ver o crédito derretendo em tempo real haha

Foram 5 projetos criados com um prompt só, e na minha avaliação eles chegaram em algo entre 80% e 85% de conclusão: perto de fechar, sem fechar os últimos detalhes

O recado do dado é simples: projeto pequeno gasta quase nada, projeto grande com muita interação e contexto crescendo é onde o dinheiro vai

E é exatamente aí que o triplo de custo do Pro pesa na decisão

No vídeo acima tu vê os testes rodando de verdade, projeto por projeto, com o gasto aparecendo na tela

Veredito: pagar pelo Pro ou ficar no Flash?

Sem ficar em cima do muro: pra código e tarefa agêntica, hoje o V4 Flash 0731 é a escolha padrão

No ranking vivo de modelos de pesos abertos do Artificial Analysis, o topo é Kimi K3 (max) com 57, GLM-5.2 (max) com 51 e DeepSeek V4 Flash 0731 (max) com 50

O V4 Pro não aparece entre os três primeiros

E o Flash custa um terço do custo combinado medido: US$ 0,06 contra US$ 0,18 por 1M de tokens

Agora, é justo dizer que a própria DeepSeek divulgou números fortes do Pro no anúncio do preview: SWE-bench Verified 80,6%, LiveCodeBench 93,5, Codeforces 3206 e GPQA Diamond 90,1

São dados do fabricante, e eu trato como tal: servem de indicação, não de veredito

Somando as duas coisas: o Pro segue em preview, e a versão oficial pode muito bem mudar essa conta…

Conclusão

O DeepSeek V4 Pro é o modelo maior da linha, com 1,6 trilhão de parâmetros totais, 1 milhão de tokens de contexto e 384 mil tokens de saída máxima, tudo com pesos abertos sob MIT

Mas maior não é sinônimo de melhor pro seu caso

O próximo passo prático é simples: comece no deepseek-v4-flash, meça o gasto real numa tarefa SUA (não em benchmark de ninguém) e só depois suba pro deepseek-v4-pro se a conta justificar

Reserve o Pro pro cenário onde ele é feito pra brilhar: contexto de 1M numa tomada só, saída muito longa, ou infra própria com os pesos na sua mão

E fica de olho na saída da versão oficial do V4 Pro, porque o Pro ainda está em preview e essa história tem continuação

Até o próximo post! 😀

Perguntas frequentes

Quanto custa usar o DeepSeek V4 Pro pela API oficial?

O DeepSeek V4 Pro sai por US$ 0,435 por milhão de tokens de entrada sem cache, US$ 0,003625 por milhão de tokens de entrada com cache e US$ 0,87 por milhão de tokens de saída. Pra comparar, o V4 Flash 0731 custa US$ 0,14 na entrada e US$ 0,28 na saída, por 1M de tokens. No custo combinado medido pelo Artificial Analysis, o Pro sai US$ 0,18 por 1M de tokens contra US$ 0,06 do Flash, ou seja, o triplo.

O DeepSeek V4 Pro é mais inteligente que o V4 Flash?

Não, pelo menos não no índice vivo do Artificial Analysis. O V4 Pro em esforço máximo marca 44 pontos no Intelligence Index, enquanto o V4 Flash 0731 marca 50 no mesmo modo. A mediana dos modelos comparáveis é 25, então os 44 do Pro ainda são bons, só que o irmão menor pontua mais alto e custa um terço.

O DeepSeek V4 Pro já saiu da fase de preview?

Não, em 3 de agosto de 2026 ele continua em preview. O changelog de 31 de julho de 2026 atualizou só o V4 Flash e registrou que a versão oficial do V4-Pro viria depois, então vale cuidado antes de colocar ele em produção.

Dá pra rodar o DeepSeek V4 Pro localmente com pesos abertos?

Dá sim. Os pesos do V4 Pro estão publicados no repositório deepseek-ai/DeepSeek-V4-Pro no Hugging Face, sob licença MIT. É a mesma licença aberta do V4 Flash, lançados juntos como preview em 24 de abril de 2026.

O V4 Flash é melhor que o V4 Pro em tarefas de código e terminal?

Sim, nos benchmarks agênticos publicados pela própria DeepSeek. O V4 Flash 0731, com 284B de parâmetros totais e 13B ativos, superou o V4 Pro preview (1,6T totais e 49B ativos) nos nove benchmarks agênticos divulgados. No Terminal Bench 2.1, por exemplo, foi 82,7 do Flash contra 72,1 do Pro.

Qual é o nome do modelo DeepSeek V4 Pro pra chamar na API?

É deepseek-v4-pro. Vale lembrar que os nomes antigos deepseek-chat e deepseek-reasoner foram aposentados em 24/07/2026 às 15:59 UTC e ficaram inacessíveis, então quem ainda usa esses nomes precisa migrar pro deepseek-v4-pro ou pro deepseek-v4-flash.




Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted
Inline Feedbacks
View all comments

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares