DeepSeek V4 Pro: o que é e quando compensa usar em vez do V4 Flash?

O DeepSeek V4 Pro é o modelo maior da linha V4: Mixture-of-Experts com 1,6 trilhão de parâmetros totais, 49 bilhões ativos por token, janela de 1 milhão de tokens e saída máxima de 384 mil tokens, com pesos abertos sob licença MIT. Na API oficial ele sai por US$ 0,435 por 1M de tokens de entrada sem cache e US$ 0,87 na saída, o triplo do custo combinado medido no V4 Flash 0731. Só que o Flash marca 50 no Intelligence Index do Artificial Analysis contra 44 do Pro. Resumo: o Pro compensa em contexto gigante, saída muito longa e infra própria, não como padrão pra código
Fala aí, beleza? A DeepSeek soltou o modelo mais gigante da linha V4 e, mesmo sendo o maior de todos, ele NÃO é a escolha óbvia pra quem quer codar hoje
O DeepSeek V4 Pro chegou como preview em 24 de abril de 2026, junto do V4 Flash, os dois com pesos abertos sob licença MIT
Esse post aqui é sobre decisão de custo, não sobre hype: o que o modelo é de fato, o que os números medidos mostram e em que situação faz sentido pagar o Pro em vez de ficar no Flash 🙂
O que é o DeepSeek V4 Pro
A ficha técnica dele é insana, vamos por partes
O V4 Pro é um modelo Mixture-of-Experts com 1,6 trilhão de parâmetros totais e 49 bilhões ativos por token
Se você nunca mexeu com MoE, pensa nele como um time enorme de especialistas onde só uma parte é chamada pra responder cada token: o modelo é gigante no total, mas o que roda de fato por token é uma fatia
A janela de contexto é de 1 milhão de tokens e a saída máxima chega a 384 mil tokens
Na API oficial o nome do modelo é deepseek-v4-pro, e os pesos estão publicados no repositório deepseek-ai/DeepSeek-V4-Pro no Hugging Face, sob licença MIT
Por que a série V4 aguenta contexto longo sem explodir o custo:
A série V4 usa um mecanismo híbrido de atenção, combinando Compressed Sparse Attention (CSA) e Heavily Compressed Attention (HCA)
E o efeito prático é o que interessa: em contexto de 1 milhão de tokens, o V4 Pro usa 27% dos FLOPs de inferência por token e 10% do cache KV do V3.2
"Cache KV?" É a memória que o modelo carrega do que já leu na conversa, e é ela que costuma pesar quando o contexto cresce
Ou seja, contexto longo aqui não é só um número grande na caixinha de especificação, é uma mudança de arquitetura pra sustentar esse número
E qual é o status dele hoje:
Preview, ainda
O changelog de 31 de julho de 2026 atualizou apenas o V4 Flash e registrou que a versão oficial do V4-Pro viria depois
Tome cuidado com isso na hora de encostar produção em cima dele
DeepSeek V4 Pro x V4 Flash: preço, inteligência e velocidade
Agora a parte que decide a conta
| Item | V4 Pro (deepseek-v4-pro) |
V4 Flash 0731 (deepseek-v4-flash) |
|---|---|---|
| Parâmetros | 1,6T totais / 49B ativos | 284B totais / 13B ativos |
| Entrada sem cache (1M tokens) | US$ 0,435 | US$ 0,14 |
| Entrada com cache (1M tokens) | US$ 0,003625 | sem dado verificado aqui |
| Saída (1M tokens) | US$ 0,87 | US$ 0,28 |
| Custo combinado medido (Artificial Analysis, mistura 7:2:1) | US$ 0,18 por 1M tokens | US$ 0,06 por 1M tokens |
| Intelligence Index (Reasoning, Max Effort) | 44 | 50 |
| Intelligence Index (High Effort) | 43 | sem dado verificado aqui |
| Intelligence Index sem raciocínio | 39 | sem dado verificado aqui |
| Velocidade de saída (Max Effort) | 55 tokens/s (média medida: 63) | sem dado verificado aqui |
| Tokens gerados na rodada do índice | 180M (mediana: 100M) | sem dado verificado aqui |
Lendo a tabela sem passar a mão na cabeça de ninguém: o modelo maior e mais caro está mais lento que a média medida, mais falante no raciocínio e ATRÁS do irmão menor no índice vivo
A mediana dos modelos comparáveis no Intelligence Index é 25, então os 44 do Pro não são pouco
Só que o Flash 0731 marca 50 custando um terço do custo combinado, e isso muda tudo na decisão
Em quais situações o V4 Pro faz sentido
Existe caso pro Pro, sim, ele só não é "o melhor pra tudo"
1. Contexto gigante em uma tomada só. Quando você precisa jogar um monte de material junto e ler tudo de uma vez, o 1 milhão de tokens de contexto entra em jogo, e o CSA+HCA derruba o custo desse contexto longo (27% dos FLOPs por token e 10% do cache KV do V3.2). É o tipo de tarefa que aparece muito em automação de documento, tipo quando alguém resolve automatizar processos seletivos com IA e precisa passar pilha de arquivo de uma vez
2. Resposta única muito longa. A saída máxima é de 384 mil tokens. Se o que você quer é UMA resposta enorme, e não vinte trocas curtas, aqui o teto ajuda
3. Prompt repetido com cache quente. A entrada com cache hit cai pra US$ 0,003625 por 1M de tokens. Isso favorece pipeline com prompt fixo e grande repetido muitas vezes, tipo aqueles fluxos de qualificação de leads no n8n onde a mesma base de instrução vai junto em toda chamada
4. Rodar em infra própria. Os pesos estão no Hugging Face sob MIT. Aí a decisão não é preço de API, é soberania: os dados não saem de casa e o modelo é seu
O contraponto que você precisa ouvir antes de escolher:
Se a sua tarefa é agêntica, terminal, ferramenta, loop de execução, o Flash 0731 leva
O V4 Flash 0731 superou o V4 Pro preview em todos os nove benchmarks agênticos publicados pela DeepSeek
No Terminal Bench 2.1 foi 82,7 do Flash contra 72,1 do Pro preview
E isso vindo de um modelo de 284B totais / 13B ativos contra um de 1,6T totais / 49B ativos… se liga nisso
O que muda no seu código e na sua conta
Tem uns detalhes operacionais que mordem quem já usa a API, então bora listar
- Os nomes antigos morreram.
deepseek-chatedeepseek-reasonerforam aposentados em 24/07/2026 às 15:59 UTC e ficaram inacessíveis. O erro comum aqui é achar que código velho "só ficou lento": ele simplesmente não acha mais o modelo
- Quem já chamava o Flash não precisou mexer em nada. Na atualização de 31 de julho, o V4 Flash 0731 manteve arquitetura e tamanho do preview: o que mudou foi o pós-treino. Mesmo endpoint, mesma chave, mesmo nome de modelo (
deepseek-v4-flash)
- O Flash ganhou formato novo. O
deepseek-v4-flashpassou a suportar nativamente o formato da Responses API e foi adaptado para o Codex. Tome cuidado pra não assumir que isso vale automaticamente pro Pro: a confirmação de 31/07 é explicitamente sobre o Flash
- Preço de pico foi anunciado. A DeepSeek anunciou uma política de preço dobrado nos horários de pico, de 9:00 às 12:00 e de 14:00 às 18:00 no horário de Pequim (UTC+8), aplicável a todos os itens cobrados. Foi anunciada como mudança futura, sem data de vigência divulgada, então vale acompanhar antes de fechar planilha de custo
Quanto custou na prática rodar projetos com a API
Aqui eu falo do meu bolso, não de benchmark
No vídeo eu coloco 7 dólares de crédito na API e saio rodando projeto
No fim dos testes o gasto acumulado foi de 6,13 dólares, e cerca de 80% disso foi um projeto só, um clone de Instagram full stack (essa parte é estimativa minha, olhando o consumo)
Durante aquele teste do clone eu cheguei a ficar com 86 centavos de dólar de saldo, ou seja, dá pra ver o crédito derretendo em tempo real haha
Foram 5 projetos criados com um prompt só, e na minha avaliação eles chegaram em algo entre 80% e 85% de conclusão: perto de fechar, sem fechar os últimos detalhes
O recado do dado é simples: projeto pequeno gasta quase nada, projeto grande com muita interação e contexto crescendo é onde o dinheiro vai
E é exatamente aí que o triplo de custo do Pro pesa na decisão
No vídeo acima tu vê os testes rodando de verdade, projeto por projeto, com o gasto aparecendo na tela
Veredito: pagar pelo Pro ou ficar no Flash?
Sem ficar em cima do muro: pra código e tarefa agêntica, hoje o V4 Flash 0731 é a escolha padrão
No ranking vivo de modelos de pesos abertos do Artificial Analysis, o topo é Kimi K3 (max) com 57, GLM-5.2 (max) com 51 e DeepSeek V4 Flash 0731 (max) com 50
O V4 Pro não aparece entre os três primeiros
E o Flash custa um terço do custo combinado medido: US$ 0,06 contra US$ 0,18 por 1M de tokens
Agora, é justo dizer que a própria DeepSeek divulgou números fortes do Pro no anúncio do preview: SWE-bench Verified 80,6%, LiveCodeBench 93,5, Codeforces 3206 e GPQA Diamond 90,1
São dados do fabricante, e eu trato como tal: servem de indicação, não de veredito
Somando as duas coisas: o Pro segue em preview, e a versão oficial pode muito bem mudar essa conta…
Conclusão
O DeepSeek V4 Pro é o modelo maior da linha, com 1,6 trilhão de parâmetros totais, 1 milhão de tokens de contexto e 384 mil tokens de saída máxima, tudo com pesos abertos sob MIT
Mas maior não é sinônimo de melhor pro seu caso
O próximo passo prático é simples: comece no deepseek-v4-flash, meça o gasto real numa tarefa SUA (não em benchmark de ninguém) e só depois suba pro deepseek-v4-pro se a conta justificar
Reserve o Pro pro cenário onde ele é feito pra brilhar: contexto de 1M numa tomada só, saída muito longa, ou infra própria com os pesos na sua mão
E fica de olho na saída da versão oficial do V4 Pro, porque o Pro ainda está em preview e essa história tem continuação
Até o próximo post! 😀
Perguntas frequentes
Quanto custa usar o DeepSeek V4 Pro pela API oficial?
O DeepSeek V4 Pro sai por US$ 0,435 por milhão de tokens de entrada sem cache, US$ 0,003625 por milhão de tokens de entrada com cache e US$ 0,87 por milhão de tokens de saída. Pra comparar, o V4 Flash 0731 custa US$ 0,14 na entrada e US$ 0,28 na saída, por 1M de tokens. No custo combinado medido pelo Artificial Analysis, o Pro sai US$ 0,18 por 1M de tokens contra US$ 0,06 do Flash, ou seja, o triplo.
O DeepSeek V4 Pro é mais inteligente que o V4 Flash?
Não, pelo menos não no índice vivo do Artificial Analysis. O V4 Pro em esforço máximo marca 44 pontos no Intelligence Index, enquanto o V4 Flash 0731 marca 50 no mesmo modo. A mediana dos modelos comparáveis é 25, então os 44 do Pro ainda são bons, só que o irmão menor pontua mais alto e custa um terço.
O DeepSeek V4 Pro já saiu da fase de preview?
Não, em 3 de agosto de 2026 ele continua em preview. O changelog de 31 de julho de 2026 atualizou só o V4 Flash e registrou que a versão oficial do V4-Pro viria depois, então vale cuidado antes de colocar ele em produção.
Dá pra rodar o DeepSeek V4 Pro localmente com pesos abertos?
Dá sim. Os pesos do V4 Pro estão publicados no repositório deepseek-ai/DeepSeek-V4-Pro no Hugging Face, sob licença MIT. É a mesma licença aberta do V4 Flash, lançados juntos como preview em 24 de abril de 2026.
O V4 Flash é melhor que o V4 Pro em tarefas de código e terminal?
Sim, nos benchmarks agênticos publicados pela própria DeepSeek. O V4 Flash 0731, com 284B de parâmetros totais e 13B ativos, superou o V4 Pro preview (1,6T totais e 49B ativos) nos nove benchmarks agênticos divulgados. No Terminal Bench 2.1, por exemplo, foi 82,7 do Flash contra 72,1 do Pro.
Qual é o nome do modelo DeepSeek V4 Pro pra chamar na API?
É deepseek-v4-pro. Vale lembrar que os nomes antigos deepseek-chat e deepseek-reasoner foram aposentados em 24/07/2026 às 15:59 UTC e ficaram inacessíveis, então quem ainda usa esses nomes precisa migrar pro deepseek-v4-pro ou pro deepseek-v4-flash.
Formações
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Blog | Mais populares
As diferenças de var, let e const
Como fazer redirecionamento com PHP
Neste artigo você vai aprender a como fazer redirecionamento com PHP, utilizaremos abordagens fáceis de entender e de aplicar Fala programador(a), beleza? Bora aprender mais […]
ChatGPT: o que é, como usar, dicas e como acessar login
ChatGPT é uma ferramenta de processamento de linguagem natural (NLP) baseada na arquitetura GPT-3.5, desenvolvida pela OpenAI. Sua criação representa um marco significativo no campo […]