DeepSeek V4 Pro ou Flash: qual usar em cada tarefa do seu projeto?

DeepSeek V4 Pro ou Flash não é uma escolha de vencedor único: os dois vivem bem no mesmo projeto. O V4-Flash 0731 marca 50 pontos no Artificial Analysis Intelligence Index contra 44 do V4-Pro (max) e custa US$ 0,14 por 1M de entrada e US$ 0,28 de saída, contra US$ 0,435 e US$ 0,87 do Pro. Os dois têm janela de 1 milhão de tokens e saída máxima de 384 mil. Mande volume e repetição pro Flash, guarde o Pro pra tarefa em que a margem de SWE-bench Verified (80,6% contra 79,0%) muda o resultado.
Escolher entre V4-Pro e V4-Flash não é escolher qual é o melhor, é escolher ONDE cada um entra no teu projeto
A família DeepSeek V4 chegou em 24 de abril de 2026 com as duas variantes publicadas como preview e pesos abertos sob licença MIT, e desde então a discussão virou torcida organizada: time Pro de um lado, time Flash do outro
Só que essa briga é meio boba 😀
O papo aqui é outro: montar um fluxo que usa os dois, separando tarefa que exige raciocínio longo de tarefa repetitiva e de alto volume
Se esse padrão de irmão menor e mais rápido te soa familiar, é a mesma conversa que rolou com o modelo rápido e barato do Google
Bora ver na prática?
V4-Pro x V4-Flash: o que muda entre as duas variantes
| Item | V4-Pro | V4-Flash (0731) |
|---|---|---|
| Parâmetros totais | 1,6 trilhão | 284 bilhões |
| Ativos por token | 49 bilhões | 13 bilhões |
| Janela de contexto | 1 milhão de tokens | 1 milhão de tokens |
| Saída máxima | 384 mil tokens | 384 mil tokens |
| Entrada, cache miss | US$ 0,435 por 1M | US$ 0,14 por 1M |
| Entrada, cache hit | US$ 0,003625 por 1M | US$ 0,0028 por 1M |
| Saída | US$ 0,87 por 1M | US$ 0,28 por 1M |
| reasoning_effort | high e max (low é tratado como high) | low, high e max |
| Saída em tokens por segundo | sem número conferido aqui | 113 |
| Tempo até o primeiro token | 1,73s | 1,21s |
| Artificial Analysis, variante max | 44 pontos | 50 pontos |
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Repara numa coisa: a janela é IGUAL nos dois, 1 milhão de tokens, com a saída dividindo a mesma janela do prompt
Ou seja, não existe aquele papo de "o menor não aguenta meu contexto", esse argumento morreu aqui
O que muda de verdade é o tamanho do modelo (1,6 trilhão contra 284 bilhões de parâmetros totais) e a conta no fim do mês
E aí vem a parte insana: o Pro custa cerca de 3x mais na entrada e 3x mais na saída, mas no Artificial Analysis Intelligence Index o Flash 0731 está 6 pontos À FRENTE dele na variante max
O Pro ainda ganha em benchmark de correção de bug real, SWE-bench Verified com Pro-Max em 80,6% contra 79,0% do Flash-Max
1,6 ponto percentual
Pagar 3x por isso faz sentido? Às vezes sim, na maior parte das tarefas não…
Qual tarefa mandar para cada modelo dentro do mesmo projeto
A lógica é a mesma de montar um time: tu não bota o cara mais caro pra fazer tudo, tu bota ele onde o erro dói
Se tu já pensou em dividir tarefa entre Opus e Sonnet, o raciocínio aqui é idêntico, só muda o fornecedor
O que mandar pro V4-Pro:
- decisão de arquitetura, aquela que atravessa muitos arquivos de uma vez
- bug real difícil, do tipo que já resistiu a duas tentativas do modelo menor
- refatoração grande onde uma escolha errada no começo contamina o resto
É tarefa de raciocínio longo, poucas chamadas por dia, e onde 1,6 ponto de acerto a mais no SWE-bench Verified realmente muda teu resultado
O que mandar pro V4-Flash:
- classificação e etiquetagem em massa
- extração de dado estruturado de texto solto
- reescrita, resumo, padronização de comentário
- varredura de arquivo, aquele passo chato que roda em cima de 300 arquivos do repo
É tarefa repetitiva, alto volume, resposta curta e verificável
Aqui o Flash é imbatível: US$ 0,14 por 1M de entrada, 113 tokens por segundo de saída e primeiro token em 1,21s contra 1,73s do Pro
Multiplica isso por milhares de chamadas e tu entende por que o roteamento importa mais que a escolha do "melhor modelo"
Como o roteamento acontece na prática:
A parte boa é que trocar de modelo é trocar UMA string
Os identificadores atuais são deepseek-v4-flash e deepseek-v4-pro
# alto volume, resposta direta: Flash sem raciocínio
resposta = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": prompt}],
extra_body={"thinking": {"type": "disabled"}},
)
# decisão pesada: Pro com raciocínio ligado
resposta = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[{"role": "user", "content": prompt}],
extra_body={"thinking": {"type": "enabled"}},
)
O padrão da API é thinking HABILITADO, então quem quer resposta rápida e barata precisa desligar na mão
Tome cuidado com isso: rodar mil classificações com raciocínio ligado por esquecimento é dinheiro indo embora sem tu perceber
E o nível de esforço do raciocínio?
O reasoning_effort aceita low, high e max, com padrão high
E aqui tem uma pegadinha boa: hoje só o deepseek-v4-flash suporta os três níveis
O deepseek-v4-pro suporta apenas high e max, e o low é tratado como high
Ou seja, o modo econômico de raciocínio existe justamente no modelo mais barato, o que reforça o Flash como padrão de entrada do teu fluxo
Duas coisas que pegam todo mundo no modo thinking:
A primeira: temperature, top_p, presence_penalty e frequency_penalty NÃO são suportados no modo thinking
E o pior, setar esses parâmetros não gera erro, simplesmente não tem efeito
Tu acha que ajustou a criatividade do modelo e não ajustou nada 🙂
A segunda: a cadeia de raciocínio não vem misturada na resposta, ela volta no campo reasoning_content, no mesmo nível do content
Quem faz parse só do content e reclama que "o modelo tá pensando dentro da resposta" tá lendo o campo errado
O cache automático é o que derruba a conta do lado de alto volume:
Esse é o detalhe que muita gente ignora e é justamente onde mora a economia
O Context Caching on Disk vem habilitado por padrão pra todos os usuários, sem alteração de código nenhuma
Ele funciona por prefixo comum entre requisições, ou seja: se as tuas mil chamadas de classificação começam com o mesmo bloco de instrução, esse prefixo tende a bater no cache
E olha a diferença de preço: entrada em cache hit no Flash sai por US$ 0,0028 por 1M contra US$ 0,14 no cache miss
É absurdo
Só que é best-effort, não garante 100% de acerto, então não dá pra fingir que a conta já está feita
Pra saber se tá funcionando, olha os campos prompt_cache_hit_tokens e prompt_cache_miss_tokens na resposta
Dica de desenho de prompt: parte fixa em cima, parte variável embaixo
Se tu joga o dado que muda no começo do prompt, o prefixo comum quebra e o cache não te ajuda em nada
O que aconteceu quando usei a API em projetos reais
Aqui preciso ser honesto antes de qualquer coisa: no vídeo eu usei o V4-Pro em TODOS os testes
Não cheguei a testar o Flash na prática, então o que vem abaixo é conta do modelo caro, não do barato
Coloquei 7 dólares de crédito na API e gerei uma leva de projetos, cada um a partir de um prompt só, repetindo os mesmos projetos e os mesmos prompts de um teste anterior meu pra ter comparação direta
No fim, o consumo total ficou em 6,13 dólares
E o mais interessante não é o total, é a DISTRIBUIÇÃO dele
Os projetos menores custaram de 20 a 30 centavos de dólar cada um
O gasto disparou mesmo foi no projeto maior, um clone do Instagram full stack, onde o contexto foi crescendo a cada interação e chegou a usar 50% da janela
Meu chute (e é chute declarado, não medição) é que uns 80% da conta veio só desse projeto
Percebe como isso amarra com o bloco anterior? O que encarece não é "o modelo", é o contexto crescendo em cima do modelo caro, chamada após chamada
Sobre a qualidade, o veredito foi misto: no clone de terminal o cursor saiu desalinhado depois do cifrão, a indentação veio errada e um comando não foi reconhecido, mas o projeto ficou funcional
A landing page saiu com design mais pobre e a animação do header não apareceu direito
Já no tower defense o resultado foi MELHOR que o do teste anterior: upgrades funcionando, seleção de novas torres fluida e nada travando
No clone do Instagram ele não fez a autenticação, e ainda bati num erro, mandei corrigir, apareceu um erro diferente e depois resolveu
A correção foi fácil e rápida, e o layout ficou responsivo
Veredito: o fluxo que usa os dois faz mais sentido que escolher um
O V4-Flash 0731 virou o padrão de entrada da família, e não é achismo meu
Ele saiu de 61,8 para 82,7 no Terminal-Bench 2.1 entre o preview e a build de 31 de julho de 2026, subiu 10 pontos no Artificial Analysis Intelligence Index e figura entre os 3 primeiros modelos de pesos abertos do leaderboard, a 1 ponto do GPT-5.6 Luna (max, 51)
E o custo por tarefa dele fica cerca de 60% menor que o do GPT-5.6 Luna max na API de primeira mão da DeepSeek
Por isso a regra prática: começa tudo no Flash e promove pro Pro só a tarefa onde aquela margem de SWE-bench Verified pesa de verdade
Agora as ressalvas, porque post honesto tem ressalva:
- o
deepseek-v4-proainda estava como preview em 1 de agosto de 2026, com o changelog dizendo que o lançamento oficial vem em breve, sem data - a atualização de 31/07 valeu SÓ pro Flash na API: o changelog registra que a API do V4-Pro e os modelos usados no app e no site da DeepSeek não foram alterados
- a DeepSeek anunciou cobrança 2x em todos os itens nas janelas de 09:00 às 12:00 e 14:00 às 18:00 (horário de Pequim, UTC+8), mas a vigência depende de anúncio oficial e até hoje isso não foi anunciado, então o multiplicador não está sendo aplicado
- provedor de terceiro cobra diferente: no OpenRouter o V4 Flash aparece a US$ 0,0882 por 1M de entrada e US$ 0,1764 por 1M de saída
Ah, e um detalhe pra quem pensa em infra: o V4 é o primeiro modelo da DeepSeek otimizado pra chips chineses, tipo o Ascend da Huawei
Sobre benchmark divulgado pela própria empresa, sempre o mesmo aviso: tem fim comercial e não é verdade absoluta, faça o teste no TEU caso de uso 😉
Como começar o seu fluxo com as duas variantes
Recapitulando o que interessa: mesma janela, mesmo teto de saída, preço bem diferente e um Flash que hoje pontua acima do irmão maior no índice
O caminho pra começar é curtinho:
- Coloca TODAS as tarefas no
deepseek-v4-flashprimeiro, com thinking desligado no que for repetitivo. O erro comum aqui é o código antigo:deepseek-chatedeepseek-reasonerforam descontinuados em 24 de julho de 2026 às 15:59 UTC, então chamada velha simplesmente não te atende mais - Mede onde a qualidade falha de verdade antes de promover qualquer coisa pro
deepseek-v4-pro. O erro comum é promover por sensação, sem caso de teste que prove a falha - Antes de trocar de modelo, tenta subir o
reasoning_effortpramaxno próprio Flash. Lembra que no Pro olownem existe de fato, ele virahigh - Olha
prompt_cache_hit_tokenseprompt_cache_miss_tokensem cada resposta pra saber se o cache tá pegando. O erro comum é montar o prompt com a parte variável no começo, o que quebra o prefixo comum e mata o cache sem tu perceber
E se tu quiser fugir da API, os pesos do Flash estão públicos: o repositório deepseek-ai/DeepSeek-V4-Flash-0731 está no Hugging Face sem gate, sob licença MIT, substituindo o checkpoint de preview
(pra rodar isso local vai precisar de um PC da Nasa, mas a opção existe haha)
No fim das contas, quem tenta eleger um vencedor único paga caro nas duas pontas: ou gasta demais em tarefa boba, ou economiza na hora errada
até o próximo post!
Perguntas frequentes
O deepseek-chat e o deepseek-reasoner ainda funcionam na API da DeepSeek?
Não, os dois apelidos foram descontinuados em 24 de julho de 2026 às 15:59 UTC. Durante o período de graça ambos eram roteados pro V4-Flash (deepseek-chat sem thinking, deepseek-reasoner com thinking ligado). Hoje o certo é chamar direto pelos IDs atuais, deepseek-v4-flash e deepseek-v4-pro.
A cobrança em dobro em horário de pico da DeepSeek já está valendo?
Ainda não. A DeepSeek anunciou multiplicador de 2x em todos os itens de cobrança nas janelas das 09h às 12h e das 14h às 18h, no horário de Pequim (UTC+8). Até 3 de agosto de 2026 não houve anúncio oficial de data de início, então o preço cobrado continua o normal, sem esse adicional.
Por que o preço do V4-Flash em provedores como o OpenRouter é diferente do preço oficial da DeepSeek?
Porque cada provedor de terceiro define sua própria tabela em cima do modelo aberto. No OpenRouter o V4-Flash aparece a US$ 0,0882 por 1M de tokens de entrada e US$ 0,1764 por 1M de saída, valores distintos dos US$ 0,14 de entrada e US$ 0,28 de saída cobrados na API oficial da DeepSeek. Vale comparar antes de decidir onde rodar em produção.
O DeepSeek V4-Pro já saiu do status de preview?
Não, em 1 de agosto de 2026 o deepseek-v4-pro continuava listado como preview. O changelog da DeepSeek diz que o lançamento oficial vem em breve, mas sem data marcada até agora.
Dá pra baixar os pesos do V4-Flash 0731 e rodar localmente?
Sim, o repositório deepseek-ai/DeepSeek-V4-Flash-0731 está público e sem gate no Hugging Face, sob licença MIT. Ele substituiu o checkpoint da versão preview e mantém a mesma arquitetura e o mesmo tamanho, só com re-pós-treinamento.
O DeepSeek V4 depende de GPU da Nvidia pra rodar?
Não exclusivamente. A família V4 é o primeiro modelo da DeepSeek otimizado também para chips chineses, como o Ascend da Huawei, o que amplia as opções de hardware pra quem depende desse ecossistema.
Formações
Formação SAAS com IA
Tire usas ideias do papel criando softwares com IA, integre pagamentos e lance seu projeto!
- 291 aulas
- 18 projetos
- 24h 17min
Blog | Mais populares
As diferenças de var, let e const
Como fazer redirecionamento com PHP
Neste artigo você vai aprender a como fazer redirecionamento com PHP, utilizaremos abordagens fáceis de entender e de aplicar Fala programador(a), beleza? Bora aprender mais […]
Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação
Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação A popularidade da automação de processos com o n8n está em alta, principalmente […]
