DeepSeek V4 Pro ou Flash: qual usar em cada tarefa do seu projeto?

comparação entre DeepSeek V4 Pro ou Flash para tarefas de código
Resposta rápida

DeepSeek V4 Pro ou Flash não é uma escolha de vencedor único: os dois vivem bem no mesmo projeto. O V4-Flash 0731 marca 50 pontos no Artificial Analysis Intelligence Index contra 44 do V4-Pro (max) e custa US$ 0,14 por 1M de entrada e US$ 0,28 de saída, contra US$ 0,435 e US$ 0,87 do Pro. Os dois têm janela de 1 milhão de tokens e saída máxima de 384 mil. Mande volume e repetição pro Flash, guarde o Pro pra tarefa em que a margem de SWE-bench Verified (80,6% contra 79,0%) muda o resultado.

Escolher entre V4-Pro e V4-Flash não é escolher qual é o melhor, é escolher ONDE cada um entra no teu projeto

A família DeepSeek V4 chegou em 24 de abril de 2026 com as duas variantes publicadas como preview e pesos abertos sob licença MIT, e desde então a discussão virou torcida organizada: time Pro de um lado, time Flash do outro

Só que essa briga é meio boba 😀

O papo aqui é outro: montar um fluxo que usa os dois, separando tarefa que exige raciocínio longo de tarefa repetitiva e de alto volume

Se esse padrão de irmão menor e mais rápido te soa familiar, é a mesma conversa que rolou com o modelo rápido e barato do Google

Bora ver na prática?

V4-Pro x V4-Flash: o que muda entre as duas variantes

Item V4-Pro V4-Flash (0731)
Parâmetros totais 1,6 trilhão 284 bilhões
Ativos por token 49 bilhões 13 bilhões
Janela de contexto 1 milhão de tokens 1 milhão de tokens
Saída máxima 384 mil tokens 384 mil tokens
Entrada, cache miss US$ 0,435 por 1M US$ 0,14 por 1M
Entrada, cache hit US$ 0,003625 por 1M US$ 0,0028 por 1M
Saída US$ 0,87 por 1M US$ 0,28 por 1M
reasoning_effort high e max (low é tratado como high) low, high e max
Saída em tokens por segundo sem número conferido aqui 113
Tempo até o primeiro token 1,73s 1,21s
Artificial Analysis, variante max 44 pontos 50 pontos
Formação Vibe Coding
Formação Recomendada

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Repara numa coisa: a janela é IGUAL nos dois, 1 milhão de tokens, com a saída dividindo a mesma janela do prompt

Ou seja, não existe aquele papo de "o menor não aguenta meu contexto", esse argumento morreu aqui

O que muda de verdade é o tamanho do modelo (1,6 trilhão contra 284 bilhões de parâmetros totais) e a conta no fim do mês

E aí vem a parte insana: o Pro custa cerca de 3x mais na entrada e 3x mais na saída, mas no Artificial Analysis Intelligence Index o Flash 0731 está 6 pontos À FRENTE dele na variante max

O Pro ainda ganha em benchmark de correção de bug real, SWE-bench Verified com Pro-Max em 80,6% contra 79,0% do Flash-Max

1,6 ponto percentual

Pagar 3x por isso faz sentido? Às vezes sim, na maior parte das tarefas não…

Qual tarefa mandar para cada modelo dentro do mesmo projeto

A lógica é a mesma de montar um time: tu não bota o cara mais caro pra fazer tudo, tu bota ele onde o erro dói

Se tu já pensou em dividir tarefa entre Opus e Sonnet, o raciocínio aqui é idêntico, só muda o fornecedor

O que mandar pro V4-Pro:

  • decisão de arquitetura, aquela que atravessa muitos arquivos de uma vez
  • bug real difícil, do tipo que já resistiu a duas tentativas do modelo menor
  • refatoração grande onde uma escolha errada no começo contamina o resto

É tarefa de raciocínio longo, poucas chamadas por dia, e onde 1,6 ponto de acerto a mais no SWE-bench Verified realmente muda teu resultado

O que mandar pro V4-Flash:

  • classificação e etiquetagem em massa
  • extração de dado estruturado de texto solto
  • reescrita, resumo, padronização de comentário
  • varredura de arquivo, aquele passo chato que roda em cima de 300 arquivos do repo

É tarefa repetitiva, alto volume, resposta curta e verificável

Aqui o Flash é imbatível: US$ 0,14 por 1M de entrada, 113 tokens por segundo de saída e primeiro token em 1,21s contra 1,73s do Pro

Multiplica isso por milhares de chamadas e tu entende por que o roteamento importa mais que a escolha do "melhor modelo"

Como o roteamento acontece na prática:

A parte boa é que trocar de modelo é trocar UMA string

Os identificadores atuais são deepseek-v4-flash e deepseek-v4-pro

# alto volume, resposta direta: Flash sem raciocínio
resposta = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[{"role": "user", "content": prompt}],
    extra_body={"thinking": {"type": "disabled"}},
)
# decisão pesada: Pro com raciocínio ligado
resposta = client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[{"role": "user", "content": prompt}],
    extra_body={"thinking": {"type": "enabled"}},
)

O padrão da API é thinking HABILITADO, então quem quer resposta rápida e barata precisa desligar na mão

Tome cuidado com isso: rodar mil classificações com raciocínio ligado por esquecimento é dinheiro indo embora sem tu perceber

E o nível de esforço do raciocínio?

O reasoning_effort aceita low, high e max, com padrão high

E aqui tem uma pegadinha boa: hoje só o deepseek-v4-flash suporta os três níveis

O deepseek-v4-pro suporta apenas high e max, e o low é tratado como high

Ou seja, o modo econômico de raciocínio existe justamente no modelo mais barato, o que reforça o Flash como padrão de entrada do teu fluxo

Duas coisas que pegam todo mundo no modo thinking:

A primeira: temperature, top_p, presence_penalty e frequency_penalty NÃO são suportados no modo thinking

E o pior, setar esses parâmetros não gera erro, simplesmente não tem efeito

Tu acha que ajustou a criatividade do modelo e não ajustou nada 🙂

A segunda: a cadeia de raciocínio não vem misturada na resposta, ela volta no campo reasoning_content, no mesmo nível do content

Quem faz parse só do content e reclama que "o modelo tá pensando dentro da resposta" tá lendo o campo errado

O cache automático é o que derruba a conta do lado de alto volume:

Esse é o detalhe que muita gente ignora e é justamente onde mora a economia

O Context Caching on Disk vem habilitado por padrão pra todos os usuários, sem alteração de código nenhuma

Ele funciona por prefixo comum entre requisições, ou seja: se as tuas mil chamadas de classificação começam com o mesmo bloco de instrução, esse prefixo tende a bater no cache

E olha a diferença de preço: entrada em cache hit no Flash sai por US$ 0,0028 por 1M contra US$ 0,14 no cache miss

É absurdo

Só que é best-effort, não garante 100% de acerto, então não dá pra fingir que a conta já está feita

Pra saber se tá funcionando, olha os campos prompt_cache_hit_tokens e prompt_cache_miss_tokens na resposta

Dica de desenho de prompt: parte fixa em cima, parte variável embaixo

Se tu joga o dado que muda no começo do prompt, o prefixo comum quebra e o cache não te ajuda em nada

O que aconteceu quando usei a API em projetos reais

Aqui preciso ser honesto antes de qualquer coisa: no vídeo eu usei o V4-Pro em TODOS os testes

Não cheguei a testar o Flash na prática, então o que vem abaixo é conta do modelo caro, não do barato

Coloquei 7 dólares de crédito na API e gerei uma leva de projetos, cada um a partir de um prompt só, repetindo os mesmos projetos e os mesmos prompts de um teste anterior meu pra ter comparação direta

No fim, o consumo total ficou em 6,13 dólares

E o mais interessante não é o total, é a DISTRIBUIÇÃO dele

Os projetos menores custaram de 20 a 30 centavos de dólar cada um

O gasto disparou mesmo foi no projeto maior, um clone do Instagram full stack, onde o contexto foi crescendo a cada interação e chegou a usar 50% da janela

Meu chute (e é chute declarado, não medição) é que uns 80% da conta veio só desse projeto

Percebe como isso amarra com o bloco anterior? O que encarece não é "o modelo", é o contexto crescendo em cima do modelo caro, chamada após chamada

Sobre a qualidade, o veredito foi misto: no clone de terminal o cursor saiu desalinhado depois do cifrão, a indentação veio errada e um comando não foi reconhecido, mas o projeto ficou funcional

A landing page saiu com design mais pobre e a animação do header não apareceu direito

Já no tower defense o resultado foi MELHOR que o do teste anterior: upgrades funcionando, seleção de novas torres fluida e nada travando

No clone do Instagram ele não fez a autenticação, e ainda bati num erro, mandei corrigir, apareceu um erro diferente e depois resolveu

A correção foi fácil e rápida, e o layout ficou responsivo

Veredito: o fluxo que usa os dois faz mais sentido que escolher um

O V4-Flash 0731 virou o padrão de entrada da família, e não é achismo meu

Ele saiu de 61,8 para 82,7 no Terminal-Bench 2.1 entre o preview e a build de 31 de julho de 2026, subiu 10 pontos no Artificial Analysis Intelligence Index e figura entre os 3 primeiros modelos de pesos abertos do leaderboard, a 1 ponto do GPT-5.6 Luna (max, 51)

E o custo por tarefa dele fica cerca de 60% menor que o do GPT-5.6 Luna max na API de primeira mão da DeepSeek

Por isso a regra prática: começa tudo no Flash e promove pro Pro só a tarefa onde aquela margem de SWE-bench Verified pesa de verdade

Agora as ressalvas, porque post honesto tem ressalva:

  • o deepseek-v4-pro ainda estava como preview em 1 de agosto de 2026, com o changelog dizendo que o lançamento oficial vem em breve, sem data
  • a atualização de 31/07 valeu SÓ pro Flash na API: o changelog registra que a API do V4-Pro e os modelos usados no app e no site da DeepSeek não foram alterados
  • a DeepSeek anunciou cobrança 2x em todos os itens nas janelas de 09:00 às 12:00 e 14:00 às 18:00 (horário de Pequim, UTC+8), mas a vigência depende de anúncio oficial e até hoje isso não foi anunciado, então o multiplicador não está sendo aplicado
  • provedor de terceiro cobra diferente: no OpenRouter o V4 Flash aparece a US$ 0,0882 por 1M de entrada e US$ 0,1764 por 1M de saída

Ah, e um detalhe pra quem pensa em infra: o V4 é o primeiro modelo da DeepSeek otimizado pra chips chineses, tipo o Ascend da Huawei

Sobre benchmark divulgado pela própria empresa, sempre o mesmo aviso: tem fim comercial e não é verdade absoluta, faça o teste no TEU caso de uso 😉

Como começar o seu fluxo com as duas variantes

Recapitulando o que interessa: mesma janela, mesmo teto de saída, preço bem diferente e um Flash que hoje pontua acima do irmão maior no índice

O caminho pra começar é curtinho:

  1. Coloca TODAS as tarefas no deepseek-v4-flash primeiro, com thinking desligado no que for repetitivo. O erro comum aqui é o código antigo: deepseek-chat e deepseek-reasoner foram descontinuados em 24 de julho de 2026 às 15:59 UTC, então chamada velha simplesmente não te atende mais
  2. Mede onde a qualidade falha de verdade antes de promover qualquer coisa pro deepseek-v4-pro. O erro comum é promover por sensação, sem caso de teste que prove a falha
  3. Antes de trocar de modelo, tenta subir o reasoning_effort pra max no próprio Flash. Lembra que no Pro o low nem existe de fato, ele vira high
  4. Olha prompt_cache_hit_tokens e prompt_cache_miss_tokens em cada resposta pra saber se o cache tá pegando. O erro comum é montar o prompt com a parte variável no começo, o que quebra o prefixo comum e mata o cache sem tu perceber

E se tu quiser fugir da API, os pesos do Flash estão públicos: o repositório deepseek-ai/DeepSeek-V4-Flash-0731 está no Hugging Face sem gate, sob licença MIT, substituindo o checkpoint de preview

(pra rodar isso local vai precisar de um PC da Nasa, mas a opção existe haha)

No fim das contas, quem tenta eleger um vencedor único paga caro nas duas pontas: ou gasta demais em tarefa boba, ou economiza na hora errada

até o próximo post!

Perguntas frequentes

O deepseek-chat e o deepseek-reasoner ainda funcionam na API da DeepSeek?

Não, os dois apelidos foram descontinuados em 24 de julho de 2026 às 15:59 UTC. Durante o período de graça ambos eram roteados pro V4-Flash (deepseek-chat sem thinking, deepseek-reasoner com thinking ligado). Hoje o certo é chamar direto pelos IDs atuais, deepseek-v4-flash e deepseek-v4-pro.

A cobrança em dobro em horário de pico da DeepSeek já está valendo?

Ainda não. A DeepSeek anunciou multiplicador de 2x em todos os itens de cobrança nas janelas das 09h às 12h e das 14h às 18h, no horário de Pequim (UTC+8). Até 3 de agosto de 2026 não houve anúncio oficial de data de início, então o preço cobrado continua o normal, sem esse adicional.

Por que o preço do V4-Flash em provedores como o OpenRouter é diferente do preço oficial da DeepSeek?

Porque cada provedor de terceiro define sua própria tabela em cima do modelo aberto. No OpenRouter o V4-Flash aparece a US$ 0,0882 por 1M de tokens de entrada e US$ 0,1764 por 1M de saída, valores distintos dos US$ 0,14 de entrada e US$ 0,28 de saída cobrados na API oficial da DeepSeek. Vale comparar antes de decidir onde rodar em produção.

O DeepSeek V4-Pro já saiu do status de preview?

Não, em 1 de agosto de 2026 o deepseek-v4-pro continuava listado como preview. O changelog da DeepSeek diz que o lançamento oficial vem em breve, mas sem data marcada até agora.

Dá pra baixar os pesos do V4-Flash 0731 e rodar localmente?

Sim, o repositório deepseek-ai/DeepSeek-V4-Flash-0731 está público e sem gate no Hugging Face, sob licença MIT. Ele substituiu o checkpoint da versão preview e mantém a mesma arquitetura e o mesmo tamanho, só com re-pós-treinamento.

O DeepSeek V4 depende de GPU da Nvidia pra rodar?

Não exclusivamente. A família V4 é o primeiro modelo da DeepSeek otimizado também para chips chineses, como o Ascend da Huawei, o que amplia as opções de hardware pra quem depende desse ecossistema.




Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação SAAS com IA

Formação SAAS com IA

Tire usas ideias do papel criando softwares com IA, integre pagamentos e lance seu projeto!

  • 291 aulas
  • 18 projetos
  • 24h 17min

Blog | Mais populares