DeepSeek V4 Pro Max: o que é e como escolher entre as variantes da família V4

modo de esforço máximo do DeepSeek V4 Pro Max explicado
Resposta rápida

DeepSeek V4 Pro Max não é um modelo separado: é o modo de esforço máximo de raciocínio do DeepSeek-V4-Pro, escolhido pelo parâmetro reasoning_effort na API. A família V4 foi apresentada em 24 de abril de 2026, em versão preview, com duas linhas: V4-Pro (1,6 trilhão de parâmetros totais e 49 bilhões ativos) e V4-Flash (284 bilhões totais e 13 bilhões ativos), as duas com 1 milhão de tokens de contexto e pesos abertos no Hugging Face. No Artificial Analysis Intelligence Index o Pro marca 44 no Max e 43 no High, e o Flash 0731 marca 50

Fala aí, beleza? Se tu chegou aqui atrás do DeepSeek V4 Pro Max achando que ia encontrar um modelo com esse nome na lista da API, se liga: esse nome não é um modelo

Max é o modo de esforço máximo de raciocínio do DeepSeek-V4-Pro, e entender isso muda toda a decisão de qual versão usar

A família V4 foi apresentada em 24 de abril de 2026, em versão preview, com duas linhas: V4-Pro (o flagship) e V4-Flash (a compacta), as duas expostas na API e com pesos abertos no Hugging Face

E não, não existe um "DeepSeek V4" pelado no meio dessas duas, beleza? São só essas linhas mesmo

Bora separar o que é MODELO do que é modo de operação 🙂

V4-Pro, V4-Pro em modo Max e V4-Flash 0731: a comparação lado a lado

Formação Vibe Coding
Formação Recomendada

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Antes da tabela, uma coisa importante pra leitura não te confundir: as duas primeiras colunas são o MESMO modelo, só que rodando em níveis de raciocínio diferentes

A terceira coluna é outro modelo, de outro porte

O que muda V4-Pro (High) V4-Pro (Max) V4-Flash 0731
Parâmetros totais 1,6 trilhão 1,6 trilhão 284 bilhões
Parâmetros ativos 49 bilhões 49 bilhões 13 bilhões
Contexto 1 milhão de tokens 1 milhão de tokens 1 milhão de tokens
Entrada por 1M de tokens US$ 0,435 US$ 0,435 US$ 0,14
Entrada com cache hit por 1M US$ 0,003625 US$ 0,003625 US$ 0,0028
Saída por 1M de tokens US$ 0,87 US$ 0,87 US$ 0,28
Artificial Analysis Intelligence Index 43 44 50
Custo de rodar o índice US$ 108,77 US$ 176,34 sem dado verificado

A leitura da tabela é meio contraintuitiva, e é justamente aí que mora a confusão do nome

O modelo pequeno da casa, o V4-Flash na revisão 0731, marca 50 pontos no Artificial Analysis Intelligence Index, 6 pontos ACIMA do flagship

E ele é mais barato em entrada, em cache hit e em saída

Já o pulo de High pra Max dentro do V4-Pro é de 1 ponto no índice, enquanto o custo de rodar a mesma avaliação vai de US$ 108,77 pra US$ 176,34

Mesmo preço por token nas duas colunas, viu? O que encarece é o volume de raciocínio que o modo Max gera

Como escolher a variante e o nível de raciocínio na API da DeepSeek

Aqui não tem segredo nem prompt mágico: são dois campos na chamada, e um terceiro se tu quiser desligar o pensamento

  1. Escolha o model

Os identificadores na API da DeepSeek são estes:

model = "deepseek-v4-pro"
model = "deepseek-v4-flash"

O erro comum deste passo é achar que deepseek-v4-flash ainda entrega a versão antiga: em 31/07/2026 esse mesmo ID passou a responder com o checkpoint DeepSeek-V4-Flash-0731, aquele dos 50 pontos

Ou seja, tu não muda nada no código e já está usando a revisão nova

  1. Defina o reasoning_effort

É esse parâmetro que responde a pergunta do título do post

reasoning_effort = "high"   # padrão
reasoning_effort = "max"    # o tal do "Pro Max"

O modo de pensamento já vem LIGADO por padrão, então não precisa habilitar nada pra ele pensar

  1. Desligue o pensamento quando não quiser raciocínio

Pra tarefa simples, formatação, extração de campo, esse tipo de coisa, o pensamento só queima token de saída

extra_body={"thinking": {"type": "disabled"}}

O erro comum deste passo é mais sutil e pega muita gente: no modo de pensamento, temperature, top_p, presence_penalty e frequency_penalty NÃO são suportados

E olha o detalhe cruel: eles não dão erro

Tu manda temperature lá, a API aceita, a resposta volta bonitinha, e o parâmetro simplesmente não faz efeito nenhum

Dá uma passada na documentação do thinking mode antes de sair debugando comportamento que não existe

Para quem cada variante da família V4 foi pensada

V4-Pro em modo Max: quando o esforço extra compensa

É a configuração mais cara de rodar da casa, e o número dela é honesto: 44 no índice contra 43 do High

O preço por token é o mesmo, mas o modo Max gerou cerca de 190M tokens de saída no Intelligence Index, contra uma mediana de 47M de modelos abertos comparáveis

Então faz sentido em tarefa pontual, difícil, onde tu prefere pagar mais pra ter a melhor tentativa do flagship

Em rotina de volume, não

V4-Pro em High: o padrão do flagship

Esse é o que tu pega sem configurar nada, porque high é o valor padrão do reasoning_effort

É o flagship inteiro, 1,6 trilhão de parâmetros totais com 49 bilhões ativos, contexto de 1 milhão de tokens, por quase metade do custo de avaliação do modo Max

V4-Flash 0731: volume e latência

Aqui é o caso mais interessante da linha

O Artificial Analysis mediu 113,5 tokens por segundo na API da DeepSeek, contra uma mediana de 62,6 t/s de modelos abertos de porte parecido

Com 13 bilhões de parâmetros ativos, ele é o candidato natural pra tarefa repetida, pipeline, agente que roda o dia inteiro

Mas tem uma ressalva que tu precisa saber ANTES de fechar a conta: ele é verboso

Foram cerca de 210M tokens de saída nas avaliações do índice, contra mediana de 62M

Token de saída é o mais caro dos dois lados, então o preço de tabela baixo não vira automaticamente fatura baixa

E por que o contexto de 1 milhão não estoura a conta

A série V4 usa uma atenção híbrida: Compressed Sparse Attention (CSA) e Heavily Compressed Attention (HCA)

Se tu nunca mexeu com isso, pensa assim: em vez de o modelo reler tudo com o mesmo peso, ele comprime o que dá pra comprimir

O resultado prático é que, em contexto de 1M de tokens, o V4-Pro usa 27% dos FLOPs por token e 10% do KV cache em relação ao V3.2

É esse número que explica por que contexto longo aqui não é luxo, é uso normal

O que aconteceu quando coloquei 7 dólares de crédito na API

Quando testei o V4 pra valer, coloquei 7 dólares de crédito na API e saí gerando projeto atrás de projeto, um prompt por projeto

No fim de tudo que mostrei, o consumo total foi de 6,13 dólares

E tem um detalhe que vale mais que a soma: cerca de 80% desse gasto foi um projeto só, o full stack, um clone do Instagram

Os projetos menores gastaram muito pouco

Faz sentido, né? Projeto full stack tem mais interação, o contexto vai crescendo a cada ida e volta, e o token de entrada vai junto

Em um momento do teste do clone o saldo já estava raspando e o projeto ainda rodando

A impressão geral que ficou: o modelo chega perto do resultado, mas trava ali no nível de 80% a 85% do que eu pedi

Funcional, mas com ponta solta pra terminar na mão

Isso conversa direto com a tabela lá de cima: a fatura é pequena porque o preço de primeira parte é baixo mesmo, e o corte de cerca de 75% aplicado em 31 de maio de 2026 virou permanente, sem tier promocional separado

Se tu está comparando essa conta com o que gasta em assinatura de ferramenta, eu já abri a conta de quanto custa o Claude Code em outro post

No vídeo abaixo eu mostro os projetos rodando um por um, com os bugs aparecendo ao vivo e o saldo derretendo na tela

Vale usar o modo Max do V4-Pro?

Veredito curto, pelos números que dá pra checar hoje: o modo Max é difícil de justificar como padrão

Tu sobe 1 ponto no Intelligence Index (43 pra 44) e o custo de rodar a mesma avaliação vai de US$ 108,77 pra US$ 176,34

E o desconforto maior: o V4-Flash 0731 marca 50 nesse mesmo índice, por um preço de tabela menor que o do Pro em qualquer modo

Então o Max faz sentido como ferramenta pontual, não como configuração de todo dia

Duas coisas que continuam em aberto e eu não vou fingir que sei:

  • O card oficial do V4-Pro no Hugging Face ainda descreve o modelo como preview version
  • Em 30/06/2026 foi anunciada uma cobrança dobrada em duas janelas diárias de horário de pico, mas em 02/08/2026 essa política não estava em vigor e a página oficial de preços listava tarifa única

Se tu vai montar orçamento em cima disso, confere a página de preços no dia, porque esse é o tipo de coisa que muda sem aviso

Conclusão

Recapitulando o que interessa: Max é MODO, não modelo

A escolha real da família V4 é entre dois modelos (V4-Pro e V4-Flash 0731) e entre dois níveis de raciocínio (high e max) dentro do Pro

O caminho mais barato de decidir é testar tu mesmo com um crédito pequeno, batendo deepseek-v4-pro contra deepseek-v4-flash no MESMO prompt e comparando o que sai

E se tu prefere rodar em casa, os pesos estão abertos sob licença MIT em deepseek-ai/DeepSeek-V4-Pro e deepseek-ai/DeepSeek-V4-Flash-0731

Esse caminho local é o mesmo raciocínio de quem monta automação com LLM local pra não mandar dado sensível pra fora

Como pano de fundo, vale registrar: o V4 é o primeiro modelo da DeepSeek otimizado para chips chineses, como o Ascend, da Huawei

Dá pra imaginar onde essa história vai dar…

até o próximo post! 😀

Perguntas frequentes

DeepSeek V4 Pro Max é um modelo separado na API da DeepSeek?

Não. Max é o modo de esforço máximo de raciocínio do DeepSeek-V4-Pro, ativado pelo parâmetro reasoning_effort="max". Na API só existem os identificadores deepseek-v4-pro e deepseek-v4-flash, sem um modelo chamado só de V4 ou V4 Pro Max.

Vale a pena usar reasoning_effort="max" em vez do padrão high?

O ganho é pequeno: 44 pontos contra 43 no Artificial Analysis Intelligence Index. Só que o custo de rodar essa avaliação sobe de US$ 108,77 para US$ 176,34, porque o modo Max gera cerca de 190M tokens de saída contra uma mediana de 47M. Faz sentido em tarefa pontual difícil, não em rotina de volume.

Por que o DeepSeek V4-Flash 0731 pontua mais que o V4-Pro no índice?

O V4-Flash 0731 marca 50 pontos no Artificial Analysis Intelligence Index, 6 pontos acima do V4-Pro em modo Max. Mesmo sendo o modelo compacto da família, com 284 bilhões de parâmetros totais e 13 bilhões ativos contra os 1,6 trilhão do V4-Pro, ele saiu na frente nessa medição.

Como desligar o modo de pensamento na API da DeepSeek V4?

Basta passar extra_body={"thinking": {"type": "disabled"}} na chamada, já que o pensamento vem ligado por padrão. Isso é útil para tarefas simples de formatação ou extração de campo, onde o raciocínio só aumenta o consumo de tokens de saída sem melhorar o resultado.

O ID deepseek-v4-flash na API ainda serve a versão antiga do modelo?

Não. Desde 31 de julho de 2026, esse mesmo identificador passou a responder com o checkpoint DeepSeek-V4-Flash-0731, o que pontuou 50 no Artificial Analysis Intelligence Index. Ou seja, quem já usava deepseek-v4-flash no código passou a receber a revisão nova sem mudar nada.

Por que o DeepSeek V4-Flash 0731 pode sair mais caro do que o preço por token sugere?

Porque ele é verboso: as avaliações do índice registraram cerca de 210M tokens de saída, contra uma mediana de 62M de modelos comparáveis. Como o token de saída custa US$ 0,28 por 1M no V4-Flash, esse volume maior de resposta pode encarecer a fatura mesmo com o preço de tabela baixo.




Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação SAAS com IA

Formação SAAS com IA

Tire usas ideias do papel criando softwares com IA, integre pagamentos e lance seu projeto!

  • 291 aulas
  • 18 projetos
  • 24h 17min

Blog | Mais populares