DeepSeek V4 vale a pena para programar? Em quais tarefas ele substitui seu modelo atual

comparação de custo e desempenho do DeepSeek V4 para programar
Resposta rápida

O DeepSeek V4 vale a pena pra programar quando o seu problema é custo por token e base de código grande: são pesos abertos sob licença MIT, 1 milhão de tokens de contexto padrão nos serviços oficiais e US$ 1,74 de entrada por 1M no V4-Pro, contra US$ 0,14 no V4-Flash. No SWE-bench Verified oficial o Pro marca 80,6%. Só que o Pro segue em preview, a Responses API e o Codex suportam apenas o Flash, e nos meus testes no Claude Code o resultado saiu funcional, porém menos polido. Testa em tarefa real antes de migrar o fluxo inteiro

Fala aí, beleza? A pergunta que chegou aqui não foi "o DeepSeek V4 é bom?"

Foi outra, bem mais prática: troco o modelo que eu uso todo dia por ele?

O preview do DeepSeek V4 foi anunciado em 24/04/2026, com dois modelos de pesos abertos publicados ao mesmo tempo no Hugging Face, na API oficial e no chat: o V4-Pro e o V4-Flash

E é aí que a conversa fica interessante, porque pesos abertos + preço baixo é exatamente a combinação que faz vibe coder repensar o setup inteiro

Então esse post não é hype, é veredito por TIPO de tarefa: onde ele substitui o teu modelo atual, onde é melhor nem mexer, e um critério simples pra testar antes de trocar tudo

Bora?

O que é o DeepSeek V4 e o que mudou em relação ao V3.2

A família V4 usa arquitetura Mixture-of-Experts (MoE)

Se você nunca parou pra pensar nisso, a analogia é simples: em vez de acordar o modelo inteiro a cada token, só uma fatia de "especialistas" é ativada

Na prática isso aparece assim:

  • V4-Pro: 1,6 trilhão de parâmetros totais e 49 bilhões ativos por token
  • V4-Flash: 284 bilhões totais e 13 bilhões ativos

Os pesos dos dois estão abertos no Hugging Face sob licença MIT, nos repositórios deepseek-ai/DeepSeek-V4-Pro e deepseek-ai/DeepSeek-V4-Flash-0731

MIT é o tipo de licença que deixa vibe coder dormir tranquilo, beleza?

Formação Vibe Coding
Formação Recomendada

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

E o contexto?

1 milhão de tokens, padrão em todos os serviços oficiais da DeepSeek

Contexto grande sozinho não significa muita coisa, o que importa é o custo de manter esse contexto

E é justamente aí que veio o salto: em contexto de 1M de tokens, o V4-Pro usa 27% dos FLOPs de inferência por token e 10% do cache KV do DeepSeek-V3.2

Ou seja, mesma janela gigante custando MUITO menos pra sustentar

O salto de geração medido por fora

O Artificial Analysis mediu a diferença entre as gerações no Intelligence Index: de 42 pontos no V3.2 para 52 pontos no V4 Pro em Max Effort

Dez pontos entre uma geração e outra é salto de verdade, não é ajuste de vírgula

O build 0731 do Flash

Em 31/07/2026 saiu o DeepSeek-V4-Flash-0731, que é o lançamento oficial do Flash e substitui o preview

Mesma arquitetura, mesmo tamanho: só o pós-treino foi refeito, com capacidade agentiva bastante reforçada

Tome cuidado com um detalhe aqui, porque é onde muita gente se enrola: o nome do modelo na API continua deepseek-v4-flash

A chamada não muda e já aponta pro build 0731, então não fica procurando um identificador novo que não existe 🙂

V4-Pro x V4-Flash x o modelo que você já usa: preço, benchmark e disponibilidade

Montei a tabela pra ser lida como critério de decisão, linha por linha

Cada linha responde uma pergunta diferente do teu bolso ou do teu fluxo:

Critério DeepSeek V4-Pro DeepSeek V4-Flash (build 0731)
Entrada por 1M de tokens US$ 1,74 US$ 0,14
Saída por 1M de tokens US$ 3,48 US$ 0,28
Leitura de cache por 1M de tokens US$ 0,145 US$ 0,028
Tamanho (MoE) 1,6 tri totais / 49 bi ativos 284 bi totais / 13 bi ativos
Contexto 1M de tokens 1M de tokens
Pesos abertos MIT, no Hugging Face MIT, no Hugging Face
SWE-bench Verified 80,6% sem número oficial checado
LiveCodeBench 93,5 sem número oficial checado
Intelligence Index (Artificial Analysis) 52 (Reasoning, Max Effort) 50
Disponibilidade preview na API, no app e na web lançamento oficial
Responses API e Codex previsto pela DeepSeek pro início de agosto de 2026 suportado

Repara na diferença de preço entre as duas variantes, porque ela é grande: o Pro custa mais de dez vezes o Flash na entrada

Essa é a hora de escolher com cabeça fria, e não no automático de "vou de topo de linha porque sim"

O que o número de benchmark diz (e o que ele não diz)

O 80,6% do V4-Pro no SWE-bench Verified, que é o benchmark de resolver issues reais do GitHub, é o dado oficial

A própria DeepSeek registra que isso ficou dentro de um ponto dos fechados que usou como referência: 80,6 do V4-Pro contra 80,8 do Opus-4.6-Max e 80,6 do Gemini-3.1-Pro no SWE Verified

E tem o ponto que eu sempre bato: benchmark divulgado pela própria empresa tem fim comercial

Serve de indicativo, não de veredito

Outro detalhe importante: no Intelligence Index, o V4 Pro não lidera hoje entre os pesos abertos

Kimi K2.6 (Reasoning) e MiMo V2.5 Pro (Reasoning) empatam na liderança com 54, com o V4 Pro em 52

O anúncio de lançamento falava em segundo lugar, mas isso já está desatualizado

Em quais tarefas de código o DeepSeek V4 substitui seu modelo atual

Aqui é onde o post precisa ser honesto, porque a resposta não é sim nem não: depende do tipo de trabalho

Refatoração e leitura de base grande: candidato forte

É o cenário mais favorável, disparado

Contexto de 1M padrão, leitura de cache a US$ 0,145 por 1M no Pro (e US$ 0,028 no Flash), e o custo de manter contexto longo caindo pra 27% dos FLOPs por token e 10% do cache KV do V3.2

Quem passa o dia jogando repositório inteiro dentro da janela sente isso na fatura antes de sentir na qualidade

Resolver issue estilo SWE-bench: candidato real, com ressalva

80,6% no SWE-bench Verified é resultado de gente grande

A ressalva é que esse tipo de tarefa é justamente onde a diferença de polimento aparece, e eu vou falar disso no teste prático mais abaixo

Algoritmo e programação competitiva: forte

93,5 no LiveCodeBench, medido pelo Artificial Analysis

Problema fechado, entrada e saída bem definidas, sem depender de contexto de negócio: é o terreno mais confortável pro modelo

Tarefa agentiva de horizonte longo com ferramenta: melhorou MUITO no Flash

O build 0731 do Flash subiu forte em relação ao preview: DeepSWE +47,1 pontos, Cybergym +38,0 e DSBench-Hard +33,8

Salto desse tamanho em tarefa de ferramenta não é ajuste fino, é outro modelo no pós-treino

Subagente e tarefa barata: use o Flash sem dó

Com entrada a US$ 0,14 por 1M, o Flash é o candidato natural pra tarefa auxiliar, resumo, classificação, busca em arquivo, aquele trabalho de bastidor que consome token feito água

Onde é melhor NÃO trocar

  1. Se o teu fluxo depende de Responses API ou Codex com o Pro: a documentação registra suporte apenas pro deepseek-v4-flash, e o suporte ao deepseek-v4-pro está só previsto pro início de agosto de 2026
  2. Se a tua decisão vai se apoiar só nos números agentivos oficiais: eles foram medidos com um harness próprio da DeepSeek, que ainda não foi liberado, e a própria empresa registra que a escolha do harness sozinha pode mover os números em mais de 10 pontos

Dez pontos de variação por causa do harness é MUITA coisa

É diferença suficiente pra inverter um ranking inteiro, então trate esses números como indicativo e não como decisão tomada

Como foi na prática: 5 projetos gerados com o V4 no Claude Code

Eu peguei os mesmos projetos e os mesmos prompts que já tinha usado no meu teste do GPT 5.5, copiei e colei, justamente pra ter base de comparação

Comecei pela interface de chat gratuita, onde não dá pra escolher modelo: o que roda é a versão mais recente, com as opções de raciocínio maior, pesquisa na internet, resposta instantânea e modo expert

Pedi uma landing page em HTML, CSS e JavaScript e vi o preview no próprio canvas, sem sair da tela

Mesmo em janela de lançamento, a resposta veio rápida: os servidores não caíram e responderam com qualidade, o que já é um ponto a favor

Depois parti pra API: criei a chave, coloquei crédito e configurei o Claude Code pra usar o DeepSeek

Aqui sim dá pra escolher a variante, e eu fui de Pro em todos os projetos rodados no Claude Code, gerando cada um com um único prompt

Os números do teste

  • Coloquei 7 de crédito na API
  • O consumo total dos testes deu 6,13
  • Cerca de 80% desse gasto veio de um único projeto: o full stack, um clone do Instagram
  • Foram 5 projetos gerados via Claude Code, todos consumindo crédito da API
  • Antes deles, os dois primeiros testes saíram na interface de chat gratuita (uma landing page e um clone de terminal) e não consumiram crédito nenhum

O recado de custo tá todo nessa distribuição, se liga: os projetos pequenos custaram muito pouco, e o full stack comeu quase tudo por ter mais interações e contexto crescente

Quem quiser fazer esse tipo de conta antes de decidir, eu já detalhei um raciocínio parecido de custo real de modelo por token em outro cenário

E a qualidade?

Aqui vem o veredito honesto

No clone de terminal, os defeitos foram visuais e concretos: cursor desalinhado, fora da posição depois do cifrão, e identação errada

O projeto ficou funcional e respondeu aos comandos, mas um dos comandos que eu digitei não foi reconhecido

Comparando lado a lado, o clone de terminal do GPT 5.5 ficou mais polido: o do DeepSeek ficou um pouco pior, porém utilizável

Na landing page gerada via Claude Code, o design saiu mais pobre que o do teste anterior: o header tinha uma animação que não apareceu direito, e os elementos ficaram mais simples

Resumo geral? OK e razoável

Não foi ruim, foi menos trabalhado que o do concorrente que eu tinha testado no dia anterior

E olha, eu cobro dos modelos pagos por resultado, porque é o meu dinheiro entrando na API: se eu tô pagando, quero entrega máxima

O detalhe que salva o V4 nessa comparação é o preço: parte dessa diferença de acabamento dá pra compensar com refino de prompt, chegando em resultado parecido por um custo bem menor

Veja o teste completo em vídeo

No vídeo abaixo eu mostro os projetos rodando de verdade e o consumo de crédito acontecendo na API, então dá pra ver o resultado e o preço na mesma tela

Veredito: trocar, usar em paralelo ou manter o que você tem

Três cenários, sem enrolação

1. Você paga muito por token e trabalha com base grande: motivo real pra migrar

Entrada a US$ 1,74 por 1M no Pro e US$ 0,14 no Flash, leitura de cache a US$ 0,145 e US$ 0,028, contexto de 1M padrão e o custo de contexto longo despencando em relação ao V3.2

Se a tua dor é fatura, esse conjunto justifica o teste hoje

2. Você depende de integração específica: espera

Se o teu fluxo passa por Codex ou Responses API com o Pro, a documentação só registra o suporte pro Flash, com o Pro previsto pro início de agosto de 2026

Migrar agora é comprar briga com o teu próprio setup

3. Você já está satisfeito com o que usa: não troca por 2 pontos de índice

52 contra 54 dos líderes de pesos abertos não é motivo pra reconfigurar a tua vida

E tem um ponto que eu falei no vídeo e repito aqui, porque é o erro mais caro: não troque de modelo no meio do caminho

Projeto começado com Opus e continuado no DeepSeek tende a perder qualidade, porque a IA se confunde pra entender o código que já está lá

O caminho seguro hoje é começar do zero e seguir com o mesmo modelo até o fim

Se você precisa mesmo trocar, um arquivo de documentação bem feito no projeto ajuda a reduzir erro na transição

E sim, eu concordo com a crítica que a galera fez: criar projeto do zero é fácil

O teste que vale é modificar projeto existente

O que ainda é incerto

  • O Pro segue em preview na API, no app e na web, com lançamento oficial previsto pra depois
  • Os benchmarks agentivos vieram de harness próprio ainda não liberado, com variação possível acima de 10 pontos
  • A liderança de pesos abertos no Intelligence Index hoje é do Kimi K2.6 e do MiMo V2.5 Pro, com 54

Como testar o DeepSeek V4 antes de migrar o fluxo inteiro

A boa notícia é que a API da DeepSeek é compatível com os formatos OpenAI e Anthropic, então dá pra trocar o backend só mexendo em configuração, sem tocar no teu código

E existe guia de integração dedicado pra Claude Code, Codex, GitHub Copilot, GitHub Copilot CLI, OpenCode e Deep Code na documentação de coding agents

Vou pelo caminho do Claude Code, que é o que eu usei:

  1. Crie a chave na API da DeepSeek e coloque um crédito pequeno

Crédito pequeno é regra, não economia: você quer medir consumo real, não bancar experimento caro

O erro comum deste passo é colocar valor alto "pra não ficar sem" e só descobrir o custo por projeto depois que a conta rodou

  1. Aponte o Claude Code pro endpoint compatível com a API da Anthropic
export ANTHROPIC_BASE_URL=https://api.deepseek.com/anthropic
export ANTHROPIC_AUTH_TOKEN=sua-chave-da-deepseek

O erro comum deste passo é deixar a chave da Anthropic no ANTHROPIC_AUTH_TOKEN: o token aqui é o da DeepSeek, e não o do teu provedor antigo

  1. Defina qual modelo responde por cada papel
export ANTHROPIC_MODEL=deepseek-v4-pro
export ANTHROPIC_DEFAULT_OPUS_MODEL=deepseek-v4-pro
export ANTHROPIC_DEFAULT_SONNET_MODEL=deepseek-v4-pro
export ANTHROPIC_DEFAULT_HAIKU_MODEL=deepseek-v4-flash
export CLAUDE_CODE_SUBAGENT_MODEL=deepseek-v4-flash
export CLAUDE_CODE_EFFORT_LEVEL=max

O erro comum deste passo é esquecer o CLAUDE_CODE_SUBAGENT_MODEL e deixar tudo no Pro: subagente é exatamente o tipo de trabalho que cabe no Flash, e a diferença de preço entre os dois é enorme

  1. No Windows, use a sintaxe $env:
$env:ANTHROPIC_BASE_URL="https://api.deepseek.com/anthropic"
$env:ANTHROPIC_AUTH_TOKEN="sua-chave-da-deepseek"
$env:ANTHROPIC_MODEL="deepseek-v4-pro"

O erro comum deste passo é copiar o export do tutorial de Linux e Mac direto no PowerShell e ficar sem entender por que nada mudou

  1. Rode as MESMAS tarefas reais que você já faz

Nada de "faz um to-do list pra mim"

Pega duas tarefas do teu repositório de verdade, do jeito que você pediria pro teu modelo atual, e roda igualzinho

O erro comum deste passo é trocar o prompt no meio: se o prompt muda, a comparação morre

  1. Compare resultado E custo, nessa ordem

Anota quanto cada tarefa consumiu e o quanto você teve que corrigir na mão depois

Um modelo mais barato que exige três rodadas de ajuste pode sair mais caro que o teu atual, e isso só aparece quando você mede as duas coisas juntas

  1. Teste o Flash e o Pro separados

A variante mais parruda custa bem mais que a econômica, e escolher no automático é receita de surpresa na fatura

O erro comum deste passo é assumir que a tua tarefa exige o Pro sem nunca ter rodado ela no Flash 0731

Conclusão

A regra de decisão não é "o DeepSeek V4 é melhor?"

É por tarefa: base grande, contexto longo, algoritmo e trabalho de subagente são onde ele entra como candidato real de substituição, com pesos abertos sob MIT e preço muito abaixo

Agora, fluxo preso em Codex ou Responses API com o Pro, e projeto já começado com outro modelo, é onde você segura a onda e não mexe

O próximo passo é simples e cabe na tua tarde: coloca um crédito pequeno, roda duas tarefas reais do teu repositório no Flash e no Pro, compara com o teu modelo atual e só então decide a migração

Benchmark é indicativo, a tua base de código é o veredito 😀

Até o próximo post!

Perguntas frequentes

O DeepSeek V4 é de graça ou pago para programar?

É pago por uso na API oficial. O V4-Pro custa US$ 1,74 de entrada e US$ 3,48 de saída por 1 milhão de tokens, enquanto o V4-Flash sai por US$ 0,14 de entrada e US$ 0,28 de saída por 1 milhão. Os pesos dos dois modelos são abertos sob licença MIT no Hugging Face, então também dá pra rodar por conta própria.

Dá pra usar o DeepSeek V4 dentro do Claude Code?

Dá sim, a DeepSeek documenta um endpoint compatível com a API da Anthropic pra isso. Configura ANTHROPIC_BASE_URL como https://api.deepseek.com/anthropic e ANTHROPIC_AUTH_TOKEN com a tua chave da DeepSeek. Depois é só apontar ANTHROPIC_MODEL e as variáveis de Sonnet, Opus e Haiku pra deepseek-v4-pro ou deepseek-v4-flash conforme o guia oficial.

Qual a real diferença entre o DeepSeek V4-Pro e o V4-Flash?

O Pro tem 1,6 trilhão de parâmetros totais com 49 bilhões ativos por token, enquanto o Flash tem 284 bilhões totais e 13 bilhões ativos. Na prática isso aparece no preço (o Pro custa mais de dez vezes o Flash na entrada) e no benchmark: o Pro cravou 80,6% no SWE-bench Verified e 93,5 no LiveCodeBench, números que a DeepSeek ainda não divulgou oficialmente pro Flash.

O DeepSeek V4 já funciona com Codex e com a Responses API?

Só o deepseek-v4-flash tem suporte confirmado à Responses API e ao Codex. O suporte ao deepseek-v4-pro nessas duas frentes está previsto pela DeepSeek para o início de agosto de 2026, já que o Pro ainda está em preview na API, no app e na web.

O DeepSeek V4 é melhor que o DeepSeek V3.2?

Sim, e o salto é grande: o Artificial Analysis mediu 42 pontos pro V3.2 contra 52 pontos pro V4 Pro (Reasoning, Max Effort) no Intelligence Index. O ganho de contexto longo também é real, com o V4-Pro usando 27% dos FLOPs de inferência por token e 10% do cache KV que o V3.2 usava.

O DeepSeek V4-Pro é o modelo de pesos abertos mais forte disponível hoje?

Não, hoje ele não lidera esse ranking. No Artificial Analysis Intelligence Index, Kimi K2.6 e MiMo V2.5 Pro empatam na liderança dos pesos abertos com 54 pontos, com o DeepSeek V4 Pro em 52. O anúncio de lançamento chegou a falar em segundo lugar, mas esse dado já está desatualizado.




Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação SAAS com IA

Formação SAAS com IA

Tire usas ideias do papel criando softwares com IA, integre pagamentos e lance seu projeto!

  • 291 aulas
  • 18 projetos
  • 24h 17min

Blog | Mais populares