DeepSeek V4 vale a pena para programar? Em quais tarefas ele substitui seu modelo atual

O DeepSeek V4 vale a pena pra programar quando o seu problema é custo por token e base de código grande: são pesos abertos sob licença MIT, 1 milhão de tokens de contexto padrão nos serviços oficiais e US$ 1,74 de entrada por 1M no V4-Pro, contra US$ 0,14 no V4-Flash. No SWE-bench Verified oficial o Pro marca 80,6%. Só que o Pro segue em preview, a Responses API e o Codex suportam apenas o Flash, e nos meus testes no Claude Code o resultado saiu funcional, porém menos polido. Testa em tarefa real antes de migrar o fluxo inteiro
Fala aí, beleza? A pergunta que chegou aqui não foi "o DeepSeek V4 é bom?"
Foi outra, bem mais prática: troco o modelo que eu uso todo dia por ele?
O preview do DeepSeek V4 foi anunciado em 24/04/2026, com dois modelos de pesos abertos publicados ao mesmo tempo no Hugging Face, na API oficial e no chat: o V4-Pro e o V4-Flash
E é aí que a conversa fica interessante, porque pesos abertos + preço baixo é exatamente a combinação que faz vibe coder repensar o setup inteiro
Então esse post não é hype, é veredito por TIPO de tarefa: onde ele substitui o teu modelo atual, onde é melhor nem mexer, e um critério simples pra testar antes de trocar tudo
Bora?
O que é o DeepSeek V4 e o que mudou em relação ao V3.2
A família V4 usa arquitetura Mixture-of-Experts (MoE)
Se você nunca parou pra pensar nisso, a analogia é simples: em vez de acordar o modelo inteiro a cada token, só uma fatia de "especialistas" é ativada
Na prática isso aparece assim:
- V4-Pro: 1,6 trilhão de parâmetros totais e 49 bilhões ativos por token
- V4-Flash: 284 bilhões totais e 13 bilhões ativos
Os pesos dos dois estão abertos no Hugging Face sob licença MIT, nos repositórios deepseek-ai/DeepSeek-V4-Pro e deepseek-ai/DeepSeek-V4-Flash-0731
MIT é o tipo de licença que deixa vibe coder dormir tranquilo, beleza?
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
E o contexto?
1 milhão de tokens, padrão em todos os serviços oficiais da DeepSeek
Contexto grande sozinho não significa muita coisa, o que importa é o custo de manter esse contexto
E é justamente aí que veio o salto: em contexto de 1M de tokens, o V4-Pro usa 27% dos FLOPs de inferência por token e 10% do cache KV do DeepSeek-V3.2
Ou seja, mesma janela gigante custando MUITO menos pra sustentar
O salto de geração medido por fora
O Artificial Analysis mediu a diferença entre as gerações no Intelligence Index: de 42 pontos no V3.2 para 52 pontos no V4 Pro em Max Effort
Dez pontos entre uma geração e outra é salto de verdade, não é ajuste de vírgula
O build 0731 do Flash
Em 31/07/2026 saiu o DeepSeek-V4-Flash-0731, que é o lançamento oficial do Flash e substitui o preview
Mesma arquitetura, mesmo tamanho: só o pós-treino foi refeito, com capacidade agentiva bastante reforçada
Tome cuidado com um detalhe aqui, porque é onde muita gente se enrola: o nome do modelo na API continua deepseek-v4-flash
A chamada não muda e já aponta pro build 0731, então não fica procurando um identificador novo que não existe 🙂
V4-Pro x V4-Flash x o modelo que você já usa: preço, benchmark e disponibilidade
Montei a tabela pra ser lida como critério de decisão, linha por linha
Cada linha responde uma pergunta diferente do teu bolso ou do teu fluxo:
| Critério | DeepSeek V4-Pro | DeepSeek V4-Flash (build 0731) |
|---|---|---|
| Entrada por 1M de tokens | US$ 1,74 | US$ 0,14 |
| Saída por 1M de tokens | US$ 3,48 | US$ 0,28 |
| Leitura de cache por 1M de tokens | US$ 0,145 | US$ 0,028 |
| Tamanho (MoE) | 1,6 tri totais / 49 bi ativos | 284 bi totais / 13 bi ativos |
| Contexto | 1M de tokens | 1M de tokens |
| Pesos abertos | MIT, no Hugging Face | MIT, no Hugging Face |
| SWE-bench Verified | 80,6% | sem número oficial checado |
| LiveCodeBench | 93,5 | sem número oficial checado |
| Intelligence Index (Artificial Analysis) | 52 (Reasoning, Max Effort) | 50 |
| Disponibilidade | preview na API, no app e na web | lançamento oficial |
| Responses API e Codex | previsto pela DeepSeek pro início de agosto de 2026 | suportado |
Repara na diferença de preço entre as duas variantes, porque ela é grande: o Pro custa mais de dez vezes o Flash na entrada
Essa é a hora de escolher com cabeça fria, e não no automático de "vou de topo de linha porque sim"
O que o número de benchmark diz (e o que ele não diz)
O 80,6% do V4-Pro no SWE-bench Verified, que é o benchmark de resolver issues reais do GitHub, é o dado oficial
A própria DeepSeek registra que isso ficou dentro de um ponto dos fechados que usou como referência: 80,6 do V4-Pro contra 80,8 do Opus-4.6-Max e 80,6 do Gemini-3.1-Pro no SWE Verified
E tem o ponto que eu sempre bato: benchmark divulgado pela própria empresa tem fim comercial
Serve de indicativo, não de veredito
Outro detalhe importante: no Intelligence Index, o V4 Pro não lidera hoje entre os pesos abertos
Kimi K2.6 (Reasoning) e MiMo V2.5 Pro (Reasoning) empatam na liderança com 54, com o V4 Pro em 52
O anúncio de lançamento falava em segundo lugar, mas isso já está desatualizado
Em quais tarefas de código o DeepSeek V4 substitui seu modelo atual
Aqui é onde o post precisa ser honesto, porque a resposta não é sim nem não: depende do tipo de trabalho
Refatoração e leitura de base grande: candidato forte
É o cenário mais favorável, disparado
Contexto de 1M padrão, leitura de cache a US$ 0,145 por 1M no Pro (e US$ 0,028 no Flash), e o custo de manter contexto longo caindo pra 27% dos FLOPs por token e 10% do cache KV do V3.2
Quem passa o dia jogando repositório inteiro dentro da janela sente isso na fatura antes de sentir na qualidade
Resolver issue estilo SWE-bench: candidato real, com ressalva
80,6% no SWE-bench Verified é resultado de gente grande
A ressalva é que esse tipo de tarefa é justamente onde a diferença de polimento aparece, e eu vou falar disso no teste prático mais abaixo
Algoritmo e programação competitiva: forte
93,5 no LiveCodeBench, medido pelo Artificial Analysis
Problema fechado, entrada e saída bem definidas, sem depender de contexto de negócio: é o terreno mais confortável pro modelo
Tarefa agentiva de horizonte longo com ferramenta: melhorou MUITO no Flash
O build 0731 do Flash subiu forte em relação ao preview: DeepSWE +47,1 pontos, Cybergym +38,0 e DSBench-Hard +33,8
Salto desse tamanho em tarefa de ferramenta não é ajuste fino, é outro modelo no pós-treino
Subagente e tarefa barata: use o Flash sem dó
Com entrada a US$ 0,14 por 1M, o Flash é o candidato natural pra tarefa auxiliar, resumo, classificação, busca em arquivo, aquele trabalho de bastidor que consome token feito água
Onde é melhor NÃO trocar
- Se o teu fluxo depende de Responses API ou Codex com o Pro: a documentação registra suporte apenas pro
deepseek-v4-flash, e o suporte aodeepseek-v4-proestá só previsto pro início de agosto de 2026 - Se a tua decisão vai se apoiar só nos números agentivos oficiais: eles foram medidos com um harness próprio da DeepSeek, que ainda não foi liberado, e a própria empresa registra que a escolha do harness sozinha pode mover os números em mais de 10 pontos
Dez pontos de variação por causa do harness é MUITA coisa
É diferença suficiente pra inverter um ranking inteiro, então trate esses números como indicativo e não como decisão tomada
Como foi na prática: 5 projetos gerados com o V4 no Claude Code
Eu peguei os mesmos projetos e os mesmos prompts que já tinha usado no meu teste do GPT 5.5, copiei e colei, justamente pra ter base de comparação
Comecei pela interface de chat gratuita, onde não dá pra escolher modelo: o que roda é a versão mais recente, com as opções de raciocínio maior, pesquisa na internet, resposta instantânea e modo expert
Pedi uma landing page em HTML, CSS e JavaScript e vi o preview no próprio canvas, sem sair da tela
Mesmo em janela de lançamento, a resposta veio rápida: os servidores não caíram e responderam com qualidade, o que já é um ponto a favor
Depois parti pra API: criei a chave, coloquei crédito e configurei o Claude Code pra usar o DeepSeek
Aqui sim dá pra escolher a variante, e eu fui de Pro em todos os projetos rodados no Claude Code, gerando cada um com um único prompt
Os números do teste
- Coloquei 7 de crédito na API
- O consumo total dos testes deu 6,13
- Cerca de 80% desse gasto veio de um único projeto: o full stack, um clone do Instagram
- Foram 5 projetos gerados via Claude Code, todos consumindo crédito da API
- Antes deles, os dois primeiros testes saíram na interface de chat gratuita (uma landing page e um clone de terminal) e não consumiram crédito nenhum
O recado de custo tá todo nessa distribuição, se liga: os projetos pequenos custaram muito pouco, e o full stack comeu quase tudo por ter mais interações e contexto crescente
Quem quiser fazer esse tipo de conta antes de decidir, eu já detalhei um raciocínio parecido de custo real de modelo por token em outro cenário
E a qualidade?
Aqui vem o veredito honesto
No clone de terminal, os defeitos foram visuais e concretos: cursor desalinhado, fora da posição depois do cifrão, e identação errada
O projeto ficou funcional e respondeu aos comandos, mas um dos comandos que eu digitei não foi reconhecido
Comparando lado a lado, o clone de terminal do GPT 5.5 ficou mais polido: o do DeepSeek ficou um pouco pior, porém utilizável
Na landing page gerada via Claude Code, o design saiu mais pobre que o do teste anterior: o header tinha uma animação que não apareceu direito, e os elementos ficaram mais simples
Resumo geral? OK e razoável
Não foi ruim, foi menos trabalhado que o do concorrente que eu tinha testado no dia anterior
E olha, eu cobro dos modelos pagos por resultado, porque é o meu dinheiro entrando na API: se eu tô pagando, quero entrega máxima
O detalhe que salva o V4 nessa comparação é o preço: parte dessa diferença de acabamento dá pra compensar com refino de prompt, chegando em resultado parecido por um custo bem menor
Veja o teste completo em vídeo
No vídeo abaixo eu mostro os projetos rodando de verdade e o consumo de crédito acontecendo na API, então dá pra ver o resultado e o preço na mesma tela
Veredito: trocar, usar em paralelo ou manter o que você tem
Três cenários, sem enrolação
1. Você paga muito por token e trabalha com base grande: motivo real pra migrar
Entrada a US$ 1,74 por 1M no Pro e US$ 0,14 no Flash, leitura de cache a US$ 0,145 e US$ 0,028, contexto de 1M padrão e o custo de contexto longo despencando em relação ao V3.2
Se a tua dor é fatura, esse conjunto justifica o teste hoje
2. Você depende de integração específica: espera
Se o teu fluxo passa por Codex ou Responses API com o Pro, a documentação só registra o suporte pro Flash, com o Pro previsto pro início de agosto de 2026
Migrar agora é comprar briga com o teu próprio setup
3. Você já está satisfeito com o que usa: não troca por 2 pontos de índice
52 contra 54 dos líderes de pesos abertos não é motivo pra reconfigurar a tua vida
E tem um ponto que eu falei no vídeo e repito aqui, porque é o erro mais caro: não troque de modelo no meio do caminho
Projeto começado com Opus e continuado no DeepSeek tende a perder qualidade, porque a IA se confunde pra entender o código que já está lá
O caminho seguro hoje é começar do zero e seguir com o mesmo modelo até o fim
Se você precisa mesmo trocar, um arquivo de documentação bem feito no projeto ajuda a reduzir erro na transição
E sim, eu concordo com a crítica que a galera fez: criar projeto do zero é fácil
O teste que vale é modificar projeto existente
O que ainda é incerto
- O Pro segue em preview na API, no app e na web, com lançamento oficial previsto pra depois
- Os benchmarks agentivos vieram de harness próprio ainda não liberado, com variação possível acima de 10 pontos
- A liderança de pesos abertos no Intelligence Index hoje é do Kimi K2.6 e do MiMo V2.5 Pro, com 54
Como testar o DeepSeek V4 antes de migrar o fluxo inteiro
A boa notícia é que a API da DeepSeek é compatível com os formatos OpenAI e Anthropic, então dá pra trocar o backend só mexendo em configuração, sem tocar no teu código
E existe guia de integração dedicado pra Claude Code, Codex, GitHub Copilot, GitHub Copilot CLI, OpenCode e Deep Code na documentação de coding agents
Vou pelo caminho do Claude Code, que é o que eu usei:
- Crie a chave na API da DeepSeek e coloque um crédito pequeno
Crédito pequeno é regra, não economia: você quer medir consumo real, não bancar experimento caro
O erro comum deste passo é colocar valor alto "pra não ficar sem" e só descobrir o custo por projeto depois que a conta rodou
- Aponte o Claude Code pro endpoint compatível com a API da Anthropic
export ANTHROPIC_BASE_URL=https://api.deepseek.com/anthropic
export ANTHROPIC_AUTH_TOKEN=sua-chave-da-deepseek
O erro comum deste passo é deixar a chave da Anthropic no ANTHROPIC_AUTH_TOKEN: o token aqui é o da DeepSeek, e não o do teu provedor antigo
- Defina qual modelo responde por cada papel
export ANTHROPIC_MODEL=deepseek-v4-pro
export ANTHROPIC_DEFAULT_OPUS_MODEL=deepseek-v4-pro
export ANTHROPIC_DEFAULT_SONNET_MODEL=deepseek-v4-pro
export ANTHROPIC_DEFAULT_HAIKU_MODEL=deepseek-v4-flash
export CLAUDE_CODE_SUBAGENT_MODEL=deepseek-v4-flash
export CLAUDE_CODE_EFFORT_LEVEL=max
O erro comum deste passo é esquecer o CLAUDE_CODE_SUBAGENT_MODEL e deixar tudo no Pro: subagente é exatamente o tipo de trabalho que cabe no Flash, e a diferença de preço entre os dois é enorme
- No Windows, use a sintaxe
$env:
$env:ANTHROPIC_BASE_URL="https://api.deepseek.com/anthropic"
$env:ANTHROPIC_AUTH_TOKEN="sua-chave-da-deepseek"
$env:ANTHROPIC_MODEL="deepseek-v4-pro"
O erro comum deste passo é copiar o export do tutorial de Linux e Mac direto no PowerShell e ficar sem entender por que nada mudou
- Rode as MESMAS tarefas reais que você já faz
Nada de "faz um to-do list pra mim"
Pega duas tarefas do teu repositório de verdade, do jeito que você pediria pro teu modelo atual, e roda igualzinho
O erro comum deste passo é trocar o prompt no meio: se o prompt muda, a comparação morre
- Compare resultado E custo, nessa ordem
Anota quanto cada tarefa consumiu e o quanto você teve que corrigir na mão depois
Um modelo mais barato que exige três rodadas de ajuste pode sair mais caro que o teu atual, e isso só aparece quando você mede as duas coisas juntas
- Teste o Flash e o Pro separados
A variante mais parruda custa bem mais que a econômica, e escolher no automático é receita de surpresa na fatura
O erro comum deste passo é assumir que a tua tarefa exige o Pro sem nunca ter rodado ela no Flash 0731
Conclusão
A regra de decisão não é "o DeepSeek V4 é melhor?"
É por tarefa: base grande, contexto longo, algoritmo e trabalho de subagente são onde ele entra como candidato real de substituição, com pesos abertos sob MIT e preço muito abaixo
Agora, fluxo preso em Codex ou Responses API com o Pro, e projeto já começado com outro modelo, é onde você segura a onda e não mexe
O próximo passo é simples e cabe na tua tarde: coloca um crédito pequeno, roda duas tarefas reais do teu repositório no Flash e no Pro, compara com o teu modelo atual e só então decide a migração
Benchmark é indicativo, a tua base de código é o veredito 😀
Até o próximo post!
Perguntas frequentes
O DeepSeek V4 é de graça ou pago para programar?
É pago por uso na API oficial. O V4-Pro custa US$ 1,74 de entrada e US$ 3,48 de saída por 1 milhão de tokens, enquanto o V4-Flash sai por US$ 0,14 de entrada e US$ 0,28 de saída por 1 milhão. Os pesos dos dois modelos são abertos sob licença MIT no Hugging Face, então também dá pra rodar por conta própria.
Dá pra usar o DeepSeek V4 dentro do Claude Code?
Dá sim, a DeepSeek documenta um endpoint compatível com a API da Anthropic pra isso. Configura ANTHROPIC_BASE_URL como https://api.deepseek.com/anthropic e ANTHROPIC_AUTH_TOKEN com a tua chave da DeepSeek. Depois é só apontar ANTHROPIC_MODEL e as variáveis de Sonnet, Opus e Haiku pra deepseek-v4-pro ou deepseek-v4-flash conforme o guia oficial.
Qual a real diferença entre o DeepSeek V4-Pro e o V4-Flash?
O Pro tem 1,6 trilhão de parâmetros totais com 49 bilhões ativos por token, enquanto o Flash tem 284 bilhões totais e 13 bilhões ativos. Na prática isso aparece no preço (o Pro custa mais de dez vezes o Flash na entrada) e no benchmark: o Pro cravou 80,6% no SWE-bench Verified e 93,5 no LiveCodeBench, números que a DeepSeek ainda não divulgou oficialmente pro Flash.
O DeepSeek V4 já funciona com Codex e com a Responses API?
Só o deepseek-v4-flash tem suporte confirmado à Responses API e ao Codex. O suporte ao deepseek-v4-pro nessas duas frentes está previsto pela DeepSeek para o início de agosto de 2026, já que o Pro ainda está em preview na API, no app e na web.
O DeepSeek V4 é melhor que o DeepSeek V3.2?
Sim, e o salto é grande: o Artificial Analysis mediu 42 pontos pro V3.2 contra 52 pontos pro V4 Pro (Reasoning, Max Effort) no Intelligence Index. O ganho de contexto longo também é real, com o V4-Pro usando 27% dos FLOPs de inferência por token e 10% do cache KV que o V3.2 usava.
O DeepSeek V4-Pro é o modelo de pesos abertos mais forte disponível hoje?
Não, hoje ele não lidera esse ranking. No Artificial Analysis Intelligence Index, Kimi K2.6 e MiMo V2.5 Pro empatam na liderança dos pesos abertos com 54 pontos, com o DeepSeek V4 Pro em 52. O anúncio de lançamento chegou a falar em segundo lugar, mas esse dado já está desatualizado.
Formações
Formação SAAS com IA
Tire usas ideias do papel criando softwares com IA, integre pagamentos e lance seu projeto!
- 291 aulas
- 18 projetos
- 24h 17min
Blog | Mais populares
As diferenças de var, let e const
Como fazer redirecionamento com PHP
Neste artigo você vai aprender a como fazer redirecionamento com PHP, utilizaremos abordagens fáceis de entender e de aplicar Fala programador(a), beleza? Bora aprender mais […]
Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação
Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação A popularidade da automação de processos com o n8n está em alta, principalmente […]
