Quanto custa o DeepSeek V4 Flash na API? Preço por token e como estimar o gasto do seu projeto

O DeepSeek V4 Flash preço na API oficial fica em US$ 0,14 por 1M de tokens de entrada (cache miss), US$ 0,0028 por 1M de entrada em cache hit e US$ 0,28 por 1M de tokens de saída. Pelo câmbio de R$ 5,06 usado neste post, dá cerca de R$ 0,71 na entrada e R$ 1,42 na saída por milhão. O V4 Pro custa aproximadamente três vezes mais. O cache em disco vem ligado por padrão e corta a entrada em cerca de 98%. Em agente o gasto sobe, porque o contexto volta inteiro a cada rodada
US$ 0,28 por 1 milhão de tokens de saída
É esse o número que faz o V4 Flash parecer quase de graça quando você olha a tabela de preço pela primeira vez
Só que a pergunta real não é quanto custa 1M de tokens, é quanto vai custar o SEU projeto rodando de verdade, com contexto crescendo, agente reenviando prompt e modelo escrevendo mais do que você esperava
Então bora resolver isso direito: preço oficial por token, a conta pra estimar antes de plugar e o raciocínio de custo pra agentes, que é onde a fatura escapa…
Tabela de preços do DeepSeek V4 Flash e V4 Pro
A DeepSeek cobra em três linhas diferentes: entrada que não bateu no cache, entrada que bateu no cache e saída
São preços por 1 milhão de tokens
| Cobrança (por 1M de tokens) | V4 Flash (US$) | V4 Pro (US$) |
|---|---|---|
| Entrada, cache miss | 0,14 | 0,435 |
| Entrada, cache hit | 0,0028 | 0,003625 |
| Saída | 0,28 | 0,87 |
Repara na régua: o Pro sai por volta de três vezes o preço do Flash na entrada com cache miss e na saída (na linha de cache hit a distância é bem menor)
Esse é o tipo de diferença que não aparece no primeiro teste e aparece MUITO no fim do mês
Se o seu caso é classificar texto, gerar resposta curta, resumir, extrair dado estruturado, o Flash resolve e a diferença de preço vira dinheiro no bolso
Se é raciocínio pesado em cima de base grande, aí vale medir os dois antes de decidir, e não escolher no achismo
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Como a cobrança por token funciona na API DeepSeek
Primeiro conceito, porque tem gente que erra a conta aqui e nem percebe: entrada e saída NÃO custam a mesma coisa
No V4 Flash a saída custa o dobro da entrada (US$ 0,28 contra US$ 0,14 por 1M)
Tudo que você manda pro modelo (system prompt, histórico, arquivos, ferramenta) é entrada
Tudo que ele escreve de volta é saída
E o cache, como entra nisso?
O context caching em disco da DeepSeek é ligado por padrão pra todos os usuários, sem você mudar uma linha de código, e o armazenamento do cache não é cobrado
Quando um pedaço do prompt já foi visto antes, ele entra como cache hit e o preço de entrada despenca de US$ 0,14 pra US$ 0,0028 por 1M, uma queda de uns 98%
Se você já leu sobre o preço da API DeepSeek em 2026, esse é o mesmo mecanismo que segura a conta de quem repete prompt longo
É como reaproveitar um build em cache: o trabalho pesado só acontece na primeira vez, e as repetições saem quase de graça
O raciocínio também é cobrado
Quando o modelo roda em modo de raciocínio, os tokens de thinking são cobrados como SAÍDA (US$ 0,28 por 1M no Flash) e ainda contam contra o teto de saída
E os limites da geração V4 são generosos: janela de contexto de 1M de tokens e até 384K tokens de saída por requisição
Contexto de 1M é ótimo pra jogar repositório inteiro lá dentro
Também é ótimo pra torrar crédito sem perceber, então segue lendo =)
Como estimar o gasto do seu projeto antes de plugar
A conta é simples, o que engana é o volume
- Meça o tamanho médio da sua entrada. Some system prompt, instruções, histórico e qualquer documento que você anexa por chamada. O erro comum aqui é medir só a pergunta do usuário e esquecer o system prompt, que vai junto em TODA requisição
- Estime a saída, e estime pra cima. Saída custa o dobro da entrada, e é a parte que você menos controla. O erro comum é chutar uma resposta curta e receber três parágrafos, ou ligar o modo de raciocínio e esquecer que o thinking é cobrado como saída
- Multiplique pelo volume real do mês. Nada de "umas chamadas por dia", pega o número. Monta a conta assim, com o seu volume no lugar do exemplo:
entrada: (total de tokens de entrada / 1M) x US$ 0,14
saida: (total de tokens de saida / 1M) x US$ 0,28
- Separe a parte que bate no cache. Se boa parte do seu prompt é fixa, essa fatia sai por US$ 0,0028 por 1M em vez de US$ 0,14. O erro comum é assumir 100% de cache hit no papel: o cache é oportunista, a taxa real varia com o seu tráfego
- Meça o real na resposta, não na planilha. A API devolve os campos que fecham a conta:
usage.prompt_cache_hit_tokenseusage.prompt_cache_miss_tokens, e a soma dos dois é oprompt_tokens
"usage": {
"prompt_tokens": 1200,
"prompt_cache_hit_tokens": 960,
"prompt_cache_miss_tokens": 240
}
- Compare estimativa com realidade depois de um dia rodando. O erro comum aqui é nem olhar: se você não loga hit e miss por chamada, você não tem como saber se o gasto subiu por volume ou porque o cache parou de pegar
Tome cuidado com o passo 2
Subestimar a saída é de longe o jeito mais rápido de a fatura vir o dobro da sua planilha
Chat, agente e código: onde o custo explode
Três perfis de uso, três contas completamente diferentes com o MESMO preço por token
Chat curto. Pergunta pequena, resposta pequena, pouca coisa de histórico. É o cenário mais barato que existe e é justamente o que engana todo mundo no primeiro teste
Geração de texto longo. Entrada pequena, saída gigante. Aqui quem manda na fatura é o US$ 0,28, porque você paga o dobro em cima da parte que mais cresce
Agente. Esse é o caso caro, e não é por maldade da DeepSeek
Agente reenvia contexto a cada volta: prompt de sistema, histórico da conversa, resultado das ferramentas, arquivos lidos
Na vigésima interação, você não está pagando uma requisição de 4K, está pagando uma de 60K, 100K, e por aí vai
É aqui que o cache hit salva a conta, porque o pedaço fixo do prompt (sistema, instruções, arquivos que não mudaram) tende a repetir a cada volta
Quem já comparou isso com o modelo de assinatura sabe a diferença: no preço do Claude Code o plano te dá previsibilidade, na API paga por token você tem preço baixo e teto nenhum
O detalhe da verbosidade
Tem um ponto que mexe direto na conta de saída: o V4 Flash 0731 é classificado como muito verboso pelo Artificial Analysis
Pra rodar o Intelligence Index ele gerou cerca de 210M de tokens, contra uma mediana de 100M dos comparáveis
Melhorou em relação à versão anterior do V4 Flash (queda de 12% nos tokens de saída), mas ainda é acima da média
Traduzindo: modelo que fala demais custa mais, porque a fala dele é justamente a linha mais cara da tabela
O que gastei de verdade rodando projetos via API
Aqui não é estimativa de planilha, é o que saiu do meu crédito
Coloquei US$ 7 na API e rodei uma bateria de projetos, os mesmos prompts que eu já tinha usado no teste do GPT 5.5, copiando e colando pra ter comparação direta
Comecei pela interface de chat, pedindo uma landing page em HTML, CSS e JavaScript, e usei o preview embutido pra ver rodando
Mesmo em período de lançamento a resposta veio rápida, sem aquela sensação de servidor sobrecarregado
Do terceiro projeto em diante eu gerei tudo via API, um prompt só por projeto
Atenção neste ponto, porque é o que mais pega gente desprevenida: eu usei a variante Pro, a mais cara, em todos os projetos gerados por API
No fim da bateria eu tinha consumido US$ 6,13
E o gasto não foi distribuído: uns 80% do total (estimativa minha olhando o consumo) foram embora num único projeto full stack, um clone do Instagram, onde o contexto crescia a cada correção e o consumo subia junto
Cheguei a ver 50% de uso de contexto na sessão desse projeto, e foi exatamente ali que o gasto disparou
Os projetos menores ficaram entre 20 e 30 centavos de dólar por execução
Sobre a qualidade, sendo honesto: os projetos do GPT 5.5 ficaram mais polidos na minha comparação
No projeto de terminal apareceu identação errada e um comando que o modelo não entendeu, mas o resultado ficou funcional
Na landing page comparativa o design ficou mais pobre, o header com animação não apareceu direito
Já no jogo de asteroides o resultado ficou idêntico ao do GPT: velocidade da nave controlada, game over funcionando e reinício pela tecla R
Pelo preço que custou, tá muito bom
Veja o teste em vídeo
Se você quer ver o gasto subindo na tela e o comportamento do modelo em cada projeto, o teste inteiro tá aqui
Mudanças de cobrança que podem alterar sua conta
Três coisas mudaram e uma está anunciada pra mudar, se liga nisso antes de copiar código velho de tutorial
Os IDs antigos foram aposentados. deepseek-chat e deepseek-reasoner foram retirados em 24/07/2026, o nome de modelo atual é deepseek-v4-flash
O desconto de horário ocioso acabou. Aquele off-peak da geração V3/R1 (16:30 às 00:30 UTC, com 50% no V3 e 75% no R1) encerrou junto com a aposentadoria daqueles aliases, em 24/07/2026, e NÃO vale pro V4
A cobrança 2x em horário de pico foi anunciada. Seria o dobro sobre todos os itens de cobrança nas faixas de 09:00 às 12:00 e 14:00 às 18:00 no horário de Pequim (UTC+8), mas até 03/08/2026 nenhuma data de vigência tinha sido anunciada
E tem uma boa notícia no meio: o snapshot V4 Flash 0731 entrou em beta pública em 31/07/2026 mantendo os mesmos US$ 0,14 e US$ 0,28
Modelo novo sem aumento de preço é raro, aproveita
Preço na DeepSeek x OpenRouter x DeepInfra
Mesmo modelo, provedor diferente, preço diferente
| Provedor | Entrada (US$ / 1M) | Saída (US$ / 1M) |
|---|---|---|
| DeepSeek (oficial) | 0,14 | 0,28 |
| OpenRouter (0731) | 0,09 | 0,18 |
| DeepInfra (0731) | 0,10 | 0,20 |
Na tabela seca, o terceiro sai mais barato por token
Mas antes de sair migrando, lembra do que a gente viu lá em cima: o cache hit oficial derruba a entrada pra US$ 0,0028 por 1M
Se o seu uso reenvia prompt fixo o tempo todo (leia-se: agente), essa vantagem do caminho oficial pesa muito mais do que a diferença de centavos na tabela
O V4 Flash compensa pelo preço?
Compensa, e nem é briga apertada em custo por inteligência
O V4 Flash 0731 marca 50 pontos no Artificial Analysis Intelligence Index, contra uma mediana de 25 dos comparáveis
O preço combinado medido pelo Artificial Analysis fica em US$ 0,06 por 1M de tokens na proporção 7:2:1 (cache hit, entrada, saída), com 113 tokens por segundo de velocidade de saída
Por baixo do capô é um Mixture-of-Experts com 284B de parâmetros totais e 13B ativados, o que explica o preço baixo com resposta rápida
O ponto fraco continua sendo a verbosidade, que infla justamente a linha mais cara
Vale pro seu caso se: você roda volume, tem prompt fixo grande (cache hit trabalhando a seu favor), quer agente rodando sem susto no cartão, ou quer testar uma ideia sem comprometer orçamento
O V4 Pro faz mais sentido se: o projeto é grande, com muita interação em cima do mesmo código e você já mediu que o Flash erra demais nesse cenário
Só não vai pro Pro no automático, porque o triplo do preço na entrada sem cache e na saída, em cima de um agente verboso, é exatamente a combinação que me fez queimar US$ 6,13 sem sentir
Conclusão
O DeepSeek V4 Flash custa US$ 0,14 por 1M de entrada e US$ 0,28 por 1M de saída, com cache hit a US$ 0,0028, enquanto o V4 Pro fica em US$ 0,435 de entrada (cache miss), US$ 0,003625 de entrada (cache hit) e US$ 0,87 de saída
Agora o próximo passo é seu, e é bem simples: coloca um crédito PEQUENO na API, roda o seu projeto real (não um hello world) e mede prompt_cache_hit_tokens e prompt_cache_miss_tokens em cada resposta
Depois compara o gasto real com a estimativa que você fez lá no começo
Se bateu, escala tranquilo
Se veio o dobro, você vai saber exatamente onde: ou o cache não pegou, ou o modelo falou mais do que você planejou 😀
Até o próximo post!
Perguntas frequentes
O DeepSeek V4 Flash e o V4 Pro custam a mesma coisa?
Não. O V4 Flash cobra US$ 0,14 de entrada (cache miss), US$ 0,0028 de entrada (cache hit) e US$ 0,28 de saída, por 1M de tokens. O V4 Pro sai por US$ 0,435 de entrada (cache miss), US$ 0,003625 de entrada (cache hit) e US$ 0,87 de saída. Na entrada com cache miss e na saída, o Pro fica em torno de três vezes o preço do Flash, mas na linha de cache hit essa distância é bem menor.
Os IDs deepseek-chat e deepseek-reasoner ainda funcionam na API?
Não, esses IDs legados foram aposentados em 24 de julho de 2026. O nome de modelo atual é deepseek-v4-flash, e é ele que carrega o preço de US$ 0,14 de entrada e US$ 0,28 de saída por 1M de tokens.
O desconto de horário ocioso (off-peak) ainda vale pro DeepSeek V4 Flash?
Não. Aquele desconto era da geração V3/R1 (50% de redução no V3 e 75% no R1, das 16h30 à 0h30 UTC) e acabou junto com a aposentadoria desses aliases em 24 de julho de 2026. No V4, incluindo o Flash, esse benefício não existe.
É verdade que vai ter cobrança em dobro no horário de pico do DeepSeek?
A DeepSeek anunciou uma cobrança 2x sobre todos os itens de faturamento das 9h às 12h e das 14h às 18h no horário de Pequim (UTC+8). Até 3 de agosto de 2026 a data efetiva dessa mudança ainda não tinha sido anunciada, então vale acompanhar antes de fechar a conta do seu projeto.
O preço do DeepSeek V4 Flash é igual em provedores como OpenRouter e DeepInfra?
Não, cada provedor define o próprio preço pro mesmo snapshot. O OpenRouter lista o deepseek-v4-flash-0731 a US$ 0,09 de entrada e US$ 0,18 de saída por 1M, e a DeepInfra cobra US$ 0,10 de entrada e US$ 0,20 de saída, ambos abaixo do preço oficial da API DeepSeek.
Preciso ativar o cache do DeepSeek pra pagar mais barato na entrada?
Não precisa mexer em nada. O context caching em disco é ligado por padrão pra todos os usuários, o armazenamento do cache não é cobrado e a entrada que bate no cache cai de US$ 0,14 pra US$ 0,0028 por 1M de tokens, uma redução de cerca de 98%. Pra medir quanto do seu prompt está batendo, olhe os campos usage.prompt_cache_hit_tokens e usage.prompt_cache_miss_tokens na resposta da API, cuja soma é o prompt_tokens.
Formações
Formação SAAS com IA
Tire usas ideias do papel criando softwares com IA, integre pagamentos e lance seu projeto!
- 291 aulas
- 18 projetos
- 24h 17min
Blog | Mais populares
As diferenças de var, let e const
Como fazer redirecionamento com PHP
Neste artigo você vai aprender a como fazer redirecionamento com PHP, utilizaremos abordagens fáceis de entender e de aplicar Fala programador(a), beleza? Bora aprender mais […]
Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação
Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação A popularidade da automação de processos com o n8n está em alta, principalmente […]
