Quanto custa o DeepSeek V4 Flash na API? Preço por token e como estimar o gasto do seu projeto

gráfico do preço do DeepSeek V4 Flash na API por milhão de tokens
Resposta rápida

O DeepSeek V4 Flash preço na API oficial fica em US$ 0,14 por 1M de tokens de entrada (cache miss), US$ 0,0028 por 1M de entrada em cache hit e US$ 0,28 por 1M de tokens de saída. Pelo câmbio de R$ 5,06 usado neste post, dá cerca de R$ 0,71 na entrada e R$ 1,42 na saída por milhão. O V4 Pro custa aproximadamente três vezes mais. O cache em disco vem ligado por padrão e corta a entrada em cerca de 98%. Em agente o gasto sobe, porque o contexto volta inteiro a cada rodada

US$ 0,28 por 1 milhão de tokens de saída

É esse o número que faz o V4 Flash parecer quase de graça quando você olha a tabela de preço pela primeira vez

Só que a pergunta real não é quanto custa 1M de tokens, é quanto vai custar o SEU projeto rodando de verdade, com contexto crescendo, agente reenviando prompt e modelo escrevendo mais do que você esperava

Então bora resolver isso direito: preço oficial por token, a conta pra estimar antes de plugar e o raciocínio de custo pra agentes, que é onde a fatura escapa…

Tabela de preços do DeepSeek V4 Flash e V4 Pro

A DeepSeek cobra em três linhas diferentes: entrada que não bateu no cache, entrada que bateu no cache e saída

São preços por 1 milhão de tokens

Cobrança (por 1M de tokens) V4 Flash (US$) V4 Pro (US$)
Entrada, cache miss 0,14 0,435
Entrada, cache hit 0,0028 0,003625
Saída 0,28 0,87

Repara na régua: o Pro sai por volta de três vezes o preço do Flash na entrada com cache miss e na saída (na linha de cache hit a distância é bem menor)

Esse é o tipo de diferença que não aparece no primeiro teste e aparece MUITO no fim do mês

Se o seu caso é classificar texto, gerar resposta curta, resumir, extrair dado estruturado, o Flash resolve e a diferença de preço vira dinheiro no bolso

Se é raciocínio pesado em cima de base grande, aí vale medir os dois antes de decidir, e não escolher no achismo

Formação Vibe Coding
Formação Recomendada

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Como a cobrança por token funciona na API DeepSeek

Primeiro conceito, porque tem gente que erra a conta aqui e nem percebe: entrada e saída NÃO custam a mesma coisa

No V4 Flash a saída custa o dobro da entrada (US$ 0,28 contra US$ 0,14 por 1M)

Tudo que você manda pro modelo (system prompt, histórico, arquivos, ferramenta) é entrada

Tudo que ele escreve de volta é saída

E o cache, como entra nisso?

O context caching em disco da DeepSeek é ligado por padrão pra todos os usuários, sem você mudar uma linha de código, e o armazenamento do cache não é cobrado

Quando um pedaço do prompt já foi visto antes, ele entra como cache hit e o preço de entrada despenca de US$ 0,14 pra US$ 0,0028 por 1M, uma queda de uns 98%

Se você já leu sobre o preço da API DeepSeek em 2026, esse é o mesmo mecanismo que segura a conta de quem repete prompt longo

É como reaproveitar um build em cache: o trabalho pesado só acontece na primeira vez, e as repetições saem quase de graça

O raciocínio também é cobrado

Quando o modelo roda em modo de raciocínio, os tokens de thinking são cobrados como SAÍDA (US$ 0,28 por 1M no Flash) e ainda contam contra o teto de saída

E os limites da geração V4 são generosos: janela de contexto de 1M de tokens e até 384K tokens de saída por requisição

Contexto de 1M é ótimo pra jogar repositório inteiro lá dentro

Também é ótimo pra torrar crédito sem perceber, então segue lendo =)

Como estimar o gasto do seu projeto antes de plugar

A conta é simples, o que engana é o volume

  1. Meça o tamanho médio da sua entrada. Some system prompt, instruções, histórico e qualquer documento que você anexa por chamada. O erro comum aqui é medir só a pergunta do usuário e esquecer o system prompt, que vai junto em TODA requisição
  1. Estime a saída, e estime pra cima. Saída custa o dobro da entrada, e é a parte que você menos controla. O erro comum é chutar uma resposta curta e receber três parágrafos, ou ligar o modo de raciocínio e esquecer que o thinking é cobrado como saída
  1. Multiplique pelo volume real do mês. Nada de "umas chamadas por dia", pega o número. Monta a conta assim, com o seu volume no lugar do exemplo:
entrada: (total de tokens de entrada / 1M) x US$ 0,14
saida:   (total de tokens de saida / 1M)   x US$ 0,28
  1. Separe a parte que bate no cache. Se boa parte do seu prompt é fixa, essa fatia sai por US$ 0,0028 por 1M em vez de US$ 0,14. O erro comum é assumir 100% de cache hit no papel: o cache é oportunista, a taxa real varia com o seu tráfego
  1. Meça o real na resposta, não na planilha. A API devolve os campos que fecham a conta: usage.prompt_cache_hit_tokens e usage.prompt_cache_miss_tokens, e a soma dos dois é o prompt_tokens
"usage": {
  "prompt_tokens": 1200,
  "prompt_cache_hit_tokens": 960,
  "prompt_cache_miss_tokens": 240
}
  1. Compare estimativa com realidade depois de um dia rodando. O erro comum aqui é nem olhar: se você não loga hit e miss por chamada, você não tem como saber se o gasto subiu por volume ou porque o cache parou de pegar

Tome cuidado com o passo 2

Subestimar a saída é de longe o jeito mais rápido de a fatura vir o dobro da sua planilha

Chat, agente e código: onde o custo explode

Três perfis de uso, três contas completamente diferentes com o MESMO preço por token

Chat curto. Pergunta pequena, resposta pequena, pouca coisa de histórico. É o cenário mais barato que existe e é justamente o que engana todo mundo no primeiro teste

Geração de texto longo. Entrada pequena, saída gigante. Aqui quem manda na fatura é o US$ 0,28, porque você paga o dobro em cima da parte que mais cresce

Agente. Esse é o caso caro, e não é por maldade da DeepSeek

Agente reenvia contexto a cada volta: prompt de sistema, histórico da conversa, resultado das ferramentas, arquivos lidos

Na vigésima interação, você não está pagando uma requisição de 4K, está pagando uma de 60K, 100K, e por aí vai

É aqui que o cache hit salva a conta, porque o pedaço fixo do prompt (sistema, instruções, arquivos que não mudaram) tende a repetir a cada volta

Quem já comparou isso com o modelo de assinatura sabe a diferença: no preço do Claude Code o plano te dá previsibilidade, na API paga por token você tem preço baixo e teto nenhum

O detalhe da verbosidade

Tem um ponto que mexe direto na conta de saída: o V4 Flash 0731 é classificado como muito verboso pelo Artificial Analysis

Pra rodar o Intelligence Index ele gerou cerca de 210M de tokens, contra uma mediana de 100M dos comparáveis

Melhorou em relação à versão anterior do V4 Flash (queda de 12% nos tokens de saída), mas ainda é acima da média

Traduzindo: modelo que fala demais custa mais, porque a fala dele é justamente a linha mais cara da tabela

O que gastei de verdade rodando projetos via API

Aqui não é estimativa de planilha, é o que saiu do meu crédito

Coloquei US$ 7 na API e rodei uma bateria de projetos, os mesmos prompts que eu já tinha usado no teste do GPT 5.5, copiando e colando pra ter comparação direta

Comecei pela interface de chat, pedindo uma landing page em HTML, CSS e JavaScript, e usei o preview embutido pra ver rodando

Mesmo em período de lançamento a resposta veio rápida, sem aquela sensação de servidor sobrecarregado

Do terceiro projeto em diante eu gerei tudo via API, um prompt só por projeto

Atenção neste ponto, porque é o que mais pega gente desprevenida: eu usei a variante Pro, a mais cara, em todos os projetos gerados por API

No fim da bateria eu tinha consumido US$ 6,13

E o gasto não foi distribuído: uns 80% do total (estimativa minha olhando o consumo) foram embora num único projeto full stack, um clone do Instagram, onde o contexto crescia a cada correção e o consumo subia junto

Cheguei a ver 50% de uso de contexto na sessão desse projeto, e foi exatamente ali que o gasto disparou

Os projetos menores ficaram entre 20 e 30 centavos de dólar por execução

Sobre a qualidade, sendo honesto: os projetos do GPT 5.5 ficaram mais polidos na minha comparação

No projeto de terminal apareceu identação errada e um comando que o modelo não entendeu, mas o resultado ficou funcional

Na landing page comparativa o design ficou mais pobre, o header com animação não apareceu direito

Já no jogo de asteroides o resultado ficou idêntico ao do GPT: velocidade da nave controlada, game over funcionando e reinício pela tecla R

Pelo preço que custou, tá muito bom

Veja o teste em vídeo

Se você quer ver o gasto subindo na tela e o comportamento do modelo em cada projeto, o teste inteiro tá aqui

Mudanças de cobrança que podem alterar sua conta

Três coisas mudaram e uma está anunciada pra mudar, se liga nisso antes de copiar código velho de tutorial

Os IDs antigos foram aposentados. deepseek-chat e deepseek-reasoner foram retirados em 24/07/2026, o nome de modelo atual é deepseek-v4-flash

O desconto de horário ocioso acabou. Aquele off-peak da geração V3/R1 (16:30 às 00:30 UTC, com 50% no V3 e 75% no R1) encerrou junto com a aposentadoria daqueles aliases, em 24/07/2026, e NÃO vale pro V4

A cobrança 2x em horário de pico foi anunciada. Seria o dobro sobre todos os itens de cobrança nas faixas de 09:00 às 12:00 e 14:00 às 18:00 no horário de Pequim (UTC+8), mas até 03/08/2026 nenhuma data de vigência tinha sido anunciada

E tem uma boa notícia no meio: o snapshot V4 Flash 0731 entrou em beta pública em 31/07/2026 mantendo os mesmos US$ 0,14 e US$ 0,28

Modelo novo sem aumento de preço é raro, aproveita

Preço na DeepSeek x OpenRouter x DeepInfra

Mesmo modelo, provedor diferente, preço diferente

Provedor Entrada (US$ / 1M) Saída (US$ / 1M)
DeepSeek (oficial) 0,14 0,28
OpenRouter (0731) 0,09 0,18
DeepInfra (0731) 0,10 0,20

Na tabela seca, o terceiro sai mais barato por token

Mas antes de sair migrando, lembra do que a gente viu lá em cima: o cache hit oficial derruba a entrada pra US$ 0,0028 por 1M

Se o seu uso reenvia prompt fixo o tempo todo (leia-se: agente), essa vantagem do caminho oficial pesa muito mais do que a diferença de centavos na tabela

O V4 Flash compensa pelo preço?

Compensa, e nem é briga apertada em custo por inteligência

O V4 Flash 0731 marca 50 pontos no Artificial Analysis Intelligence Index, contra uma mediana de 25 dos comparáveis

O preço combinado medido pelo Artificial Analysis fica em US$ 0,06 por 1M de tokens na proporção 7:2:1 (cache hit, entrada, saída), com 113 tokens por segundo de velocidade de saída

Por baixo do capô é um Mixture-of-Experts com 284B de parâmetros totais e 13B ativados, o que explica o preço baixo com resposta rápida

O ponto fraco continua sendo a verbosidade, que infla justamente a linha mais cara

Vale pro seu caso se: você roda volume, tem prompt fixo grande (cache hit trabalhando a seu favor), quer agente rodando sem susto no cartão, ou quer testar uma ideia sem comprometer orçamento

O V4 Pro faz mais sentido se: o projeto é grande, com muita interação em cima do mesmo código e você já mediu que o Flash erra demais nesse cenário

Só não vai pro Pro no automático, porque o triplo do preço na entrada sem cache e na saída, em cima de um agente verboso, é exatamente a combinação que me fez queimar US$ 6,13 sem sentir

Conclusão

O DeepSeek V4 Flash custa US$ 0,14 por 1M de entrada e US$ 0,28 por 1M de saída, com cache hit a US$ 0,0028, enquanto o V4 Pro fica em US$ 0,435 de entrada (cache miss), US$ 0,003625 de entrada (cache hit) e US$ 0,87 de saída

Agora o próximo passo é seu, e é bem simples: coloca um crédito PEQUENO na API, roda o seu projeto real (não um hello world) e mede prompt_cache_hit_tokens e prompt_cache_miss_tokens em cada resposta

Depois compara o gasto real com a estimativa que você fez lá no começo

Se bateu, escala tranquilo

Se veio o dobro, você vai saber exatamente onde: ou o cache não pegou, ou o modelo falou mais do que você planejou 😀

Até o próximo post!

Perguntas frequentes

O DeepSeek V4 Flash e o V4 Pro custam a mesma coisa?

Não. O V4 Flash cobra US$ 0,14 de entrada (cache miss), US$ 0,0028 de entrada (cache hit) e US$ 0,28 de saída, por 1M de tokens. O V4 Pro sai por US$ 0,435 de entrada (cache miss), US$ 0,003625 de entrada (cache hit) e US$ 0,87 de saída. Na entrada com cache miss e na saída, o Pro fica em torno de três vezes o preço do Flash, mas na linha de cache hit essa distância é bem menor.

Os IDs deepseek-chat e deepseek-reasoner ainda funcionam na API?

Não, esses IDs legados foram aposentados em 24 de julho de 2026. O nome de modelo atual é deepseek-v4-flash, e é ele que carrega o preço de US$ 0,14 de entrada e US$ 0,28 de saída por 1M de tokens.

O desconto de horário ocioso (off-peak) ainda vale pro DeepSeek V4 Flash?

Não. Aquele desconto era da geração V3/R1 (50% de redução no V3 e 75% no R1, das 16h30 à 0h30 UTC) e acabou junto com a aposentadoria desses aliases em 24 de julho de 2026. No V4, incluindo o Flash, esse benefício não existe.

É verdade que vai ter cobrança em dobro no horário de pico do DeepSeek?

A DeepSeek anunciou uma cobrança 2x sobre todos os itens de faturamento das 9h às 12h e das 14h às 18h no horário de Pequim (UTC+8). Até 3 de agosto de 2026 a data efetiva dessa mudança ainda não tinha sido anunciada, então vale acompanhar antes de fechar a conta do seu projeto.

O preço do DeepSeek V4 Flash é igual em provedores como OpenRouter e DeepInfra?

Não, cada provedor define o próprio preço pro mesmo snapshot. O OpenRouter lista o deepseek-v4-flash-0731 a US$ 0,09 de entrada e US$ 0,18 de saída por 1M, e a DeepInfra cobra US$ 0,10 de entrada e US$ 0,20 de saída, ambos abaixo do preço oficial da API DeepSeek.

Preciso ativar o cache do DeepSeek pra pagar mais barato na entrada?

Não precisa mexer em nada. O context caching em disco é ligado por padrão pra todos os usuários, o armazenamento do cache não é cobrado e a entrada que bate no cache cai de US$ 0,14 pra US$ 0,0028 por 1M de tokens, uma redução de cerca de 98%. Pra medir quanto do seu prompt está batendo, olhe os campos usage.prompt_cache_hit_tokens e usage.prompt_cache_miss_tokens na resposta da API, cuja soma é o prompt_tokens.




Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação SAAS com IA

Formação SAAS com IA

Tire usas ideias do papel criando softwares com IA, integre pagamentos e lance seu projeto!

  • 291 aulas
  • 18 projetos
  • 24h 17min

Blog | Mais populares