Quanto custa usar o DeepSeek V4 Pro 0813 na API? Preço por token e como calcular o gasto do seu projeto

tabela de preço do DeepSeek V4 Pro 0813 por token na API
Resposta rápida

O preço do DeepSeek V4 Pro 0813 na API oficial hoje é de US$ 0,435 por 1 milhão de tokens de entrada sem cache, US$ 0,003625 por 1 milhão de tokens de entrada em cache hit e US$ 0,87 por 1 milhão de tokens de saída. A partir das 16:00 UTC de 16 de agosto de 2026 a cobrança muda e passa a ter faixa de pico e faixa fora de pico, com o vale valendo metade do pico. Estimar o gasto do seu projeto é aritmética simples: tokens divididos por 1 milhão, vezes o preço da linha certa

Ninguém descobre o custo real de uma API lendo a documentação

Descobre lendo a fatura, com o projeto já no ar e o cliente usando 😅

A boa notícia é que dá pra evitar isso: o DeepSeek V4 Pro tem preço público por milhão de tokens, e a conta do seu projeto é multiplicação e divisão, nada além disso

A notícia que muda o planejamento: a DeepSeek anunciou reajuste da API com data e hora marcada, às 16:00 UTC de 16 de agosto de 2026, e junto vem um modelo novo de cobrança por horário

Então vale fazer a conta duas vezes, com o preço de hoje e com o que entra em vigor

Bora montar isso passo a passo?

O que você está contratando: model ID, janela de contexto e cache automático

Antes de multiplicar qualquer coisa, é bom saber o que exatamente entra na fatura

Na API oficial, o identificador estável deepseek-v4-pro passou a servir o build DeepSeek-V4-Pro-0813 desde 12/08/2026

Ou seja: você não precisa apontar pra um nome com data, o ID de sempre já entrega o build novo

Formação Claude Code
Formação Recomendada

Formação Claude Code

Domine Claude Code do absoluto zero até o avançado

  • 114 aulas
  • 4 projetos
  • 9h 18min

Os tetos da sua estimativa:

A documentação oficial lista contexto de 1.000.000 de tokens e saída máxima de 384.000 tokens

Esses dois números são o limite superior da sua conta

Se o seu caso de uso joga documento gigante dentro do prompt, é aqui que mora o custo, porque entrada também se paga

E o cache, como funciona?

O context caching em disco da DeepSeek é automático pra todos os usuários, sem alteração de código nem de interface, e o armazenamento do cache não tem cobrança extra

É por isso que existe uma linha bem mais barata na tabela de preços: quando um pedaço do seu prompt já foi visto, ele cai na faixa de cache hit

Se você conhece cache de build (aquele lance de não recompilar o que não mudou), a ideia é a mesma: repetiu, sai mais barato

O V4 Pro é um Mixture of Experts com 1,6 trilhão de parâmetros totais e cerca de 49 bilhões ativos por token, pré-treinado em mais de 32 trilhões de tokens

Na atualização de agosto a API expõe modos thinking e non-thinking, tool calls, saída JSON, suporte à Responses API e rotas compatíveis com OpenAI e Anthropic

A Artificial Analysis marca 53 no índice de inteligência dela (versão max) e 83,2 tokens de saída por segundo no provedor DeepSeek

Tabela de preços do DeepSeek V4 Pro: hoje e a partir de 16 de agosto de 2026

Todos os valores abaixo são por 1 milhão de tokens, em dólar

Linha de cobrança Preço hoje A partir de 16/08, fora de pico A partir de 16/08, no pico
Entrada sem cache (cache miss) US$ 0,435 US$ 0,66 US$ 1,32
Entrada em cache (cache hit) US$ 0,003625 US$ 0,022 US$ 0,044
Saída US$ 0,87 US$ 1,98 US$ 3,96

A regra de horário é simples: pico das 01:00 às 04:00 UTC e das 06:00 às 10:00 UTC

Todas as demais horas são fora de pico, e a faixa fora de pico custa metade da faixa de pico

Repare de onde vem o preço atual: em 22 de maio de 2026 a DeepSeek tornou permanente o desconto de 75% do V4 Pro, fixando justamente os US$ 0,435 de entrada e US$ 0,87 de saída

Ou seja, o que muda agora não é um desconto expirando, é tabela nova mesmo

A tabela viva fica na documentação de preços da DeepSeek, e é ela que manda no fim do dia

Se você quer comparar com o irmão mais barato da casa antes de decidir, vale olhar o preço por token do V4 Flash também

Como calcular o gasto do seu projeto por token, passo a passo

Aqui não tem fórmula mágica, tem aritmética

  1. Separe entrada e saída

São preços diferentes, e no V4 Pro a saída custa mais que o dobro da entrada sem cache hoje

O erro comum deste passo: somar tudo num "total de tokens" só e multiplicar por um preço único, o que subestima projeto que gera texto longo

  1. Estime os tokens por requisição

Quebre em quatro pedaços: prompt de sistema, contexto anexado, pergunta do usuário e resposta esperada

Os três primeiros são entrada, o último é saída

O erro comum deste passo: medir por caracteres em vez de tokens, ou esquecer que o prompt de sistema é recobrado a cada chamada, ele não é "configurado uma vez"

  1. Multiplique volume por preço, dividindo por 1 milhão

A fórmula é literalmente essa, com os preços de hoje:

custo_entrada_miss = (tokens_miss  / 1000000) * 0.435
custo_entrada_hit  = (tokens_hit   / 1000000) * 0.003625
custo_saida        = (tokens_saida / 1000000) * 0.87

custo_total = custo_entrada_miss + custo_entrada_hit + custo_saida

O erro comum deste passo: dividir por 1.000 em vez de 1.000.000 e sair contando mil vezes mais caro (ou mais barato) 😛

  1. Separe a entrada em cache hit e cache miss

A diferença entre US$ 0,435 e US$ 0,003625 é gigante, então tratar toda a entrada como miss infla a estimativa, e tratar tudo como hit é fantasia

O erro comum deste passo: supor cache hit em 100% do prompt

A parte que muda a cada chamada (a pergunta do usuário, o trecho novo do documento) tende a entrar como miss

  1. Audite com a própria resposta da API

Você não precisa adivinhar o mix: a resposta traz os campos prompt_cache_hit_tokens e prompt_cache_miss_tokens, e o total de tokens de prompt é a soma dos dois

"usage": {
  "prompt_cache_hit_tokens": 2000,
  "prompt_cache_miss_tokens": 500
}

Esses valores aí em cima são só ilustração do formato, os seus vêm da sua chamada

A referência dos campos está na página de uso de tokens da API

O erro comum deste passo: estimar o cache no chute quando o número real já vem de graça em toda resposta

  1. Converta pra real por último

O preço é cobrado em dólar, então feche a conta em dólar e só depois converta

Neste post o câmbio usado é US$ 1 = R$ 5,19 (dólar comercial, venda, em 13/08/2026)

O erro comum deste passo: converter cada linha separadamente com arredondamento, acumular erro e depois não bater com a fatura

Três cenários com a conta montada: chat de suporte, geração de código e resumo de documento

Deixa uma coisa clara antes: o preço é oficial, o volume é hipótese

Os números de requisição por mês abaixo são premissa de exemplo, você troca pelos seus e a fórmula do passo 3 continua a mesma

Cenário 1: chat de suporte

Premissa: 10.000 conversas por mês, prompt de sistema de 2.000 tokens que bate no cache, 500 tokens de entrada nova por conversa e 300 tokens de resposta

Isso dá 20 milhões de tokens em cache hit, 5 milhões em cache miss e 3 milhões de saída no mês

Linha Volume no mês Preço hoje (por 1 M) Fora de pico (16/08) Pico (16/08)
Entrada cache hit 20 M US$ 0,003625 US$ 0,022 US$ 0,044
Entrada cache miss 5 M US$ 0,435 US$ 0,66 US$ 1,32
Saída 3 M US$ 0,87 US$ 1,98 US$ 3,96

Agora é aplicar a fórmula linha por linha (volume dividido por 1 milhão, vezes o preço da coluna) e somar as três

Repare numa coisa: mesmo sendo o maior volume da tabela, o cache hit é a linha mais barata da conta hoje, porque o preço por milhão dele é uma fração das outras duas

Cenário 2: geração de código

Premissa: 3.000 requisições por mês, 4.000 tokens de entrada sem cache e 3.000 tokens de saída por requisição

Dá 12 milhões de entrada e 9 milhões de saída

Linha Volume no mês Preço hoje (por 1 M) Fora de pico (16/08) Pico (16/08)
Entrada cache miss 12 M US$ 0,435 US$ 0,66 US$ 1,32
Saída 9 M US$ 0,87 US$ 1,98 US$ 3,96

Aqui quem manda na conta é a saída: ela é a linha com o preço por milhão mais alto em qualquer coluna da tabela, e o volume dela nem é pequeno

Modelo que escreve muito código custa pelo que ele escreve, não pelo que ele lê

Se você cobra mensalidade de cliente em cima disso, a lógica é a mesma de calcular custo de automação no n8n: o token entra na planilha junto com infra

Cenário 3: resumo de documento

Premissa: 200 documentos por mês, 400.000 tokens de entrada cada um (cabe folgado na janela de 1.000.000) e 1.500 tokens de resumo

Dá 80 milhões de entrada e 0,3 milhão de saída

Linha Volume no mês Preço hoje (por 1 M) Fora de pico (16/08) Pico (16/08)
Entrada cache miss 80 M US$ 0,435 US$ 0,66 US$ 1,32
Saída 0,3 M US$ 0,87 US$ 1,98 US$ 3,96

Inverteu completamente: o volume de saída virou troco perto da entrada, então é a entrada que faz a fatura praticamente sozinha

Janela de 1 milhão de tokens é liberdade, e liberdade tem preço 🙂

O que muda na sua fatura a partir de 16 de agosto de 2026

O reajuste não sobe tudo na mesma proporção, e é aí que mora a decisão

O maior salto é no cache hit, que passa a custar cerca de 6 vezes o valor atual

Isso pesa exatamente onde a gente menos espera: fluxo de agente que relê os mesmos arquivos a cada passo vive de cache hit

A entrada sem cache e a saída também sobem, mas quem tinha arquitetado tudo pra "caber no cache" é quem sente mais

A faixa de horário abre uma escolha:

Como fora de pico custa metade do pico, trabalho em lote que tolera espera muda de natureza

Indexação, geração de conteúdo em fila, reprocessamento de base, tudo isso pode ser agendado pra rodar fora das janelas de 01:00 às 04:00 UTC e 06:00 às 10:00 UTC

Já chat com usuário na frente da tela não escolhe horário, roda quando o usuário aparece

O que checar antes da data:

  • Meça o mix real de prompt_cache_hit_tokens e prompt_cache_miss_tokens do seu tráfego, não o mix que você imagina
  • Refaça a estimativa com as três colunas da tabela nova, separando o que é lote (fora de pico) do que é interativo
  • Olhe qual linha domina a sua conta hoje, porque é ela que vai definir o tamanho do susto

Conclusão

Estimar gasto de API não é adivinhação, é divisão por 1 milhão e multiplicação

O que costuma dar errado é o volume estimado no chute e o cache tratado como fé, e os dois têm conserto: a própria resposta da API devolve o número real

O próximo passo concreto é esse: roda uma amostra pequena do seu caso, lê prompt_cache_hit_tokens e prompt_cache_miss_tokens, multiplica pelo volume que você espera em produção e fecha a conta

Depois repete tudo com os preços que entram em vigor às 16:00 UTC de 16 de agosto de 2026, pra saber hoje qual vai ser a fatura de setembro

E lembra: preço de API muda, e muda com data marcada

A página oficial é sempre a fonte final, o post é o mapa pra você não descobrir a conta depois…

até o próximo post! 😀

Perguntas frequentes

Quanto custa 1 milhão de tokens de entrada no DeepSeek V4 Pro hoje?

Hoje, entrada que não bate no cache (cache miss) custa US$ 0,435 por 1 milhão de tokens. Se o trecho já foi visto e cai em cache hit, o preço cai para US$ 0,003625 por 1 milhão. Esse valor de US$ 0,435 é o mesmo que ficou permanente desde 22 de maio de 2026, quando a DeepSeek fixou o desconto de 75%.

Quando entra em vigor o novo preço da API do DeepSeek V4 Pro?

O reajuste começa às 16:00 UTC de 16 de agosto de 2026. A partir desse horário, os preços deixam de ser fixos e passam a variar por faixa de pico e fora de pico. Vale rodar a estimativa do seu projeto duas vezes, com a tabela de hoje e com a tabela nova.

Como funciona o horário de pico na nova cobrança do DeepSeek V4 Pro?

O pico acontece das 01:00 às 04:00 UTC e das 06:00 às 10:00 UTC. Todas as demais horas do dia são fora de pico, e essa faixa custa exatamente metade do valor cobrado no pico. Isso vale para entrada, saída e cache hit.

O cache automático do DeepSeek V4 Pro precisa de alguma configuração?

Não. O context caching em disco é automático para todos os usuários, sem alteração de código ou de interface, e o armazenamento do cache não gera cobrança extra. Ele só muda o preço da entrada que já foi vista antes, jogando parte do prompt na faixa mais barata de cache hit.

Qual a diferença de preço entre cache hit e cache miss no DeepSeek V4 Pro depois do reajuste?

A partir de 16 de agosto de 2026, o cache hit sobe para US$ 0,022 por 1 milhão de tokens fora de pico e US$ 0,044 no pico, ante US$ 0,003625 hoje. É o item com o maior salto percentual da tabela nova, cerca de 6 vezes o valor atual, o que pesa bastante em fluxos de agente que releem os mesmos arquivos.

Como converter o gasto do DeepSeek V4 Pro de dólar para real?

Feche a conta inteira em dólar primeiro, somando entrada, cache hit e saída, e só depois converta o total. Neste post o câmbio usado é US$ 1 = R$ 5,19, dólar comercial de venda em 13/08/2026. Converter cada linha separada acumula erro de arredondamento e a conta não bate com a fatura.



Escrito por | Matheus Battisti

Matheus Battisti
Fundador da Hora de Codar

Programador apaixonado pelo mundo das tecnologias, sempre buscando em aprender e se aprofundar em linguagens, frameworks e o que mais for necessário para executar um bom trabalho. Agora tem uma nova missão que é de passar seu conhecimento adiante para formar novos programadores e especializar mais os que já são.

Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares