Quanto custa usar o DeepSeek V4 Pro 0813 na API? Preço por token e como calcular o gasto do seu projeto

O preço do DeepSeek V4 Pro 0813 na API oficial hoje é de US$ 0,435 por 1 milhão de tokens de entrada sem cache, US$ 0,003625 por 1 milhão de tokens de entrada em cache hit e US$ 0,87 por 1 milhão de tokens de saída. A partir das 16:00 UTC de 16 de agosto de 2026 a cobrança muda e passa a ter faixa de pico e faixa fora de pico, com o vale valendo metade do pico. Estimar o gasto do seu projeto é aritmética simples: tokens divididos por 1 milhão, vezes o preço da linha certa
Ninguém descobre o custo real de uma API lendo a documentação
Descobre lendo a fatura, com o projeto já no ar e o cliente usando 😅
A boa notícia é que dá pra evitar isso: o DeepSeek V4 Pro tem preço público por milhão de tokens, e a conta do seu projeto é multiplicação e divisão, nada além disso
A notícia que muda o planejamento: a DeepSeek anunciou reajuste da API com data e hora marcada, às 16:00 UTC de 16 de agosto de 2026, e junto vem um modelo novo de cobrança por horário
Então vale fazer a conta duas vezes, com o preço de hoje e com o que entra em vigor
Bora montar isso passo a passo?
O que você está contratando: model ID, janela de contexto e cache automático
Antes de multiplicar qualquer coisa, é bom saber o que exatamente entra na fatura
Na API oficial, o identificador estável deepseek-v4-pro passou a servir o build DeepSeek-V4-Pro-0813 desde 12/08/2026
Ou seja: você não precisa apontar pra um nome com data, o ID de sempre já entrega o build novo
Formação Claude Code
Domine Claude Code do absoluto zero até o avançado
- 114 aulas
- 4 projetos
- 9h 18min
Os tetos da sua estimativa:
A documentação oficial lista contexto de 1.000.000 de tokens e saída máxima de 384.000 tokens
Esses dois números são o limite superior da sua conta
Se o seu caso de uso joga documento gigante dentro do prompt, é aqui que mora o custo, porque entrada também se paga
E o cache, como funciona?
O context caching em disco da DeepSeek é automático pra todos os usuários, sem alteração de código nem de interface, e o armazenamento do cache não tem cobrança extra
É por isso que existe uma linha bem mais barata na tabela de preços: quando um pedaço do seu prompt já foi visto, ele cai na faixa de cache hit
Se você conhece cache de build (aquele lance de não recompilar o que não mudou), a ideia é a mesma: repetiu, sai mais barato
O V4 Pro é um Mixture of Experts com 1,6 trilhão de parâmetros totais e cerca de 49 bilhões ativos por token, pré-treinado em mais de 32 trilhões de tokens
Na atualização de agosto a API expõe modos thinking e non-thinking, tool calls, saída JSON, suporte à Responses API e rotas compatíveis com OpenAI e Anthropic
A Artificial Analysis marca 53 no índice de inteligência dela (versão max) e 83,2 tokens de saída por segundo no provedor DeepSeek
Tabela de preços do DeepSeek V4 Pro: hoje e a partir de 16 de agosto de 2026
Todos os valores abaixo são por 1 milhão de tokens, em dólar
| Linha de cobrança | Preço hoje | A partir de 16/08, fora de pico | A partir de 16/08, no pico |
|---|---|---|---|
| Entrada sem cache (cache miss) | US$ 0,435 | US$ 0,66 | US$ 1,32 |
| Entrada em cache (cache hit) | US$ 0,003625 | US$ 0,022 | US$ 0,044 |
| Saída | US$ 0,87 | US$ 1,98 | US$ 3,96 |
A regra de horário é simples: pico das 01:00 às 04:00 UTC e das 06:00 às 10:00 UTC
Todas as demais horas são fora de pico, e a faixa fora de pico custa metade da faixa de pico
Repare de onde vem o preço atual: em 22 de maio de 2026 a DeepSeek tornou permanente o desconto de 75% do V4 Pro, fixando justamente os US$ 0,435 de entrada e US$ 0,87 de saída
Ou seja, o que muda agora não é um desconto expirando, é tabela nova mesmo
A tabela viva fica na documentação de preços da DeepSeek, e é ela que manda no fim do dia
Se você quer comparar com o irmão mais barato da casa antes de decidir, vale olhar o preço por token do V4 Flash também
Como calcular o gasto do seu projeto por token, passo a passo
Aqui não tem fórmula mágica, tem aritmética
- Separe entrada e saída
São preços diferentes, e no V4 Pro a saída custa mais que o dobro da entrada sem cache hoje
O erro comum deste passo: somar tudo num "total de tokens" só e multiplicar por um preço único, o que subestima projeto que gera texto longo
- Estime os tokens por requisição
Quebre em quatro pedaços: prompt de sistema, contexto anexado, pergunta do usuário e resposta esperada
Os três primeiros são entrada, o último é saída
O erro comum deste passo: medir por caracteres em vez de tokens, ou esquecer que o prompt de sistema é recobrado a cada chamada, ele não é "configurado uma vez"
- Multiplique volume por preço, dividindo por 1 milhão
A fórmula é literalmente essa, com os preços de hoje:
custo_entrada_miss = (tokens_miss / 1000000) * 0.435
custo_entrada_hit = (tokens_hit / 1000000) * 0.003625
custo_saida = (tokens_saida / 1000000) * 0.87
custo_total = custo_entrada_miss + custo_entrada_hit + custo_saida
O erro comum deste passo: dividir por 1.000 em vez de 1.000.000 e sair contando mil vezes mais caro (ou mais barato) 😛
- Separe a entrada em cache hit e cache miss
A diferença entre US$ 0,435 e US$ 0,003625 é gigante, então tratar toda a entrada como miss infla a estimativa, e tratar tudo como hit é fantasia
O erro comum deste passo: supor cache hit em 100% do prompt
A parte que muda a cada chamada (a pergunta do usuário, o trecho novo do documento) tende a entrar como miss
- Audite com a própria resposta da API
Você não precisa adivinhar o mix: a resposta traz os campos prompt_cache_hit_tokens e prompt_cache_miss_tokens, e o total de tokens de prompt é a soma dos dois
"usage": {
"prompt_cache_hit_tokens": 2000,
"prompt_cache_miss_tokens": 500
}
Esses valores aí em cima são só ilustração do formato, os seus vêm da sua chamada
A referência dos campos está na página de uso de tokens da API
O erro comum deste passo: estimar o cache no chute quando o número real já vem de graça em toda resposta
- Converta pra real por último
O preço é cobrado em dólar, então feche a conta em dólar e só depois converta
Neste post o câmbio usado é US$ 1 = R$ 5,19 (dólar comercial, venda, em 13/08/2026)
O erro comum deste passo: converter cada linha separadamente com arredondamento, acumular erro e depois não bater com a fatura
Três cenários com a conta montada: chat de suporte, geração de código e resumo de documento
Deixa uma coisa clara antes: o preço é oficial, o volume é hipótese
Os números de requisição por mês abaixo são premissa de exemplo, você troca pelos seus e a fórmula do passo 3 continua a mesma
Cenário 1: chat de suporte
Premissa: 10.000 conversas por mês, prompt de sistema de 2.000 tokens que bate no cache, 500 tokens de entrada nova por conversa e 300 tokens de resposta
Isso dá 20 milhões de tokens em cache hit, 5 milhões em cache miss e 3 milhões de saída no mês
| Linha | Volume no mês | Preço hoje (por 1 M) | Fora de pico (16/08) | Pico (16/08) |
|---|---|---|---|---|
| Entrada cache hit | 20 M | US$ 0,003625 | US$ 0,022 | US$ 0,044 |
| Entrada cache miss | 5 M | US$ 0,435 | US$ 0,66 | US$ 1,32 |
| Saída | 3 M | US$ 0,87 | US$ 1,98 | US$ 3,96 |
Agora é aplicar a fórmula linha por linha (volume dividido por 1 milhão, vezes o preço da coluna) e somar as três
Repare numa coisa: mesmo sendo o maior volume da tabela, o cache hit é a linha mais barata da conta hoje, porque o preço por milhão dele é uma fração das outras duas
Cenário 2: geração de código
Premissa: 3.000 requisições por mês, 4.000 tokens de entrada sem cache e 3.000 tokens de saída por requisição
Dá 12 milhões de entrada e 9 milhões de saída
| Linha | Volume no mês | Preço hoje (por 1 M) | Fora de pico (16/08) | Pico (16/08) |
|---|---|---|---|---|
| Entrada cache miss | 12 M | US$ 0,435 | US$ 0,66 | US$ 1,32 |
| Saída | 9 M | US$ 0,87 | US$ 1,98 | US$ 3,96 |
Aqui quem manda na conta é a saída: ela é a linha com o preço por milhão mais alto em qualquer coluna da tabela, e o volume dela nem é pequeno
Modelo que escreve muito código custa pelo que ele escreve, não pelo que ele lê
Se você cobra mensalidade de cliente em cima disso, a lógica é a mesma de calcular custo de automação no n8n: o token entra na planilha junto com infra
Cenário 3: resumo de documento
Premissa: 200 documentos por mês, 400.000 tokens de entrada cada um (cabe folgado na janela de 1.000.000) e 1.500 tokens de resumo
Dá 80 milhões de entrada e 0,3 milhão de saída
| Linha | Volume no mês | Preço hoje (por 1 M) | Fora de pico (16/08) | Pico (16/08) |
|---|---|---|---|---|
| Entrada cache miss | 80 M | US$ 0,435 | US$ 0,66 | US$ 1,32 |
| Saída | 0,3 M | US$ 0,87 | US$ 1,98 | US$ 3,96 |
Inverteu completamente: o volume de saída virou troco perto da entrada, então é a entrada que faz a fatura praticamente sozinha
Janela de 1 milhão de tokens é liberdade, e liberdade tem preço 🙂
O que muda na sua fatura a partir de 16 de agosto de 2026
O reajuste não sobe tudo na mesma proporção, e é aí que mora a decisão
O maior salto é no cache hit, que passa a custar cerca de 6 vezes o valor atual
Isso pesa exatamente onde a gente menos espera: fluxo de agente que relê os mesmos arquivos a cada passo vive de cache hit
A entrada sem cache e a saída também sobem, mas quem tinha arquitetado tudo pra "caber no cache" é quem sente mais
A faixa de horário abre uma escolha:
Como fora de pico custa metade do pico, trabalho em lote que tolera espera muda de natureza
Indexação, geração de conteúdo em fila, reprocessamento de base, tudo isso pode ser agendado pra rodar fora das janelas de 01:00 às 04:00 UTC e 06:00 às 10:00 UTC
Já chat com usuário na frente da tela não escolhe horário, roda quando o usuário aparece
O que checar antes da data:
- Meça o mix real de
prompt_cache_hit_tokenseprompt_cache_miss_tokensdo seu tráfego, não o mix que você imagina - Refaça a estimativa com as três colunas da tabela nova, separando o que é lote (fora de pico) do que é interativo
- Olhe qual linha domina a sua conta hoje, porque é ela que vai definir o tamanho do susto
Conclusão
Estimar gasto de API não é adivinhação, é divisão por 1 milhão e multiplicação
O que costuma dar errado é o volume estimado no chute e o cache tratado como fé, e os dois têm conserto: a própria resposta da API devolve o número real
O próximo passo concreto é esse: roda uma amostra pequena do seu caso, lê prompt_cache_hit_tokens e prompt_cache_miss_tokens, multiplica pelo volume que você espera em produção e fecha a conta
Depois repete tudo com os preços que entram em vigor às 16:00 UTC de 16 de agosto de 2026, pra saber hoje qual vai ser a fatura de setembro
E lembra: preço de API muda, e muda com data marcada
A página oficial é sempre a fonte final, o post é o mapa pra você não descobrir a conta depois…
até o próximo post! 😀
Perguntas frequentes
Quanto custa 1 milhão de tokens de entrada no DeepSeek V4 Pro hoje?
Hoje, entrada que não bate no cache (cache miss) custa US$ 0,435 por 1 milhão de tokens. Se o trecho já foi visto e cai em cache hit, o preço cai para US$ 0,003625 por 1 milhão. Esse valor de US$ 0,435 é o mesmo que ficou permanente desde 22 de maio de 2026, quando a DeepSeek fixou o desconto de 75%.
Quando entra em vigor o novo preço da API do DeepSeek V4 Pro?
O reajuste começa às 16:00 UTC de 16 de agosto de 2026. A partir desse horário, os preços deixam de ser fixos e passam a variar por faixa de pico e fora de pico. Vale rodar a estimativa do seu projeto duas vezes, com a tabela de hoje e com a tabela nova.
Como funciona o horário de pico na nova cobrança do DeepSeek V4 Pro?
O pico acontece das 01:00 às 04:00 UTC e das 06:00 às 10:00 UTC. Todas as demais horas do dia são fora de pico, e essa faixa custa exatamente metade do valor cobrado no pico. Isso vale para entrada, saída e cache hit.
O cache automático do DeepSeek V4 Pro precisa de alguma configuração?
Não. O context caching em disco é automático para todos os usuários, sem alteração de código ou de interface, e o armazenamento do cache não gera cobrança extra. Ele só muda o preço da entrada que já foi vista antes, jogando parte do prompt na faixa mais barata de cache hit.
Qual a diferença de preço entre cache hit e cache miss no DeepSeek V4 Pro depois do reajuste?
A partir de 16 de agosto de 2026, o cache hit sobe para US$ 0,022 por 1 milhão de tokens fora de pico e US$ 0,044 no pico, ante US$ 0,003625 hoje. É o item com o maior salto percentual da tabela nova, cerca de 6 vezes o valor atual, o que pesa bastante em fluxos de agente que releem os mesmos arquivos.
Como converter o gasto do DeepSeek V4 Pro de dólar para real?
Feche a conta inteira em dólar primeiro, somando entrada, cache hit e saída, e só depois converta o total. Neste post o câmbio usado é US$ 1 = R$ 5,19, dólar comercial de venda em 13/08/2026. Converter cada linha separada acumula erro de arredondamento e a conta não bate com a fatura.
Formações
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Blog | Mais populares
Como rodar o DeepSeek V4 no Ollama: o passo a passo e o que checar antes de tentar
Rodar o DeepSeek V4 no Ollama hoje é via tag cloud: veja como fazer login, baixar a tag e usar via CLI ou API local, e quando vale ir de GGUF offline.
DeepSeek V4 Pro Max: o que é e como escolher entre as variantes da família V4
DeepSeek V4 Pro Max não é um modelo separado: é o modo de raciocínio máximo do V4-Pro. Veja como funciona e como escolher entre as variantes.
DeepSeek V4 Pro: o que é e quando compensa usar em vez do V4 Flash?
DeepSeek V4 Pro tem 1,6 tri de parâmetros e janela de 1 milhão de tokens. Entenda o preço, o desempenho e quando vale mais a pena que o V4 Flash.
