DeepSeek V4 Pro 0813: o que cabe na janela de 1 milhão de tokens (e por que a saída para em 384 mil)?

O DeepSeek V4 Pro 0813 tem dois tetos diferentes e quase todo mundo confunde os dois: a janela de contexto é de 1.048.576 tokens e a saída máxima é de 384.000 tokens. Um é o espaço pra colocar material dentro do prompt, o outro é o orçamento pra gerar a resposta. Se o texto volta cortado com contexto sobrando, o limite que estourou foi o de saída, ainda mais porque os tokens de raciocínio dividem esse mesmo orçamento. E a janela real muda conforme o provedor que você usa pra chamar o modelo
1.048.576 tokens de contexto não são 1.048.576 tokens de resposta
Fala aí, beleza? Esses dois números vivem colados no mesmo card de especificação, e é exatamente aí que a confusão nasce
O DeepSeek V4 Pro 0813 apareceu em 12 de agosto de 2026 como release de disponibilidade geral, encerrando o período de preview do V4 Pro
Ele tem janela de contexto de 1.048.576 tokens e saída máxima de 384.000 tokens
São limites SEPARADOS, com funções diferentes: um diz quanto material cabe na conversa, o outro diz quanto texto o modelo consegue produzir numa única resposta
Na API oficial, o ID estável do modelo é deepseek-v4-pro, e hoje ele serve a versão DeepSeek-V4-Pro-0813
Bora destrinchar os dois?
O que cabe na janela de 1 milhão de tokens na prática
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Janela de contexto é espaço de mesa: tudo que você joga pra dentro da chamada (instruções, arquivos, histórico da conversa e a própria resposta em construção) ocupa lugar ali
Com 1.048.576 tokens de espaço, o tipo de trabalho que muda de figura é este:
- base de código inteira numa chamada só, em vez de recortar 3 arquivos e torcer pro modelo adivinhar o resto
- documentação longa lida de ponta a ponta, tipo especificação técnica, RFC ou manual completo
- transcrições acumuladas, várias reuniões ou vídeos empilhados no mesmo prompt
- histórico de conversa que não precisa ser resumido a cada 20 mensagens
Quantos tokens vale uma linha de código? Isso varia demais com a linguagem e com o arquivo, então não vou cravar aqui um "X mil linhas cabem em 1M" só pra soar preciso
O ponto que interessa é a ordem de grandeza: você deixa de fazer curadoria manual de contexto e passa a mandar o material inteiro
Cuidado: o V4 Pro 0813 é somente texto
Ele não aceita entrada de imagem
Ou seja: PDF escaneado, print de tela e diagrama fotografado ficam de fora dessa festa
Se o seu material vive em imagem, o pré-processamento é problema seu antes da chamada, não do modelo
E o custo de mandar tanta coisa?
É aqui que o cache de contexto muda a conta
A API da DeepSeek documenta o Advanced Context Caching pro endpoint do V4 Pro, com preço distinto de cache hit e de cache miss
Na API oficial, a entrada custa US$ 0,435 por milhão de tokens em cache miss e US$ 0,003625 por milhão em cache hit
A diferença entre repetir o mesmo prompt gigante toda hora e aproveitar o cache é enorme, então prompt estável na frente e parte variável no fim deixou de ser firula
Se a sua dúvida é mais básica, do tipo em que tarefa de código ele realmente entrega, eu já falei sobre usar o V4 pra programar por aqui
Por que a resposta para em 384 mil tokens (e como evitar o corte)
O sintoma é sempre o mesmo: você pede um documento gigante, o modelo escreve, escreve, e a resposta simplesmente para no meio
Aí você olha o contexto e tem espaço sobrando, o que só aumenta a confusão
A causa é que o limite que estourou não é o de contexto, é o de saída
O teto real de geração é o MENOR valor entre três coisas:
geração real = min(max_tokens pedido, 384.000, contexto restante após o prompt)
Então dá pra estourar de três jeitos diferentes: pedindo max_tokens baixo demais, batendo no teto de 384.000 tokens do modelo, ou enchendo tanto o prompt que sobra pouco espaço pra resposta
O detalhe que pega quase todo mundo: o raciocínio come do mesmo prato
O V4 Pro opera em modo com e sem raciocínio, e o raciocínio vem ligado por padrão
E os tokens de raciocínio dividem o mesmo orçamento do max_tokens e do teto de 384.000 tokens de saída
Não existe cota separada de cadeia de pensamento aqui
Traduzindo: se o modelo pensou muito antes de responder, ele gastou parte do seu orçamento de resposta pensando
A resposta final chega mais curta e você fica achando que o modelo "não quis" escrever tudo
Como evitar o corte:
- Dimensione o
max_tokenscom folga, não no talo do que você espera de resposta
Se você quer 20 mil tokens de texto e pede exatamente 20 mil, o raciocínio consome uma parte e a resposta trunca
O erro comum deste passo: tratar max_tokens como "tamanho da resposta" quando ele é "tamanho de tudo que sai do modelo"
{
"model": "deepseek-v4-pro",
"max_tokens": 64000
}
- Fatie a geração longa em várias chamadas
Em vez de "escreva o livro inteiro", peça capítulo por capítulo, ou módulo por módulo, mantendo o contexto grande na entrada
A janela de 1 milhão de tokens trabalha justamente a seu favor aqui: o material de referência continua todo lá em cada chamada, só a saída é que vira pedaço
O erro comum deste passo: fatiar a ENTRADA junto com a saída, e o modelo perder a referência do que já escreveu
- Considere o modo sem raciocínio quando o que importa é volume de resposta
Se a tarefa é mais mecânica (transcrever, reformatar, gerar boilerplate) e menos deliberativa, o raciocínio ligado só está comendo orçamento de saída
O erro comum deste passo: desligar o raciocínio em tarefa que exige análise, e trocar resposta longa por resposta longa e errada, o que não é lá um bom negócio 😅
A janela que você recebe depende de onde você chama o modelo
Essa é a parte que ninguém avisa: o card de especificação diz 1.048.576 tokens, mas o número que CHEGA até você depende do caminho de acesso
| Caminho de acesso | Janela efetiva | Entrada (por milhão) | Saída (por milhão) |
|---|---|---|---|
| API oficial da DeepSeek | 1.048.576 tokens | US$ 0,435 em cache miss / US$ 0,003625 em cache hit | US$ 0,87 |
Together AI (deepseek-ai/DeepSeek-V4-Pro, FP4) |
512K tokens | US$ 1,74 / US$ 0,20 em cache | US$ 3,48 |
| Cursor (relato de usuários no fórum) | 200K tokens | não divulgado nessa fonte | não divulgado nessa fonte |
Repara na diferença: a Together AI serve o mesmo modelo com janela de 512K tokens, metade do que a API oficial entrega
E tem usuários relatando no fórum do Cursor que, pelo Cursor, o contexto fica limitado a 200K tokens, mesmo a janela nativa sendo de 1M
Ou seja: aquele plano lindo de jogar o repositório inteiro numa chamada só pode simplesmente não existir na ferramenta que você usa
Checar a janela real do provedor é passo obrigatório, não detalhe
A dica da Together AI sobre o Think Max
A documentação da Together AI orienta configurar a janela em pelo menos 384K tokens pro modo Think Max e deixar o max_tokens generoso
O motivo é exatamente o que a gente discutiu na seção anterior: esse modo gera cadeias de raciocínio muito longas, e elas saem do mesmo orçamento
É a mesma regra vista de outro ângulo 🙂
Onde mais dá pra usar
O V4 Pro está disponível na interface web, no aplicativo móvel e na API da DeepSeek
A atualização de API do V4 Pro também passou a oferecer suporte nativo à Responses API da OpenAI, com integração com o Codex, e as rotas seguem compatíveis com OpenAI e com Anthropic
Na prática isso significa menos gambiarra de adaptador pra plugar o modelo em ferramenta que já fala esses protocolos
Vale usar a janela cheia de 1 milhão de tokens?
Agora o veredito honesto: só porque cabe, não quer dizer que compensa
A precisão de recuperação cai conforme o contexto cresce
No teste MRCR de 8 agulhas, o modelo fica acima de 0,82 até 256K tokens e cai para 0,59 em 1 milhão de tokens
Ou seja: encher a janela até a boca cobra em precisão, e cobra caro
Encontrar a informação certa no meio de 1 milhão de tokens é bem mais difícil do que encontrar no meio de 256K, mesmo com a janela suportando os dois
O lado bom da conta
A arquitetura ajuda bastante do lado do custo de rodar contexto longo
O V4 Pro é um Mixture-of-Experts com 1,6 trilhão de parâmetros totais e cerca de 49 bilhões ativos por token
Em contexto de 1 milhão de tokens, ele usa 27% dos FLOPs de inferência por token e 10% do KV cache em comparação com o DeepSeek-V3.2
Isso é MUITO significativo: contexto longo deixou de ser aquele luxo que derrete a máquina
E a velocidade?
A velocidade de saída medida do V4 Pro 0813 (max) é de 78 tokens por segundo
Parece confortável até você pedir uma resposta de dezenas de milhares de tokens
Aí a espera vira parte do projeto, e fatiar a geração deixa de ser boa prática e vira questão de sanidade
Minha régua
Use a janela cheia como reserva de emergência, não como configuração padrão
Se o material cabe em 256K, mande em 256K e colha a precisão melhor
Se você está escolhendo entre variantes pra cada tipo de tarefa, essa conversa de V4 Pro ou Flash resolve boa parte da dúvida antes de você se preocupar com janela
Conclusão
A regra de bolso que resolve quase toda a confusão com o DeepSeek V4 Pro 0813 é essa:
contexto é ESPAÇO, saída é ORÇAMENTO
Os 1.048.576 tokens dizem quanto material cabe na mesa
Os 384.000 tokens dizem quanto o modelo consegue escrever de uma vez, com o raciocínio comendo do mesmo prato
O próximo passo é bem prático: definir o max_tokens de forma consciente (com folga pro raciocínio), checar a janela real do provedor que você escolheu, e planejar resposta longa em partes desde o começo
Faz esses três e o "por que cortou?" some da sua vida 😀
Até o próximo post!
Perguntas frequentes
Quantos tokens o DeepSeek V4 Pro 0813 consegue gerar numa única resposta?
O teto de saída é 384.000 tokens, um limite separado da janela de contexto de 1.048.576 tokens. Na prática, a geração real é o menor valor entre o max_tokens pedido, esse teto de 384.000 e o espaço de contexto que sobrou depois do prompt.
O DeepSeek V4 Pro 0813 aceita imagem como entrada?
Não. O modelo é somente texto, sem suporte a entrada de imagem, então PDF escaneado, print de tela ou diagrama fotografado precisam de pré-processamento antes de entrar no prompt.
Por que o raciocínio do DeepSeek V4 Pro reduz o tamanho da resposta final?
Porque os tokens de raciocínio dividem o mesmo orçamento do max_tokens e do teto de 384.000 tokens de saída, sem cota separada de chain-of-thought. Como o thinking vem habilitado por padrão, quanto mais o modelo pensa antes de responder, menos espaço sobra para a resposta final.
Quanto custa usar o DeepSeek V4 Pro 0813 na API oficial?
A entrada custa US$ 0,435 por milhão de tokens em cache miss e US$ 0,003625 por milhão em cache hit, graças ao Advanced Context Caching documentado para o endpoint do V4 Pro. A saída custa US$ 0,87 por milhão de tokens.
A janela de contexto de 1 milhão de tokens é igual em qualquer ferramenta que usa o DeepSeek V4 Pro?
Não. A Together AI serve o modelo com janela de 512K tokens em FP4, e há relatos de usuários no fórum do Cursor apontando limite de 200K tokens de contexto por essa ferramenta, mesmo a janela nativa sendo de 1.048.576 tokens na API oficial.
Qual a diferença entre o preview e o build 0813 do DeepSeek V4 Pro?
O build 0813 é a versão de disponibilidade geral (GA) do DeepSeek V4 Pro, lançada em 12 de agosto de 2026 e encerrando o período de preview. Na API, o ID estável deepseek-v4-pro aponta hoje para essa versão DeepSeek-V4-Pro-0813.
Formações
Formação SAAS com IA
Tire usas ideias do papel criando softwares com IA, integre pagamentos e lance seu projeto!
- 291 aulas
- 18 projetos
- 24h 17min
Blog | Mais populares
As diferenças de var, let e const
Como fazer redirecionamento com PHP
Neste artigo você vai aprender a como fazer redirecionamento com PHP, utilizaremos abordagens fáceis de entender e de aplicar Fala programador(a), beleza? Bora aprender mais […]
Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação
Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação A popularidade da automação de processos com o n8n está em alta, principalmente […]
