DeepSeek V4 Pro 0813: o que cabe na janela de 1 milhão de tokens (e por que a saída para em 384 mil)?

janela de contexto e limite de saída do DeepSeek V4 Pro 0813
Resposta rápida

O DeepSeek V4 Pro 0813 tem dois tetos diferentes e quase todo mundo confunde os dois: a janela de contexto é de 1.048.576 tokens e a saída máxima é de 384.000 tokens. Um é o espaço pra colocar material dentro do prompt, o outro é o orçamento pra gerar a resposta. Se o texto volta cortado com contexto sobrando, o limite que estourou foi o de saída, ainda mais porque os tokens de raciocínio dividem esse mesmo orçamento. E a janela real muda conforme o provedor que você usa pra chamar o modelo

1.048.576 tokens de contexto não são 1.048.576 tokens de resposta

Fala aí, beleza? Esses dois números vivem colados no mesmo card de especificação, e é exatamente aí que a confusão nasce

O DeepSeek V4 Pro 0813 apareceu em 12 de agosto de 2026 como release de disponibilidade geral, encerrando o período de preview do V4 Pro

Ele tem janela de contexto de 1.048.576 tokens e saída máxima de 384.000 tokens

São limites SEPARADOS, com funções diferentes: um diz quanto material cabe na conversa, o outro diz quanto texto o modelo consegue produzir numa única resposta

Na API oficial, o ID estável do modelo é deepseek-v4-pro, e hoje ele serve a versão DeepSeek-V4-Pro-0813

Bora destrinchar os dois?

O que cabe na janela de 1 milhão de tokens na prática

Formação Vibe Coding
Formação Recomendada

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Janela de contexto é espaço de mesa: tudo que você joga pra dentro da chamada (instruções, arquivos, histórico da conversa e a própria resposta em construção) ocupa lugar ali

Com 1.048.576 tokens de espaço, o tipo de trabalho que muda de figura é este:

  • base de código inteira numa chamada só, em vez de recortar 3 arquivos e torcer pro modelo adivinhar o resto
  • documentação longa lida de ponta a ponta, tipo especificação técnica, RFC ou manual completo
  • transcrições acumuladas, várias reuniões ou vídeos empilhados no mesmo prompt
  • histórico de conversa que não precisa ser resumido a cada 20 mensagens

Quantos tokens vale uma linha de código? Isso varia demais com a linguagem e com o arquivo, então não vou cravar aqui um "X mil linhas cabem em 1M" só pra soar preciso

O ponto que interessa é a ordem de grandeza: você deixa de fazer curadoria manual de contexto e passa a mandar o material inteiro

Cuidado: o V4 Pro 0813 é somente texto

Ele não aceita entrada de imagem

Ou seja: PDF escaneado, print de tela e diagrama fotografado ficam de fora dessa festa

Se o seu material vive em imagem, o pré-processamento é problema seu antes da chamada, não do modelo

E o custo de mandar tanta coisa?

É aqui que o cache de contexto muda a conta

A API da DeepSeek documenta o Advanced Context Caching pro endpoint do V4 Pro, com preço distinto de cache hit e de cache miss

Na API oficial, a entrada custa US$ 0,435 por milhão de tokens em cache miss e US$ 0,003625 por milhão em cache hit

A diferença entre repetir o mesmo prompt gigante toda hora e aproveitar o cache é enorme, então prompt estável na frente e parte variável no fim deixou de ser firula

Se a sua dúvida é mais básica, do tipo em que tarefa de código ele realmente entrega, eu já falei sobre usar o V4 pra programar por aqui

Por que a resposta para em 384 mil tokens (e como evitar o corte)

O sintoma é sempre o mesmo: você pede um documento gigante, o modelo escreve, escreve, e a resposta simplesmente para no meio

Aí você olha o contexto e tem espaço sobrando, o que só aumenta a confusão

A causa é que o limite que estourou não é o de contexto, é o de saída

O teto real de geração é o MENOR valor entre três coisas:

geração real = min(max_tokens pedido, 384.000, contexto restante após o prompt)

Então dá pra estourar de três jeitos diferentes: pedindo max_tokens baixo demais, batendo no teto de 384.000 tokens do modelo, ou enchendo tanto o prompt que sobra pouco espaço pra resposta

O detalhe que pega quase todo mundo: o raciocínio come do mesmo prato

O V4 Pro opera em modo com e sem raciocínio, e o raciocínio vem ligado por padrão

E os tokens de raciocínio dividem o mesmo orçamento do max_tokens e do teto de 384.000 tokens de saída

Não existe cota separada de cadeia de pensamento aqui

Traduzindo: se o modelo pensou muito antes de responder, ele gastou parte do seu orçamento de resposta pensando

A resposta final chega mais curta e você fica achando que o modelo "não quis" escrever tudo

Como evitar o corte:

  1. Dimensione o max_tokens com folga, não no talo do que você espera de resposta

Se você quer 20 mil tokens de texto e pede exatamente 20 mil, o raciocínio consome uma parte e a resposta trunca

O erro comum deste passo: tratar max_tokens como "tamanho da resposta" quando ele é "tamanho de tudo que sai do modelo"

{
  "model": "deepseek-v4-pro",
  "max_tokens": 64000
}
  1. Fatie a geração longa em várias chamadas

Em vez de "escreva o livro inteiro", peça capítulo por capítulo, ou módulo por módulo, mantendo o contexto grande na entrada

A janela de 1 milhão de tokens trabalha justamente a seu favor aqui: o material de referência continua todo lá em cada chamada, só a saída é que vira pedaço

O erro comum deste passo: fatiar a ENTRADA junto com a saída, e o modelo perder a referência do que já escreveu

  1. Considere o modo sem raciocínio quando o que importa é volume de resposta

Se a tarefa é mais mecânica (transcrever, reformatar, gerar boilerplate) e menos deliberativa, o raciocínio ligado só está comendo orçamento de saída

O erro comum deste passo: desligar o raciocínio em tarefa que exige análise, e trocar resposta longa por resposta longa e errada, o que não é lá um bom negócio 😅

A janela que você recebe depende de onde você chama o modelo

Essa é a parte que ninguém avisa: o card de especificação diz 1.048.576 tokens, mas o número que CHEGA até você depende do caminho de acesso

Caminho de acesso Janela efetiva Entrada (por milhão) Saída (por milhão)
API oficial da DeepSeek 1.048.576 tokens US$ 0,435 em cache miss / US$ 0,003625 em cache hit US$ 0,87
Together AI (deepseek-ai/DeepSeek-V4-Pro, FP4) 512K tokens US$ 1,74 / US$ 0,20 em cache US$ 3,48
Cursor (relato de usuários no fórum) 200K tokens não divulgado nessa fonte não divulgado nessa fonte

Repara na diferença: a Together AI serve o mesmo modelo com janela de 512K tokens, metade do que a API oficial entrega

E tem usuários relatando no fórum do Cursor que, pelo Cursor, o contexto fica limitado a 200K tokens, mesmo a janela nativa sendo de 1M

Ou seja: aquele plano lindo de jogar o repositório inteiro numa chamada só pode simplesmente não existir na ferramenta que você usa

Checar a janela real do provedor é passo obrigatório, não detalhe

A dica da Together AI sobre o Think Max

A documentação da Together AI orienta configurar a janela em pelo menos 384K tokens pro modo Think Max e deixar o max_tokens generoso

O motivo é exatamente o que a gente discutiu na seção anterior: esse modo gera cadeias de raciocínio muito longas, e elas saem do mesmo orçamento

É a mesma regra vista de outro ângulo 🙂

Onde mais dá pra usar

O V4 Pro está disponível na interface web, no aplicativo móvel e na API da DeepSeek

A atualização de API do V4 Pro também passou a oferecer suporte nativo à Responses API da OpenAI, com integração com o Codex, e as rotas seguem compatíveis com OpenAI e com Anthropic

Na prática isso significa menos gambiarra de adaptador pra plugar o modelo em ferramenta que já fala esses protocolos

Vale usar a janela cheia de 1 milhão de tokens?

Agora o veredito honesto: só porque cabe, não quer dizer que compensa

A precisão de recuperação cai conforme o contexto cresce

No teste MRCR de 8 agulhas, o modelo fica acima de 0,82 até 256K tokens e cai para 0,59 em 1 milhão de tokens

Ou seja: encher a janela até a boca cobra em precisão, e cobra caro

Encontrar a informação certa no meio de 1 milhão de tokens é bem mais difícil do que encontrar no meio de 256K, mesmo com a janela suportando os dois

O lado bom da conta

A arquitetura ajuda bastante do lado do custo de rodar contexto longo

O V4 Pro é um Mixture-of-Experts com 1,6 trilhão de parâmetros totais e cerca de 49 bilhões ativos por token

Em contexto de 1 milhão de tokens, ele usa 27% dos FLOPs de inferência por token e 10% do KV cache em comparação com o DeepSeek-V3.2

Isso é MUITO significativo: contexto longo deixou de ser aquele luxo que derrete a máquina

E a velocidade?

A velocidade de saída medida do V4 Pro 0813 (max) é de 78 tokens por segundo

Parece confortável até você pedir uma resposta de dezenas de milhares de tokens

Aí a espera vira parte do projeto, e fatiar a geração deixa de ser boa prática e vira questão de sanidade

Minha régua

Use a janela cheia como reserva de emergência, não como configuração padrão

Se o material cabe em 256K, mande em 256K e colha a precisão melhor

Se você está escolhendo entre variantes pra cada tipo de tarefa, essa conversa de V4 Pro ou Flash resolve boa parte da dúvida antes de você se preocupar com janela

Conclusão

A regra de bolso que resolve quase toda a confusão com o DeepSeek V4 Pro 0813 é essa:

contexto é ESPAÇO, saída é ORÇAMENTO

Os 1.048.576 tokens dizem quanto material cabe na mesa

Os 384.000 tokens dizem quanto o modelo consegue escrever de uma vez, com o raciocínio comendo do mesmo prato

O próximo passo é bem prático: definir o max_tokens de forma consciente (com folga pro raciocínio), checar a janela real do provedor que você escolheu, e planejar resposta longa em partes desde o começo

Faz esses três e o "por que cortou?" some da sua vida 😀

Até o próximo post!

Perguntas frequentes

Quantos tokens o DeepSeek V4 Pro 0813 consegue gerar numa única resposta?

O teto de saída é 384.000 tokens, um limite separado da janela de contexto de 1.048.576 tokens. Na prática, a geração real é o menor valor entre o max_tokens pedido, esse teto de 384.000 e o espaço de contexto que sobrou depois do prompt.

O DeepSeek V4 Pro 0813 aceita imagem como entrada?

Não. O modelo é somente texto, sem suporte a entrada de imagem, então PDF escaneado, print de tela ou diagrama fotografado precisam de pré-processamento antes de entrar no prompt.

Por que o raciocínio do DeepSeek V4 Pro reduz o tamanho da resposta final?

Porque os tokens de raciocínio dividem o mesmo orçamento do max_tokens e do teto de 384.000 tokens de saída, sem cota separada de chain-of-thought. Como o thinking vem habilitado por padrão, quanto mais o modelo pensa antes de responder, menos espaço sobra para a resposta final.

Quanto custa usar o DeepSeek V4 Pro 0813 na API oficial?

A entrada custa US$ 0,435 por milhão de tokens em cache miss e US$ 0,003625 por milhão em cache hit, graças ao Advanced Context Caching documentado para o endpoint do V4 Pro. A saída custa US$ 0,87 por milhão de tokens.

A janela de contexto de 1 milhão de tokens é igual em qualquer ferramenta que usa o DeepSeek V4 Pro?

Não. A Together AI serve o modelo com janela de 512K tokens em FP4, e há relatos de usuários no fórum do Cursor apontando limite de 200K tokens de contexto por essa ferramenta, mesmo a janela nativa sendo de 1.048.576 tokens na API oficial.

Qual a diferença entre o preview e o build 0813 do DeepSeek V4 Pro?

O build 0813 é a versão de disponibilidade geral (GA) do DeepSeek V4 Pro, lançada em 12 de agosto de 2026 e encerrando o período de preview. Na API, o ID estável deepseek-v4-pro aponta hoje para essa versão DeepSeek-V4-Pro-0813.



Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação SAAS com IA

Formação SAAS com IA

Tire usas ideias do papel criando softwares com IA, integre pagamentos e lance seu projeto!

  • 291 aulas
  • 18 projetos
  • 24h 17min

Blog | Mais populares