Claude Fable 5: quanto ele consegue escrever em uma resposta só (o limite de 128 mil tokens de saída)

O limite de saída do Claude Fable 5 é de 128 mil tokens por requisição, e isso não tem nada a ver com a janela de contexto de 1 milhão de tokens. O milhão é o que ele LÊ (entrada, saída e raciocínio somados na mesma janela), os 128 mil são o que ele ESCREVE de uma vez só. E tem um detalhe que pega muita gente: os tokens de thinking saem de dentro do max_tokens e são cobrados como saída, então o teto não é todo do texto final. Bateu no teto? O stop_reason vem como max_tokens e a resposta foi cortada
1 milhão de tokens de contexto e 128 mil de saída: os dois números do Claude Fable 5 que todo mundo confunde
Essa confusão é a mãe de quase todo "a resposta parou no meio do nada" que aparece por aí
São dois números diferentes: a janela de contexto (1 milhão de tokens, tudo que cabe na conversa, incluindo o que o próprio modelo escreve) e o teto de saída por requisição (128 mil tokens, o quanto ele consegue escrever numa tacada só)
O primeiro número é o que todo mundo comemora no anúncio
O segundo é o que corta seu texto no meio da frase 😅
Bora separar os dois de vez?
Janela de contexto x limite de saída: a diferença que confunde todo mundo
A analogia mais direta que eu consigo: a janela de contexto é a mesa de trabalho, e tudo vai ocupando espaço nela (o que entra E o que o modelo escreve), enquanto o limite de saída é o quanto ele consegue redigir antes de ter que levantar da cadeira
Domine o Claude Code do básico ao avançado
Você vai aprender a criar sistemas completos com Claude Code, sem precisar ser programador. Inscreva-se para ter acesso a um desconto de lançamento e bônus especiais!
Cabe MUITA coisa na mesa
Mas a redação de uma vez só tem teto
| Janela de contexto | Limite de saída | |
|---|---|---|
| Quanto é no Fable 5 | 1.000.000 de tokens | 128.000 tokens por requisição |
| O que ocupa | tudo que entra e sai: input, output e os tokens de raciocínio (thinking) | o que o modelo gera naquela requisição, thinking incluso |
| Quando estoura | a geração para com stop_reason: model_context_window_exceeded | a geração para com stop_reason: max_tokens |
| Preço na API | US$ 10 por milhão de tokens de entrada | US$ 50 por milhão de tokens de saída |
Repara no preço: saída custa cinco vezes a entrada
Então pedir uma resposta gigante "só pra ver no que dá" é diferente de jogar um monte de arquivo no contexto
E tem uma boa notícia no meio disso: nos modelos com janela de 1 milhão, 1M é o PADRÃO
Não precisa de beta header, não tem sobretaxa de contexto longo, as requisições longas são cobradas pelo preço padrão
Comparando as janelas por modelo:
| Modelo | Janela de contexto |
|---|---|
| Claude Opus 4.8 | 1 milhão de tokens |
| Claude Sonnet 5 | 1 milhão de tokens |
| Claude Fable 5 | 1 milhão de tokens |
| Claude Haiku 4.5 | 200 mil tokens |
Se você acompanhou a janela de 1 milhão de tokens na API quando isso ainda era novidade e exigia cerimônia, agora virou o comportamento normal da linha
O identificador na API, pra registrar: claude-fable-5
O que cabe (e o que não cabe) em 128 mil tokens de saída
Aqui vem a pergunta óbvia: 128 mil tokens dá quantas páginas?
E aqui vem a resposta honesta: depende, e a documentação não te dá essa conversão pronta
O que a documentação da Anthropic dá é uma razão de referência: um token corresponde a aproximadamente 3,5 caracteres em inglês, variando conforme o idioma
Ou seja: em português a conta MUDA
Acentuação, palavras mais longas, estrutura diferente, tudo isso mexe na tokenização
Por isso eu não vou te vender "cabem X páginas", porque seria chute e chute nesse assunto é o que faz gente calibrar o max_tokens errado
O teto não é todo do texto final
Esse é o ponto que quase ninguém considera na hora de fazer a conta
Os tokens de thinking são um subconjunto do parâmetro max_tokens
Eles saem de dentro do mesmo orçamento, são cobrados como tokens de saída e contam para os limites de uso
Então quando você define um max_tokens de 128 mil, você não reservou 128 mil tokens de resposta
Você reservou 128 mil tokens de raciocínio + resposta
E no Fable 5 tem um agravante: ele sempre opera com thinking habilitado
Passar thinking: {"type": "disabled"} não é suportado
Não tem como desligar pra "sobrar mais espaço pro texto", esse orçamento vai ser dividido, ponto
E existe um outro nome que aparece nessa conversa: o effort
Ele é o nível de esforço de raciocínio, ou seja, o quanto o modelo se estende pensando antes de escrever
Guarda esse termo, porque ele volta já já quando o pensamento come o orçamento inteiro
Sua resposta foi cortada no meio: como identificar o motivo
Antes de xingar o modelo, olha o stop_reason da resposta
Ele te diz exatamente o que aconteceu, e são três cenários bem diferentes com sintomas parecidos
Caso 1: stop_reason "max_tokens"
Sinal: a resposta chega truncada, cortada no meio, e o stop_reason devolvido é max_tokens
Causa: o modelo bateu no teto daquela requisição
Tem uma variação mais cruel desse caso: um raciocínio longo pode consumir o orçamento ANTES de o texto terminar
Aí você recebe stop_reason: max_tokens com o texto truncado ou até ausente
Você pagou pelo pensamento e não levou a resposta 😬
Solução: continuar em nova requisição, e quando o problema foi o raciocínio comendo o orçamento, a orientação é aumentar o max_tokens ou reduzir o effort (aquele nível de esforço de raciocínio que a gente viu ali em cima)
Caso 2: stop_reason "model_context_window_exceeded"
Sinal: a geração para e o motivo é model_context_window_exceeded
Causa: os tokens de entrada somados ao max_tokens ultrapassam a janela
E olha o detalhe traiçoeiro: a API aceita a requisição nesse caso
Ela não te barra na porta
Se a geração bater no limite da janela durante a escrita, ela para ali
Solução: enxugar a entrada ou baixar o max_tokens pra soma caber na janela
Lembra que input, output e thinking ocupam a MESMA janela de contexto
Caso 3: a requisição nem chega a terminar
Sinal: você pede uma saída grande e a coisa morre por queda de conexão ociosa
Causa: definir um max_tokens grande sem usar a Messages API em streaming ou a Message Batches API
Os SDKs inclusive validam isso: requisições não-streaming não devem exceder o timeout de 10 minutos
Solução (e prevenção): saída longa pede streaming
<pre><code>{ "model": "claude-fable-5", "max_tokens": 64000, "stream": true, "messages": [ { "role": "user", "content": "…" } ] }</code></pre>
Se o trabalho não é interativo, a Message Batches API também é caminho
O erro comum aqui é tratar "conexão caiu" como instabilidade do provedor
Na maioria das vezes é só uma requisição não-streaming pedindo mais texto do que dá pra entregar dentro do timeout
Quando quebrar o trabalho em partes em vez de pedir tudo de uma vez
Agora a parte prática, que é onde essa régua vira decisão
Pede em uma resposta só quando:
- o entregável é UM artefato contínuo que perde sentido fatiado
- você consegue estimar que o texto final fica confortavelmente abaixo do orçamento, lembrando que o thinking também come dali
- você ligou streaming
Quebra em requisições encadeadas quando:
- você está mirando perto do teto de 128 mil, porque "perto do teto" com thinking ligado é basicamente "no teto"
- o trabalho tem partes independentes (módulos, capítulos, arquivos), que é justamente o caso onde continuar de onde parou é barato
- a primeira tentativa já voltou com stop_reason: max_tokens
- o custo importa: a US$ 50 por milhão de tokens de saída, gerar duas vezes o mesmo bloco porque a primeira truncou é dinheiro jogado fora
Conversa longa come janela a cada turno
Esse aqui é sutil e merece atenção
O Claude Fable 5 mantém os blocos de thinking anteriores por padrão
E eles contam na janela de contexto como qualquer token de entrada
Traduzindo: cada turno de uma conversa longa carrega junto o raciocínio dos turnos passados
A janela é enorme, mas ela não é infinita, e quem trabalha em sessões longas sente isso
É o mesmo raciocínio de quando você precisa gerenciar contexto no Claude Code: não é sobre ter espaço, é sobre não deixar o espaço se encher de coisa que já cumpriu o papel
E se você não controla o max_tokens?
Detalhe importante: nem todo ambiente te dá esse botão
O Fable 5 está disponível na Claude API, no Claude Code, no Amazon Bedrock, no GitHub Copilot, no Google Cloud e no Microsoft Foundry, e para usuários Pro, Max, Team e Enterprise
Ele ficou disponível de forma geral em 9 de junho de 2026
Onde você mexe na requisição direto, a régua deste post é literal
Onde a plataforma monta a chamada por você, o que sobra é o comportamento: quebrar o pedido em partes menores continua sendo a jogada quando o entregável é grande
Ah, e vale saber: o Fable 5 e o Claude Mythos 5 compartilham as mesmas especificações e o mesmo preço
A diferença é que o Fable 5 roda com classificadores de segurança que redirecionam pedidos de alto risco (cibersegurança, biologia, química e saúde) para resposta do Claude Opus 4.8
Conclusão
A régua, resumida pra você não esquecer nunca mais:
1 milhão de tokens é a mesa inteira, e tudo ocupa ela: entrada, saída e thinking. 128 mil tokens é o máximo que ele escreve numa única requisição. E o thinking sai de dentro desse orçamento de escrita
São três frases que resolvem a maior parte da frustração com resposta cortada
O próximo passo é bem concreto:
- Defina o max_tokens DE PROPÓSITO, sabendo que o raciocínio divide esse espaço com o texto final
- Ligue streaming (ou vá de Message Batches API) sempre que a saída for longa, senão você arrisca perder a requisição por conexão ociosa
- Confira o stop_reason ANTES de culpar o modelo: max_tokens e model_context_window_exceeded são problemas diferentes, com soluções diferentes
O modelo raramente "esqueceu" o que você pediu
Na maioria das vezes ele só bateu num teto que ninguém tinha configurado direito 🙂
até o próximo post!
Perguntas frequentes
128 mil tokens de saída dão quantas palavras no Claude Fable 5?
Não tem conversão fixa: a própria documentação usa como referência 1 token ≈ 3,5 caracteres em inglês, e isso varia por idioma. Em português a conta muda por causa de acentuação e palavras mais longas, então qualquer número de páginas que alguém te der é chute.
Dá pra desligar o thinking do Claude Fable 5 pra sobrar mais espaço pra resposta?
Não. O Claude Fable 5 sempre opera com thinking habilitado, e passar thinking: {"type": "disabled"} não é suportado. Como o thinking é subconjunto do max_tokens, ele sempre vai dividir espaço com o texto final, sem exceção.
Dá pra aumentar o limite de saída do Claude Fable 5 além de 128 mil tokens numa requisição?
Não, esse é o teto por requisição do Claude Fable 5. Pra textos maiores, o caminho é quebrar o trabalho em partes e continuar em requisições novas, e não tentar forçar um max_tokens maior que o limite.
Por que a requisição do Claude Fable 5 cai antes de terminar uma resposta longa?
Geralmente é queda de conexão ociosa: definir um max_tokens grande sem streaming pode estourar o timeout, já que requisições não-streaming não devem passar de 10 minutos. A solução é usar a Messages API em streaming ou, pra trabalho não interativo, a Message Batches API.
Gerar uma resposta longa no Claude Fable 5 sai mais caro que ler um contexto grande?
Sim, e bem mais: a saída custa US$ 50 por milhão de tokens contra US$ 10 por milhão de tokens de entrada, cinco vezes mais caro. Como o thinking também é cobrado como saída, uma resposta com raciocínio longo pesa dobrado na conta.
Formações
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Blog | Mais populares
As diferenças de var, let e const
Como fazer redirecionamento com PHP
Neste artigo você vai aprender a como fazer redirecionamento com PHP, utilizaremos abordagens fáceis de entender e de aplicar Fala programador(a), beleza? Bora aprender mais […]
Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação
Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação A popularidade da automação de processos com o n8n está em alta, principalmente […]
