O que é KV cache e como o chip Jalapeño da OpenAI reduz a movimentação de dados na inferência

O KV cache é o estado que o modelo guarda das chaves e valores já calculados dos tokens anteriores, pra não refazer a conta a cada token novo. Quanto mais longe esse estado fica de quem calcula, mais tempo se perde em transporte. O Jalapeño, primeiro chip de inferência da OpenAI co-desenvolvido com a Broadcom, ataca exatamente isso: a OpenAI descreve que o estado do modelo, incluindo o KV cache usado durante a geração da resposta, pode ser explicitamente posicionado e mantido local. Os primeiros benchmarks saíram em 25/08/2026, no Hot Chips 2026, ainda sem corroboração independente
O gargalo mais caro da inferência hoje não é a conta que o chip faz, é o caminho que o dado percorre até chegar nela
Fala aí, beleza? A OpenAI acabou de soltar os primeiros resultados do Jalapeño, o primeiro chip customizado de inferência dela, co-desenvolvido com a Broadcom, e o argumento central do projeto não é encher o slide de FLOP
O argumento é memória: manter o estado do modelo, incluindo o KV cache usado durante a geração da resposta, posicionado e mantido local
O chip foi anunciado publicamente em 24/06/2026 e os primeiros benchmarks vieram em 25/08/2026, no Hot Chips 2026
Antes de falar de silício, bora entender o conceito, porque ele explica uma coisa que tu sente todo dia na API e nem associa a hardware
E não, tu não precisa encostar em chip nenhum pra aproveitar esse post 🙂
Por que mover estado custa tempo: prefill, decode e inferência distribuída
Formação Claude Code
Domine Claude Code do absoluto zero até o avançado
- 116 aulas
- 4 projetos
- 9h 23min
Tem uma imagem que resolve isso na cabeça antes de qualquer número
Imagina uma obra em que o pedreiro é rapidíssimo, absurdo de rápido, só que o cimento está guardado do outro lado da cidade
O tempo da obra não é o tempo do trabalho, é o tempo do transporte
Inferência de LLM é exatamente isso, e ela ainda tem a mania de trocar de gargalo no meio do caminho
O que é KV cache, afinal?
Quando o modelo gera uma resposta, ele não recomeça do zero a cada token
Ele guarda as chaves e os valores (key e value) que já calculou dos tokens anteriores e reaproveita isso no token seguinte
Esse monte de estado guardado é o KV cache
É um clássico trade de memória por tempo: tu ocupa memória pra não refazer conta
Se você já mexeu com cache de qualquer coisa em aplicação web, a lógica é a mesma, só que o volume aqui é MUITO maior
Prefill é limitado por computação:
A primeira fase é o prefill, o processamento do prompt que tu mandou
Aqui o sistema está com trabalho matemático pesado na mão e o limite é computação
É a fase em que o chip realmente "pensa" no sentido bruto da palavra
Decode é limitado por largura de banda de memória:
Depois vem o decode, a geração token a token
E aqui o jogo vira: o limite passa a ser largura de banda de memória, não computação
Ou seja, o chip fica esperando dado chegar
É o pedreiro parado na calçada olhando o caminhão vir do outro lado da cidade
E a terceira dor: inferência distribuída
Quando o modelo não cabe (ou não convém) num pedaço só de hardware, a inferência vira distribuída
Aí a OpenAI aponta um gargalo adicional: o movimento do estado do modelo e dos dados intermediários entre os recursos de processamento
Se liga no que isso significa na prática
Você agora paga três contas: a computação do prefill, a banda de memória do decode e o transporte do estado entre as partes do sistema
A terceira é a mais chata porque ela não aparece em nenhum benchmark de FLOP
Como o Jalapeño mantém o KV cache local
A descrição da OpenAI sobre o Jalapeño ataca justamente essa terceira conta
O estado do modelo, incluindo o KV cache usado durante a geração da resposta, pode ser explicitamente posicionado e mantido local, enquanto o sistema ativa a combinação certa de computação, memória e rede para cada fase da inferência
Leia de novo a parte do "para cada fase", porque ela conversa direto com o prefill e o decode que a gente viu ali em cima
São fases com gargalos diferentes, então faz sentido o sistema mudar de postura no meio do caminho
Richard Ho, VP de hardware da OpenAI, disse em coletiva que o chip foi projetado para minimizar movimentação de dados e manter operações intermediárias e os KV caches no próprio chip
A arquitetura em slices:
O detalhe que sustenta a promessa é como o chip é fatiado
Os núcleos e a HBM do Jalapeño são divididos em slices
Cada slice de núcleo tem uma visão local, de baixa latência, sobre a sua própria fatia de HBM
E a sincronização entre os slices é feita por uma rede coletiva dedicada, de alta largura de banda
Traduzindo a analogia da obra: em vez de um depósito central longe de todo mundo, cada equipe tem o próprio estoque do lado, e existe uma via exclusiva pra quando as equipes precisam se falar
O co-design é o que faz a coisa fechar:
Aqui está o pulo do gato que eu acho mais interessante
A OpenAI não projetou só o acelerador
Ela projetou em conjunto o acelerador, o subsistema de memória, a rede, o software de serving e o sistema em escala de rack
De nada adianta o silício conseguir manter estado local se a camada que serve as requisições não souber tirar proveito disso
É tipo afinar motor, câmbio e pneu juntos em vez de comprar a peça mais cara de cada um e rezar
As especificações do Jalapeño
Bora aos números crus, todos divulgados pela própria empresa e pela cobertura do Hot Chips
| Item | Número |
|---|---|
| Processo de fabricação (1ª geração) | TSMC 3nm |
| Memória por pacote | 6 stacks de HBM4, 216 GiB a 15,4 TB/s |
| Computação por chip | 13,4 PFLOP/s em MXFP4 (matriz MXFP4 por MXFP4) |
| Potência do pacote | 700 W nominais, sustentado medido em 550 W ou menos nas cargas testadas |
| Rack | 128 aceleradores |
| Pod completo | 2.048 ASICs, 27 EFLOP/s e 432 TiB de memória |
Repara numa coisa: o número que mais importa pro argumento deste post não é o PFLOP
É o 216 GiB a 15,4 TB/s por pacote
Memória perto do núcleo é literalmente o espaço onde o estado pode ficar sem sair passeando
E os 432 TiB do pod são a versão em escala da mesma ideia: quanto mais estado cabe dentro do sistema, menos ele precisa ser empurrado pra fora dele
O 700 W nominal com sustentado medido em 550 W ou menos entra na conta porque eficiência, em datacenter, é o único jeito de escalar sem estourar a rede elétrica
Os primeiros benchmarks e a ressalva de quem operou o teste
Os resultados foram divulgados em 25/08/2026, no Hot Chips 2026
O benchmark usado foi o InferenceX, benchmark público operado pela SemiAnalysis, que avalia o processo ponta a ponta de atender requisições de inferência
Os modelos usados nos testes divulgados foram GPT-OSS 120B, DeepSeek R1 670B e Kimi K2.5 1T
Os números contra GB200 e GB300:
Contra os sistemas de rack GB200 e GB300 da Nvidia, a OpenAI divulgou:
- 1,5x a 1,9x mais trabalho de IA por watt no pico de throughput
- 1,7x a 3,6x menos latência ponta a ponta
- 2,1x a 4,1x de vantagem de desempenho em cargas altamente interativas
E o contraste de potência nominal ajuda a entender de onde sai a conta por watt:
| Sistema | Potência nominal |
|---|---|
| Jalapeño | 700 W |
| Nvidia GB200 | 1.200 W |
| Nvidia GB300 | 1.400 W |
Números insanos, né?
Mas segura a euforia, porque a parte mais honesta da história veio de quem opera o benchmark
A ressalva da SemiAnalysis:
A própria SemiAnalysis colocou o pé no freio
Ela considera o confronto com o Blackwell incompleto e injusto, porque o concorrente real do Jalapeño é o Rubin, que usa HBM4
Além disso, a peça não foi liberada para teste externo e não há corroboração independente dos resultados do Jalapeño
O baseline é reproduzível, os resultados do Jalapeño não são
Então o que a gente tem hoje é um número forte com uma etiqueta de "ainda não checado por terceiro" colada nele
E eu prefiro te contar isso do que vender hype 😀
O que isso muda para quem desenvolve com IA
Você que consome API e ferramenta de IA nunca vai ver um Jalapeño de perto
Mas duas coisas que tu sente todo dia nascem exatamente nessa camada: latência de resposta e custo por token
Quando o decode está preso em banda de memória, é a tua resposta que sai devagar
Quando o estado precisa viajar entre partes do sistema, é a conta de energia do provedor que sobe, e conta de energia vira preço em algum momento
Não segura a respiração pelo cronograma:
A implantação inicial está prevista para o fim de 2026, em volumes muito pequenos, basicamente protótipos
A escala relevante fica pra 2027
Isso se encaixa no acordo de outubro de 2025 entre OpenAI e Broadcom pra implantar 10 gigawatts de aceleradores projetados pela OpenAI até 2029
E tem um detalhe importante que muita gente confunde: os chips serão usados pela OpenAI para inferência, ou seja, pra servir os modelos dela em produtos como o ChatGPT
Não foi anunciado como produto de venda a terceiros
Ou seja, não é peça que tu vai comprar, é infraestrutura que tu vai consumir sem saber
Nove meses do design ao tape-out:
Greg Brockman, presidente da OpenAI, disse à CNBC que o chip foi projetado de ponta a ponta em nove meses, com ajuda dos próprios modelos da empresa
Pra quem tem alguma noção de ciclo de silício, isso é um prazo agressivo pra caramba
KV cache na prática: onde o conceito aparece no seu dia a dia
Agora esquece o chip por um minuto
O princípio "estado guardado perto de quem calcula" explica um monte de comportamento que tu já viu:
- Contexto longo fica mais lento: quanto mais tokens no histórico, maior o KV cache que precisa ser lido a cada token novo, e o decode já é limitado por banda de memória
- Conversa com muitas idas e voltas pesa: cada rodada empilha estado, e o custo de manter esse estado por perto cresce junto
- Agente que repete o mesmo prefixo de prompt: se o prefixo é sempre igual, reaproveitar o que já foi calculado dele evita refazer a mesma conta do zero toda vez
- Modelo rodando local na tua máquina: aqui o efeito fica escancarado, porque a memória é a tua e ela acaba
O caso 4 é o mais didático de todos, na minha opinião
Quando tu roda um modelo na própria máquina, a memória para de ser abstração e vira barra de progresso na cara
É o mesmo motivo pelo qual muita gente monta setup pra rodar LLM local por privacidade e descobre no caminho que contexto longo cobra pedágio em RAM
E cache, em qualquer camada, tem sempre o mesmo par de problemas: ocupa espaço e envelhece
Qualquer dev de front já sentiu a versão mansa disso na hora de limpar dados da localStorage porque o estado guardado ficou velho
Muda a escala, o dilema é o mesmo
Veja o conceito rodando local
Rodar modelo na própria máquina é o jeito mais rápido de enxergar o efeito da memória e do estado, porque tudo acontece no teu hardware
Pra começar do zero com inferência local, este vídeo do canal mostra como rodar o Codex 100% local com o Ollama, em um comando:
Conclusão
A leitura que fica é essa: a briga da inferência hoje é por movimentação de dados, não só por FLOP
O prefill quer computação, o decode quer banda de memória, e a inferência distribuída ainda cobra o pedágio de mover estado entre as partes do sistema
O Jalapeño é a aposta da OpenAI nessa tese, com KV cache explicitamente posicionado e mantido local, arquitetura em slices e co-design de ponta a ponta
Os números divulgados são fortes, mas seguem sem validação independente, e a própria SemiAnalysis já avisou que o adversário de verdade é o Rubin
Então o próximo capítulo é esse confronto, e vale acompanhar
Enquanto isso, tem uma tarefa bem mais barata que tu pode fazer hoje: reparar em como as tuas ferramentas se comportam conforme o contexto cresce
O gargalo do datacenter e a lentidão da tua janela de chat são o mesmo fenômeno, só que em escalas diferentes…
até o próximo post! =)
Perguntas frequentes
Quando o Jalapeño vai começar a rodar de verdade nos produtos da OpenAI?
A implantação inicial acontece no fim de 2026, ainda em volumes muito pequenos, tratados como protótipos. A escala relevante só chega em 2027.
A OpenAI vai vender o Jalapeño para outras empresas?
Não. Os chips serão usados internamente pela OpenAI para inferência, ou seja, para servir os próprios modelos em produtos como o ChatGPT. Não há anúncio de venda do Jalapeño como produto para terceiros.
Os benchmarks do Jalapeño contra a Nvidia já foram confirmados por alguém de fora da OpenAI?
Ainda não. A própria SemiAnalysis, que opera o InferenceX usado no teste, chamou a comparação de incompleta e injusta, porque o rival direto do Jalapeño seria o Rubin (que usa HBM4), não o Blackwell. Além disso, o chip não foi liberado para teste externo, então o baseline da Nvidia é reproduzível e os resultados do Jalapeño não.
O que é KV cache e por que ele importa tanto no Jalapeño?
O KV cache é o estado que o modelo guarda das chaves e valores já calculados dos tokens anteriores, pra não refazer a conta a cada token novo. No Jalapeño, a OpenAI descreve que esse estado pode ser explicitamente posicionado e mantido local, e Richard Ho, VP de hardware da empresa, afirmou que o chip foi projetado para minimizar movimentação de dados e manter operações intermediárias e os KV caches no próprio chip.
Qual é o acordo entre OpenAI e Broadcom que envolve o Jalapeño?
O Jalapeño se encaixa no acordo fechado em outubro de 2025 entre as duas empresas, que prevê implantar 10 gigawatts de aceleradores projetados pela OpenAI. Esses aceleradores são infraestrutura da própria OpenAI para inferência, não produto de venda a terceiros.
O Jalapeño consome mais ou menos energia que os racks GB200 e GB300 da Nvidia?
Menos, pelo menos no papel: o pacote Jalapeño é nominal de 700 W, contra 1.200 W do GB200 e 1.400 W do GB300. É essa diferença de potência que sustenta o número de 1,5x a 1,9x mais trabalho de IA por watt divulgado no benchmark.
Formações
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Blog | Mais populares

Como Recuperar Conversas Apagadas no ChatGPT: É Possível?
Descubra neste artigo tudo o que você precisa saber sobre como recuperar conversas apagadas no ChatGPT, se isso é possível, quais alternativas existem para proteger […]
ChatGPT não funciona: saiba como corrigir erros
ChatGPT não funciona? O ChatGPT pode deixar de funcionar por diversos motivos, e a maioria deles está relacionada a problemas de conexão, cache ou instabilidade […]

Como limpar histórico do ChatGPT e proteger sua privacidade
Veja como limpar o histórico do ChatGPT e proteger sua privacidade de forma simples e eficaz, mantendo seus dados seguros online. Para apagar uma conversa […]
