O que é KV cache e como o chip Jalapeño da OpenAI reduz a movimentação de dados na inferência

chip Jalapeño da OpenAI mantendo o KV cache local durante a inferência
Resposta rápida

O KV cache é o estado que o modelo guarda das chaves e valores já calculados dos tokens anteriores, pra não refazer a conta a cada token novo. Quanto mais longe esse estado fica de quem calcula, mais tempo se perde em transporte. O Jalapeño, primeiro chip de inferência da OpenAI co-desenvolvido com a Broadcom, ataca exatamente isso: a OpenAI descreve que o estado do modelo, incluindo o KV cache usado durante a geração da resposta, pode ser explicitamente posicionado e mantido local. Os primeiros benchmarks saíram em 25/08/2026, no Hot Chips 2026, ainda sem corroboração independente

O gargalo mais caro da inferência hoje não é a conta que o chip faz, é o caminho que o dado percorre até chegar nela

Fala aí, beleza? A OpenAI acabou de soltar os primeiros resultados do Jalapeño, o primeiro chip customizado de inferência dela, co-desenvolvido com a Broadcom, e o argumento central do projeto não é encher o slide de FLOP

O argumento é memória: manter o estado do modelo, incluindo o KV cache usado durante a geração da resposta, posicionado e mantido local

O chip foi anunciado publicamente em 24/06/2026 e os primeiros benchmarks vieram em 25/08/2026, no Hot Chips 2026

Antes de falar de silício, bora entender o conceito, porque ele explica uma coisa que tu sente todo dia na API e nem associa a hardware

E não, tu não precisa encostar em chip nenhum pra aproveitar esse post 🙂

Por que mover estado custa tempo: prefill, decode e inferência distribuída

Formação Claude Code
Formação Recomendada

Formação Claude Code

Domine Claude Code do absoluto zero até o avançado

  • 120 aulas
  • 4 projetos
  • 9h 45min

Tem uma imagem que resolve isso na cabeça antes de qualquer número

Imagina uma obra em que o pedreiro é rapidíssimo, absurdo de rápido, só que o cimento está guardado do outro lado da cidade

O tempo da obra não é o tempo do trabalho, é o tempo do transporte

Inferência de LLM é exatamente isso, e ela ainda tem a mania de trocar de gargalo no meio do caminho

O que é KV cache, afinal?

Quando o modelo gera uma resposta, ele não recomeça do zero a cada token

Ele guarda as chaves e os valores (key e value) que já calculou dos tokens anteriores e reaproveita isso no token seguinte

Esse monte de estado guardado é o KV cache

É um clássico trade de memória por tempo: tu ocupa memória pra não refazer conta

Se você já mexeu com cache de qualquer coisa em aplicação web, a lógica é a mesma, só que o volume aqui é MUITO maior

Prefill é limitado por computação:

A primeira fase é o prefill, o processamento do prompt que tu mandou

Aqui o sistema está com trabalho matemático pesado na mão e o limite é computação

É a fase em que o chip realmente "pensa" no sentido bruto da palavra

Decode é limitado por largura de banda de memória:

Depois vem o decode, a geração token a token

E aqui o jogo vira: o limite passa a ser largura de banda de memória, não computação

Ou seja, o chip fica esperando dado chegar

É o pedreiro parado na calçada olhando o caminhão vir do outro lado da cidade

E a terceira dor: inferência distribuída

Quando o modelo não cabe (ou não convém) num pedaço só de hardware, a inferência vira distribuída

Aí a OpenAI aponta um gargalo adicional: o movimento do estado do modelo e dos dados intermediários entre os recursos de processamento

Se liga no que isso significa na prática

Você agora paga três contas: a computação do prefill, a banda de memória do decode e o transporte do estado entre as partes do sistema

A terceira é a mais chata porque ela não aparece em nenhum benchmark de FLOP

Como o Jalapeño mantém o KV cache local

A descrição da OpenAI sobre o Jalapeño ataca justamente essa terceira conta

O estado do modelo, incluindo o KV cache usado durante a geração da resposta, pode ser explicitamente posicionado e mantido local, enquanto o sistema ativa a combinação certa de computação, memória e rede para cada fase da inferência

Leia de novo a parte do "para cada fase", porque ela conversa direto com o prefill e o decode que a gente viu ali em cima

São fases com gargalos diferentes, então faz sentido o sistema mudar de postura no meio do caminho

Richard Ho, VP de hardware da OpenAI, disse em coletiva que o chip foi projetado para minimizar movimentação de dados e manter operações intermediárias e os KV caches no próprio chip

A arquitetura em slices:

O detalhe que sustenta a promessa é como o chip é fatiado

Os núcleos e a HBM do Jalapeño são divididos em slices

Cada slice de núcleo tem uma visão local, de baixa latência, sobre a sua própria fatia de HBM

E a sincronização entre os slices é feita por uma rede coletiva dedicada, de alta largura de banda

Traduzindo a analogia da obra: em vez de um depósito central longe de todo mundo, cada equipe tem o próprio estoque do lado, e existe uma via exclusiva pra quando as equipes precisam se falar

O co-design é o que faz a coisa fechar:

Aqui está o pulo do gato que eu acho mais interessante

A OpenAI não projetou só o acelerador

Ela projetou em conjunto o acelerador, o subsistema de memória, a rede, o software de serving e o sistema em escala de rack

De nada adianta o silício conseguir manter estado local se a camada que serve as requisições não souber tirar proveito disso

É tipo afinar motor, câmbio e pneu juntos em vez de comprar a peça mais cara de cada um e rezar

As especificações do Jalapeño

Bora aos números crus, todos divulgados pela própria empresa e pela cobertura do Hot Chips

Item Número
Processo de fabricação (1ª geração) TSMC 3nm
Memória por pacote 6 stacks de HBM4, 216 GiB a 15,4 TB/s
Computação por chip 13,4 PFLOP/s em MXFP4 (matriz MXFP4 por MXFP4)
Potência do pacote 700 W nominais, sustentado medido em 550 W ou menos nas cargas testadas
Rack 128 aceleradores
Pod completo 2.048 ASICs, 27 EFLOP/s e 432 TiB de memória

Repara numa coisa: o número que mais importa pro argumento deste post não é o PFLOP

É o 216 GiB a 15,4 TB/s por pacote

Memória perto do núcleo é literalmente o espaço onde o estado pode ficar sem sair passeando

E os 432 TiB do pod são a versão em escala da mesma ideia: quanto mais estado cabe dentro do sistema, menos ele precisa ser empurrado pra fora dele

O 700 W nominal com sustentado medido em 550 W ou menos entra na conta porque eficiência, em datacenter, é o único jeito de escalar sem estourar a rede elétrica

Os primeiros benchmarks e a ressalva de quem operou o teste

Os resultados foram divulgados em 25/08/2026, no Hot Chips 2026

O benchmark usado foi o InferenceX, benchmark público operado pela SemiAnalysis, que avalia o processo ponta a ponta de atender requisições de inferência

Os modelos usados nos testes divulgados foram GPT-OSS 120B, DeepSeek R1 670B e Kimi K2.5 1T

Os números contra GB200 e GB300:

Contra os sistemas de rack GB200 e GB300 da Nvidia, a OpenAI divulgou:

  • 1,5x a 1,9x mais trabalho de IA por watt no pico de throughput
  • 1,7x a 3,6x menos latência ponta a ponta
  • 2,1x a 4,1x de vantagem de desempenho em cargas altamente interativas

E o contraste de potência nominal ajuda a entender de onde sai a conta por watt:

Sistema Potência nominal
Jalapeño 700 W
Nvidia GB200 1.200 W
Nvidia GB300 1.400 W

Números insanos, né?

Mas segura a euforia, porque a parte mais honesta da história veio de quem opera o benchmark

A ressalva da SemiAnalysis:

A própria SemiAnalysis colocou o pé no freio

Ela considera o confronto com o Blackwell incompleto e injusto, porque o concorrente real do Jalapeño é o Rubin, que usa HBM4

Além disso, a peça não foi liberada para teste externo e não há corroboração independente dos resultados do Jalapeño

O baseline é reproduzível, os resultados do Jalapeño não são

Então o que a gente tem hoje é um número forte com uma etiqueta de "ainda não checado por terceiro" colada nele

E eu prefiro te contar isso do que vender hype 😀

O que isso muda para quem desenvolve com IA

Você que consome API e ferramenta de IA nunca vai ver um Jalapeño de perto

Mas duas coisas que tu sente todo dia nascem exatamente nessa camada: latência de resposta e custo por token

Quando o decode está preso em banda de memória, é a tua resposta que sai devagar

Quando o estado precisa viajar entre partes do sistema, é a conta de energia do provedor que sobe, e conta de energia vira preço em algum momento

Não segura a respiração pelo cronograma:

A implantação inicial está prevista para o fim de 2026, em volumes muito pequenos, basicamente protótipos

A escala relevante fica pra 2027

Isso se encaixa no acordo de outubro de 2025 entre OpenAI e Broadcom pra implantar 10 gigawatts de aceleradores projetados pela OpenAI até 2029

E tem um detalhe importante que muita gente confunde: os chips serão usados pela OpenAI para inferência, ou seja, pra servir os modelos dela em produtos como o ChatGPT

Não foi anunciado como produto de venda a terceiros

Ou seja, não é peça que tu vai comprar, é infraestrutura que tu vai consumir sem saber

Nove meses do design ao tape-out:

Greg Brockman, presidente da OpenAI, disse à CNBC que o chip foi projetado de ponta a ponta em nove meses, com ajuda dos próprios modelos da empresa

Pra quem tem alguma noção de ciclo de silício, isso é um prazo agressivo pra caramba

KV cache na prática: onde o conceito aparece no seu dia a dia

Agora esquece o chip por um minuto

O princípio "estado guardado perto de quem calcula" explica um monte de comportamento que tu já viu:

  1. Contexto longo fica mais lento: quanto mais tokens no histórico, maior o KV cache que precisa ser lido a cada token novo, e o decode já é limitado por banda de memória
  2. Conversa com muitas idas e voltas pesa: cada rodada empilha estado, e o custo de manter esse estado por perto cresce junto
  3. Agente que repete o mesmo prefixo de prompt: se o prefixo é sempre igual, reaproveitar o que já foi calculado dele evita refazer a mesma conta do zero toda vez
  4. Modelo rodando local na tua máquina: aqui o efeito fica escancarado, porque a memória é a tua e ela acaba

O caso 4 é o mais didático de todos, na minha opinião

Quando tu roda um modelo na própria máquina, a memória para de ser abstração e vira barra de progresso na cara

É o mesmo motivo pelo qual muita gente monta setup pra rodar LLM local por privacidade e descobre no caminho que contexto longo cobra pedágio em RAM

E cache, em qualquer camada, tem sempre o mesmo par de problemas: ocupa espaço e envelhece

Qualquer dev de front já sentiu a versão mansa disso na hora de limpar dados da localStorage porque o estado guardado ficou velho

Muda a escala, o dilema é o mesmo

Veja o conceito rodando local

Rodar modelo na própria máquina é o jeito mais rápido de enxergar o efeito da memória e do estado, porque tudo acontece no teu hardware

Pra começar do zero com inferência local, este vídeo do canal mostra como rodar o Codex 100% local com o Ollama, em um comando:

Conclusão

A leitura que fica é essa: a briga da inferência hoje é por movimentação de dados, não só por FLOP

O prefill quer computação, o decode quer banda de memória, e a inferência distribuída ainda cobra o pedágio de mover estado entre as partes do sistema

O Jalapeño é a aposta da OpenAI nessa tese, com KV cache explicitamente posicionado e mantido local, arquitetura em slices e co-design de ponta a ponta

Os números divulgados são fortes, mas seguem sem validação independente, e a própria SemiAnalysis já avisou que o adversário de verdade é o Rubin

Então o próximo capítulo é esse confronto, e vale acompanhar

Enquanto isso, tem uma tarefa bem mais barata que tu pode fazer hoje: reparar em como as tuas ferramentas se comportam conforme o contexto cresce

O gargalo do datacenter e a lentidão da tua janela de chat são o mesmo fenômeno, só que em escalas diferentes…

até o próximo post! =)

Perguntas frequentes

Quando o Jalapeño vai começar a rodar de verdade nos produtos da OpenAI?

A implantação inicial acontece no fim de 2026, ainda em volumes muito pequenos, tratados como protótipos. A escala relevante só chega em 2027.

A OpenAI vai vender o Jalapeño para outras empresas?

Não. Os chips serão usados internamente pela OpenAI para inferência, ou seja, para servir os próprios modelos em produtos como o ChatGPT. Não há anúncio de venda do Jalapeño como produto para terceiros.

Os benchmarks do Jalapeño contra a Nvidia já foram confirmados por alguém de fora da OpenAI?

Ainda não. A própria SemiAnalysis, que opera o InferenceX usado no teste, chamou a comparação de incompleta e injusta, porque o rival direto do Jalapeño seria o Rubin (que usa HBM4), não o Blackwell. Além disso, o chip não foi liberado para teste externo, então o baseline da Nvidia é reproduzível e os resultados do Jalapeño não.

O que é KV cache e por que ele importa tanto no Jalapeño?

O KV cache é o estado que o modelo guarda das chaves e valores já calculados dos tokens anteriores, pra não refazer a conta a cada token novo. No Jalapeño, a OpenAI descreve que esse estado pode ser explicitamente posicionado e mantido local, e Richard Ho, VP de hardware da empresa, afirmou que o chip foi projetado para minimizar movimentação de dados e manter operações intermediárias e os KV caches no próprio chip.

Qual é o acordo entre OpenAI e Broadcom que envolve o Jalapeño?

O Jalapeño se encaixa no acordo fechado em outubro de 2025 entre as duas empresas, que prevê implantar 10 gigawatts de aceleradores projetados pela OpenAI. Esses aceleradores são infraestrutura da própria OpenAI para inferência, não produto de venda a terceiros.

O Jalapeño consome mais ou menos energia que os racks GB200 e GB300 da Nvidia?

Menos, pelo menos no papel: o pacote Jalapeño é nominal de 700 W, contra 1.200 W do GB200 e 1.400 W do GB300. É essa diferença de potência que sustenta o número de 1,5x a 1,9x mais trabalho de IA por watt divulgado no benchmark.




Escrito por | Matheus Battisti

Matheus Battisti
Fundador da Hora de Codar

Programador apaixonado pelo mundo das tecnologias, sempre buscando em aprender e se aprofundar em linguagens, frameworks e o que mais for necessário para executar um bom trabalho. Agora tem uma nova missão que é de passar seu conhecimento adiante para formar novos programadores e especializar mais os que já são.

Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares