Jalapeño: por que o chip da OpenAI não obriga a escolher entre throughput e latência?

chip Jalapeño da OpenAI para inferência de IA com throughput e latência otimizados
Resposta rápida

Jalapeño OpenAI é o chip de inferência (ASIC) que a OpenAI co-desenvolveu com a Broadcom, anunciado em 24 de junho de 2026 e com os primeiros benchmarks apresentados na Hot Chips em 25 de agosto de 2026. A promessa central é arquitetural: entregar maior throughput E menor latência numa mesma arquitetura, algo que, segundo a OpenAI, sistemas de hardware existentes normalmente precisam trocar um pelo outro. O caminho é reduzir movimentação de dados: cores e HBM em slices, rede coletiva dedicada e um domínio de conectividade que segura o workload inteiro num sistema só. Os números são medições da própria OpenAI, sem verificação independente até agora

Todo hardware de inferência hoje faz uma pergunta chata pra quem opera: você quer volume ou quer resposta rápida?

Fala aí, beleza? A OpenAI e a Broadcom estão dizendo que dá pra simplesmente não responder essa pergunta

O Jalapeño é o chip de inferência customizado (ASIC) co-desenvolvido pelas duas, projetado do zero pra inferência de LLM e não um acelerador de propósito geral adaptado

O anúncio público saiu em 24 de junho de 2026, e o primeiro lote de benchmarks subiu no palco da conferência Hot Chips em 25 de agosto de 2026

Bora entender o problema antes da solução, porque aqui o problema é metade da história

Formação Vibe Coding
Formação Recomendada

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Throughput e latência: por que hardware de inferência costuma escolher um dos dois

Duas palavras que vivem juntas e brigam o tempo todo

Throughput é quanto trabalho o sistema entrega por unidade de tempo (e, quando entra a conta de energia, por watt)

Latência é quanto o usuário espera sentado até a resposta aparecer na tela

A sacada é que essas duas métricas olham pra coisas diferentes: uma é a visão de quem paga a fatura da infra, a outra é a visão de quem tá com o cursor piscando esperando o token chegar

E por que otimizar uma tende a estragar a outra? A resposta que a OpenAI dá é bem direta: o gargalo não é só "quanta conta o chip faz", é o dado indo e voltando

Movimentação de KVCache

Movimentação de pesos

Latências fixas e overheads que aparecem em todo caminho percorrido

Atrasos de comunicação quando o workload não cabe num sistema só e precisa conversar com o vizinho

Aí você tem o quadro que a OpenAI descreve: sistemas de hardware existentes normalmente precisam fazer uma troca entre throughput e latência, e a afirmação dela é que o Jalapeño entrega os dois numa mesma arquitetura

É uma afirmação forte, e o desenho do chip é a explicação que eles dão pra ela 😀

Como a arquitetura do Jalapeño ataca a movimentação de dados

Aqui mora o coração conceitual do chip

Em vez de tratar compute de um lado e memória do outro, o Jalapeño divide cores e HBM em fatias (slices)

Cada fatia de core tem visão local, de baixa latência, sobre a sua própria fatia de HBM

Analogia de aproximação: em vez de um almoxarifado central onde todo mundo vai buscar peça e forma fila, cada bancada tem a gaveta dela do lado, com a peça que ela usa

E quando as bancadas precisam se falar? Aí entra a sincronização entre slices, feita por uma rede coletiva dedicada de alta largura de banda

O objetivo declarado da arquitetura é eliminar movimentação de memória de KVCache e de pesos, junto com latências fixas e overheads

O efeito que a OpenAI busca com isso é equilibrar compute, memória e rede pra chegar numa utilização real mais próxima do pico teórico

Esse é o ponto que costuma passar batido em anúncio de chip: pico teórico todo mundo tem no slide, o difícil é o silício realmente trabalhar perto dele

O papel da rede: manter o workload inteiro dentro de um sistema

Se reduzir movimentação de dados é a tese, a rede não é acessório, é parte do argumento

A OpenAI diz que a rede do Jalapeño oferece um domínio de conectividade grande o bastante pra manter um workload inteiro dentro de um único sistema conectado

Menos conversa saindo pra fora do sistema significa menos atraso de comunicação e menos dado viajando

Os números da topologia apresentados na Hot Chips:

  • domínio local de 128 ASICs
  • domínio global chegando a 2.048 chips
  • topologia Clos de dois níveis (half-flattened) sobre switches Broadcom Tomahawk 6

Repare como isso amarra com a seção anterior: os slices resolvem a distância dentro do chip, a rede resolve a distância entre os chips

É a mesma ideia aplicada em duas escalas, e é isso que sustenta a promessa de não escolher entre volume e espera

Os primeiros números: o que a OpenAI mostrou na Hot Chips

Os testes foram rodados no InferenceX, benchmark público operado pela SemiAnalysis

Os modelos usados foram três abertos: GPT-OSS 120B, DeepSeek R1 670B e Kimi K2.5 1T

A base de comparação foram sistemas baseados em NVIDIA GB200 e GB300

O que a OpenAI afirma ter medido:

  • 1,5x a 1,9x mais trabalho de IA por watt em pico de throughput
  • menor latência ponta a ponta
  • 2,1x a 4,1x mais performance em cargas altamente interativas

E o caso concreto do DeepSeek R1 contra o GB300:

Métrica (DeepSeek R1, InferenceX) Jalapeño NVIDIA GB300
Throughput (tokens mistos por segundo por quilowatt) 19.641 11.781
Latência ponta a ponta 1,65 s 5,99 s

Tem ainda a conta de energia, que é onde a coisa fica interessante pra quem pensa em custo de operação

O Jalapeño tem 700 W de potência nominal, e a potência sustentada medida nos testes ficou em 550 W ou menos

O GB300 comparado aparece com 1.400 W

Ou seja: a vantagem declarada não vem só de fazer mais, vem de fazer mais gastando menos

Vale registrar que todos esses números saíram da apresentação da própria OpenAI

O que ainda não dá para afirmar sobre o Jalapeño

Se liga nisso, porque é a parte que separa notícia de release

Todos os números divulgados são medições da própria OpenAI sobre o próprio silício

O chip ainda não foi liberado pra teste independente externo, então não existe verificação de terceiro até agora

O contraponto honesto é que a base de comparação (Blackwell rodando um benchmark de terceiros com modelos abertos) é reproduzível por quem tiver o hardware na mão

Isso não valida o lado do Jalapeño, mas deixa metade da mesa auditável

E tem o estágio de maturidade, que muita manchete esquece de mencionar

O Jalapeño ainda não está em produção ampla: o plano é começar a implantar na infraestrutura da própria OpenAI até o fim de 2026, em escala muito pequena, com rollout maior em 2027

Então sim, é notícia grande de arquitetura

Não, não é coisa que já está rodando por trás do que você usa hoje

O que isso muda para quem desenvolve com LLM

Vamos traduzir pro nosso dia a dia, que é onde essas duas métricas param de ser slide e viram sensação

Latência ponta a ponta é o número que você sente em fluxo interativo: agente esperando ferramenta, chat respondendo, autocomplete no editor

É o número que faz a diferença entre "a IA me acompanha" e "a IA me interrompe"

Throughput por watt é o número que aparece na fatura, não na tela

É o que decide o custo por token lá na ponta de quem opera a infra

Essa tensão entre velocidade, custo e qualidade não é exclusiva de hardware, viu? Ela reaparece na hora de você escolher o nível de raciocínio de um modelo na API que já usa hoje

Na prática imediata, nada muda: o chip não está em produção ampla

O que dá pra ler no desenho é a intenção

A OpenAI diz que o Jalapeño foi informado pelos sistemas que ela roda em produção (ChatGPT, Codex e a API), mas projetado pensando em LLMs atuais e futuros da indústria

E tem um detalhe do processo que diz muito sobre o ritmo do setor: foram nove meses do design inicial ao tape-out, com a OpenAI usando os próprios modelos ao longo do desenvolvimento

Nove meses pra um ASIC dedicado sair do papel

Isso é bem insano quando você pensa no ciclo tradicional de silício

Vídeo: a evolução do vibe coding para a IA não quebrar nada

Se o assunto é IA no desenvolvimento e você quer começar do zero, este vídeo do canal mostra a evolução do vibe coding pro que dá pra chamar de Loop Engineering: como trabalhar com IA sem que ela quebre o que já funcionava

Conclusão

A promessa do Jalapeño não é "chip mais rápido", é uma promessa arquitetural: reduzir movimentação de dados (KVCache, pesos, overheads, atraso de comunicação) pra não ter que escolher entre volume e espera

Slices de core com HBM local, rede coletiva dedicada pra sincronizar e um domínio de conectividade que segura o workload inteiro dentro de um sistema só

Os primeiros números da Hot Chips são bons no papel, e são da casa

Então o próximo passo pra quem acompanha é simples: ficar de olho se aparecem medições independentes, e observar o que realmente acontece na implantação de escala pequena no fim de 2026 e no rollout maior de 2027

Até o próximo post! 🙂

Perguntas frequentes

O Jalapeño é uma GPU ou um tipo diferente de chip?

É um ASIC, um chip de inferência customizado, co-desenvolvido pela OpenAI com a Broadcom. Foi projetado do zero para inferência de LLM, e não é um acelerador de propósito geral adaptado para essa função.

Quando o Jalapeño vai estar disponível em produção?

Ainda não está em produção ampla. O plano é começar a implantar na infraestrutura da própria OpenAI até o fim de 2026, em escala muito pequena, com rollout maior previsto para 2027.

Quais modelos foram usados nos benchmarks do Jalapeño na Hot Chips?

Os testes cobriram três modelos abertos: GPT-OSS 120B, DeepSeek R1 670B e Kimi K2.5 1T. Todos rodaram no InferenceX, benchmark público operado pela SemiAnalysis.

Quanto o Jalapeño consome de energia comparado ao NVIDIA GB300?

O Jalapeño tem potência nominal de 700 W, com potência sustentada medida nos testes em 550 W ou menos. O GB300 comparado aparece com 1.400 W, o que ajuda a explicar a vantagem de trabalho por watt declarada pela OpenAI.

Quanto tempo levou para desenvolver o Jalapeño do zero?

O ciclo completo, do design inicial ao tape-out, levou nove meses. A OpenAI afirma ter usado seus próprios modelos ao longo desse processo de desenvolvimento.

Os números de desempenho do Jalapeño já foram confirmados por alguém fora da OpenAI?

Não. Todos os números divulgados até agora são medições da própria OpenAI sobre o próprio silício, sem verificação independente externa. O contraponto é que a base de comparação, o Blackwell rodando o InferenceX com modelos abertos, é reproduzível por quem tiver o hardware.




Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação SAAS com IA

Formação SAAS com IA

Tire usas ideias do papel criando softwares com IA, integre pagamentos e lance seu projeto!

  • 291 aulas
  • 18 projetos
  • 24h 17min

Blog | Mais populares