Jalapeño: por que o chip da OpenAI não obriga a escolher entre throughput e latência?

Jalapeño OpenAI é o chip de inferência (ASIC) que a OpenAI co-desenvolveu com a Broadcom, anunciado em 24 de junho de 2026 e com os primeiros benchmarks apresentados na Hot Chips em 25 de agosto de 2026. A promessa central é arquitetural: entregar maior throughput E menor latência numa mesma arquitetura, algo que, segundo a OpenAI, sistemas de hardware existentes normalmente precisam trocar um pelo outro. O caminho é reduzir movimentação de dados: cores e HBM em slices, rede coletiva dedicada e um domínio de conectividade que segura o workload inteiro num sistema só. Os números são medições da própria OpenAI, sem verificação independente até agora
Todo hardware de inferência hoje faz uma pergunta chata pra quem opera: você quer volume ou quer resposta rápida?
Fala aí, beleza? A OpenAI e a Broadcom estão dizendo que dá pra simplesmente não responder essa pergunta
O Jalapeño é o chip de inferência customizado (ASIC) co-desenvolvido pelas duas, projetado do zero pra inferência de LLM e não um acelerador de propósito geral adaptado
O anúncio público saiu em 24 de junho de 2026, e o primeiro lote de benchmarks subiu no palco da conferência Hot Chips em 25 de agosto de 2026
Bora entender o problema antes da solução, porque aqui o problema é metade da história
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Throughput e latência: por que hardware de inferência costuma escolher um dos dois
Duas palavras que vivem juntas e brigam o tempo todo
Throughput é quanto trabalho o sistema entrega por unidade de tempo (e, quando entra a conta de energia, por watt)
Latência é quanto o usuário espera sentado até a resposta aparecer na tela
A sacada é que essas duas métricas olham pra coisas diferentes: uma é a visão de quem paga a fatura da infra, a outra é a visão de quem tá com o cursor piscando esperando o token chegar
E por que otimizar uma tende a estragar a outra? A resposta que a OpenAI dá é bem direta: o gargalo não é só "quanta conta o chip faz", é o dado indo e voltando
Movimentação de KVCache
Movimentação de pesos
Latências fixas e overheads que aparecem em todo caminho percorrido
Atrasos de comunicação quando o workload não cabe num sistema só e precisa conversar com o vizinho
Aí você tem o quadro que a OpenAI descreve: sistemas de hardware existentes normalmente precisam fazer uma troca entre throughput e latência, e a afirmação dela é que o Jalapeño entrega os dois numa mesma arquitetura
É uma afirmação forte, e o desenho do chip é a explicação que eles dão pra ela 😀
Como a arquitetura do Jalapeño ataca a movimentação de dados
Aqui mora o coração conceitual do chip
Em vez de tratar compute de um lado e memória do outro, o Jalapeño divide cores e HBM em fatias (slices)
Cada fatia de core tem visão local, de baixa latência, sobre a sua própria fatia de HBM
Analogia de aproximação: em vez de um almoxarifado central onde todo mundo vai buscar peça e forma fila, cada bancada tem a gaveta dela do lado, com a peça que ela usa
E quando as bancadas precisam se falar? Aí entra a sincronização entre slices, feita por uma rede coletiva dedicada de alta largura de banda
O objetivo declarado da arquitetura é eliminar movimentação de memória de KVCache e de pesos, junto com latências fixas e overheads
O efeito que a OpenAI busca com isso é equilibrar compute, memória e rede pra chegar numa utilização real mais próxima do pico teórico
Esse é o ponto que costuma passar batido em anúncio de chip: pico teórico todo mundo tem no slide, o difícil é o silício realmente trabalhar perto dele
O papel da rede: manter o workload inteiro dentro de um sistema
Se reduzir movimentação de dados é a tese, a rede não é acessório, é parte do argumento
A OpenAI diz que a rede do Jalapeño oferece um domínio de conectividade grande o bastante pra manter um workload inteiro dentro de um único sistema conectado
Menos conversa saindo pra fora do sistema significa menos atraso de comunicação e menos dado viajando
Os números da topologia apresentados na Hot Chips:
- domínio local de 128 ASICs
- domínio global chegando a 2.048 chips
- topologia Clos de dois níveis (half-flattened) sobre switches Broadcom Tomahawk 6
Repare como isso amarra com a seção anterior: os slices resolvem a distância dentro do chip, a rede resolve a distância entre os chips
É a mesma ideia aplicada em duas escalas, e é isso que sustenta a promessa de não escolher entre volume e espera
Os primeiros números: o que a OpenAI mostrou na Hot Chips
Os testes foram rodados no InferenceX, benchmark público operado pela SemiAnalysis
Os modelos usados foram três abertos: GPT-OSS 120B, DeepSeek R1 670B e Kimi K2.5 1T
A base de comparação foram sistemas baseados em NVIDIA GB200 e GB300
O que a OpenAI afirma ter medido:
- 1,5x a 1,9x mais trabalho de IA por watt em pico de throughput
- menor latência ponta a ponta
- 2,1x a 4,1x mais performance em cargas altamente interativas
E o caso concreto do DeepSeek R1 contra o GB300:
| Métrica (DeepSeek R1, InferenceX) | Jalapeño | NVIDIA GB300 |
|---|---|---|
| Throughput (tokens mistos por segundo por quilowatt) | 19.641 | 11.781 |
| Latência ponta a ponta | 1,65 s | 5,99 s |
Tem ainda a conta de energia, que é onde a coisa fica interessante pra quem pensa em custo de operação
O Jalapeño tem 700 W de potência nominal, e a potência sustentada medida nos testes ficou em 550 W ou menos
O GB300 comparado aparece com 1.400 W
Ou seja: a vantagem declarada não vem só de fazer mais, vem de fazer mais gastando menos
Vale registrar que todos esses números saíram da apresentação da própria OpenAI
O que ainda não dá para afirmar sobre o Jalapeño
Se liga nisso, porque é a parte que separa notícia de release
Todos os números divulgados são medições da própria OpenAI sobre o próprio silício
O chip ainda não foi liberado pra teste independente externo, então não existe verificação de terceiro até agora
O contraponto honesto é que a base de comparação (Blackwell rodando um benchmark de terceiros com modelos abertos) é reproduzível por quem tiver o hardware na mão
Isso não valida o lado do Jalapeño, mas deixa metade da mesa auditável
E tem o estágio de maturidade, que muita manchete esquece de mencionar
O Jalapeño ainda não está em produção ampla: o plano é começar a implantar na infraestrutura da própria OpenAI até o fim de 2026, em escala muito pequena, com rollout maior em 2027
Então sim, é notícia grande de arquitetura
Não, não é coisa que já está rodando por trás do que você usa hoje
O que isso muda para quem desenvolve com LLM
Vamos traduzir pro nosso dia a dia, que é onde essas duas métricas param de ser slide e viram sensação
Latência ponta a ponta é o número que você sente em fluxo interativo: agente esperando ferramenta, chat respondendo, autocomplete no editor
É o número que faz a diferença entre "a IA me acompanha" e "a IA me interrompe"
Throughput por watt é o número que aparece na fatura, não na tela
É o que decide o custo por token lá na ponta de quem opera a infra
Essa tensão entre velocidade, custo e qualidade não é exclusiva de hardware, viu? Ela reaparece na hora de você escolher o nível de raciocínio de um modelo na API que já usa hoje
Na prática imediata, nada muda: o chip não está em produção ampla
O que dá pra ler no desenho é a intenção
A OpenAI diz que o Jalapeño foi informado pelos sistemas que ela roda em produção (ChatGPT, Codex e a API), mas projetado pensando em LLMs atuais e futuros da indústria
E tem um detalhe do processo que diz muito sobre o ritmo do setor: foram nove meses do design inicial ao tape-out, com a OpenAI usando os próprios modelos ao longo do desenvolvimento
Nove meses pra um ASIC dedicado sair do papel
Isso é bem insano quando você pensa no ciclo tradicional de silício
Vídeo: a evolução do vibe coding para a IA não quebrar nada
Se o assunto é IA no desenvolvimento e você quer começar do zero, este vídeo do canal mostra a evolução do vibe coding pro que dá pra chamar de Loop Engineering: como trabalhar com IA sem que ela quebre o que já funcionava
Conclusão
A promessa do Jalapeño não é "chip mais rápido", é uma promessa arquitetural: reduzir movimentação de dados (KVCache, pesos, overheads, atraso de comunicação) pra não ter que escolher entre volume e espera
Slices de core com HBM local, rede coletiva dedicada pra sincronizar e um domínio de conectividade que segura o workload inteiro dentro de um sistema só
Os primeiros números da Hot Chips são bons no papel, e são da casa
Então o próximo passo pra quem acompanha é simples: ficar de olho se aparecem medições independentes, e observar o que realmente acontece na implantação de escala pequena no fim de 2026 e no rollout maior de 2027
Até o próximo post! 🙂
Perguntas frequentes
O Jalapeño é uma GPU ou um tipo diferente de chip?
É um ASIC, um chip de inferência customizado, co-desenvolvido pela OpenAI com a Broadcom. Foi projetado do zero para inferência de LLM, e não é um acelerador de propósito geral adaptado para essa função.
Quando o Jalapeño vai estar disponível em produção?
Ainda não está em produção ampla. O plano é começar a implantar na infraestrutura da própria OpenAI até o fim de 2026, em escala muito pequena, com rollout maior previsto para 2027.
Quais modelos foram usados nos benchmarks do Jalapeño na Hot Chips?
Os testes cobriram três modelos abertos: GPT-OSS 120B, DeepSeek R1 670B e Kimi K2.5 1T. Todos rodaram no InferenceX, benchmark público operado pela SemiAnalysis.
Quanto o Jalapeño consome de energia comparado ao NVIDIA GB300?
O Jalapeño tem potência nominal de 700 W, com potência sustentada medida nos testes em 550 W ou menos. O GB300 comparado aparece com 1.400 W, o que ajuda a explicar a vantagem de trabalho por watt declarada pela OpenAI.
Quanto tempo levou para desenvolver o Jalapeño do zero?
O ciclo completo, do design inicial ao tape-out, levou nove meses. A OpenAI afirma ter usado seus próprios modelos ao longo desse processo de desenvolvimento.
Os números de desempenho do Jalapeño já foram confirmados por alguém fora da OpenAI?
Não. Todos os números divulgados até agora são medições da própria OpenAI sobre o próprio silício, sem verificação independente externa. O contraponto é que a base de comparação, o Blackwell rodando o InferenceX com modelos abertos, é reproduzível por quem tiver o hardware.
Formações
Formação SAAS com IA
Tire usas ideias do papel criando softwares com IA, integre pagamentos e lance seu projeto!
- 291 aulas
- 18 projetos
- 24h 17min
Blog | Mais populares
As diferenças de var, let e const
Como fazer redirecionamento com PHP
Neste artigo você vai aprender a como fazer redirecionamento com PHP, utilizaremos abordagens fáceis de entender e de aplicar Fala programador(a), beleza? Bora aprender mais […]
Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação
Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação A popularidade da automação de processos com o n8n está em alta, principalmente […]
