O que é o Jalapeño, o chip de inferência da OpenAI?

Jalapeño é o primeiro chip próprio da OpenAI, um acelerador de inferência co-desenvolvido com a Broadcom e anunciado em 24 de junho de 2026, com os primeiros benchmarks apresentados no Hot Chips em 25 de agosto de 2026. Ele é um ASIC dedicado a rodar modelos já treinados, não uma GPU de uso geral e nem hardware de treinamento. Cada acelerador entrega 13,4 petaFLOPS em MXFP4, 216 GB de HBM4 e 15,4 TB/s de banda, em processo de 3 nm. A implantação inicial está prevista para o fim de 2026, em escala muito pequena, com rollout maior em 2027
Jalapeño
Não, não é o nome de um prato mexicano no cardápio: é o nome do primeiro chip da OpenAI 😀
A empresa que até ontem era só cliente do silício dos outros agora tem o seu próprio, e ele veio com nome de pimenta
O Jalapeño é o primeiro Intelligence Processor da OpenAI, um acelerador co-desenvolvido com a Broadcom e arquitetado em torno da visão da empresa para o futuro da inferência de LLM. Foi anunciado publicamente em 24 de junho de 2026 e detalhado com os primeiros resultados de benchmark na conferência Hot Chips, em 25 de agosto de 2026
Bora entender o que ele é de verdade, sem hype?
Por que a OpenAI fez o próprio chip de inferência
Primeiro precisamos separar duas coisas que muita gente joga no mesmo balde
Formação Claude Code
Domine Claude Code do absoluto zero até o avançado
- 120 aulas
- 4 projetos
- 9h 45min
Treinamento é o processo de criar o modelo, queimando computação por semanas ou meses pra ajustar os pesos
Inferência é o que acontece depois: o modelo já está pronto e precisa responder ao seu comando, agora, com você olhando pra tela esperando o token aparecer
O Jalapeño é um ASIC dedicado a inferência. Não é uma GPU de uso geral e não foi feito pra treinar nada
E aqui está o pulo do gato: quando você serve modelo pra milhões de pessoas ao mesmo tempo, a inferência vira o gargalo econômico da brincadeira. Cada resposta custa energia, custa memória e custa tempo de espera
A tese de arquitetura declarada pela OpenAI:
A OpenAI diz que a arquitetura do Jalapeño reduz a movimentação de dados e equilibra os recursos de computação, memória e rede pra chegar a uma utilização real muito mais próxima do pico teórico
Se você já mexeu com otimização de aplicação, a analogia é direta: não adianta ter o servidor mais parrudo do mundo se o dado fica indo e voltando à toa entre as camadas. O chip pode ter um pico de papel absurdo e entregar uma fração disso na vida real
O design também mira dois pontos específicos que a OpenAI aponta como gargalos frequentes: a fase de prefill e a fase de comunicação do processamento
E tem um detalhe de bastidor que é mto massa: o chip foi co-desenvolvido do design inicial até o tape-out de fabricação em nove meses, o que OpenAI e Broadcom descrevem como o ciclo de desenvolvimento de ASIC mais rápido já alcançado em semicondutores avançados de alto desempenho
Como? Segundo a própria OpenAI, os modelos dela ajudaram no processo de design do chip
Ou seja: a IA ajudando a construir o hardware que vai rodar a IA 🙂
Especificações do Jalapeño: o que a OpenAI divulgou
Agora a ficha técnica, com a leitura do que cada número significa na prática
Por acelerador:
- 13,4 petaFLOPS em MXFP4: a computação bruta em precisão de 4 bits, o formato que domina o serving moderno porque cabe mais trabalho no mesmo silício
- 216 GB de memória HBM4: é aqui que os pesos do modelo moram durante a inferência, quanto mais memória rápida por acelerador, menos você precisa picotar o modelo entre chips
- 15,4 TB/s de banda de memória: a velocidade com que esses pesos chegam até a computação, em inferência de LLM isso costuma pesar mais que o pico de FLOPS
Por rack:
- 128 aceleradores
- 1,7 exaFLOPS de computação de 4 bits
- 27,5 TB de HBM4
Processo e potência:
- Construído em processo de 3 nm, ajustado aos padrões específicos de movimentação de memória, computação e rede da inferência de LLM
- Classificado em 700 watts, mas a potência sustentada medida ficou em 550 watts ou abaixo nas cargas testadas
Esse último ponto merece atenção: classificação é o teto, sustentado é o que a conta de luz do data center vê. A diferença entre os dois é exatamente o tipo de coisa que decide quantos aceleradores cabem num rack
Jalapeño x NVIDIA GB200 e GB300: o que dizem os benchmarks
Aqui a OpenAI fez algo que dá pra checar: em vez de publicar só slide próprio, o Jalapeño foi medido no InferenceX, benchmark público operado pela SemiAnalysis, contra sistemas comerciais líderes
Os sistemas de comparação usados nos resultados publicados foram os racks GB200 e GB300 da NVIDIA
Os testes cobriram três modelos de pesos abertos: GPT-OSS 120B, DeepSeek R1 670B e Kimi K2.5 1T. A ideia é mostrar que a arquitetura funciona com modelos criados dentro e fora da OpenAI
| Métrica | Resultado do Jalapeño | Escopo |
|---|---|---|
| Trabalho de IA por watt (pico de throughput) | 1,5x a 1,9x mais | Nos três modelos testados |
| Latência ponta a ponta | 1,7x a 3,6x menos | Nos três modelos testados |
| Desempenho em cargas altamente interativas | 2,1x a 4,1x mais | Contra os sistemas de comparação |
| Kimi K2.5 1T, desempenho por watt em pico | ~1,5x mais | Maior modelo público testado |
| Kimi K2.5 1T, latência ponta a ponta | 3,4x menos | Maior modelo público testado |
O recorte das cargas altamente interativas é o mais interessante pra quem usa IA no editor ou no chat: é justamente o cenário de muita gente pedindo resposta ao mesmo tempo, esperando o token sair rápido
E agora o disclaimer honesto, que vale mais que qualquer número da tabela
A OpenAI indicou que um relatório técnico com os detalhes do Jalapeño sairá nos próximos meses. Até agora ele não saiu
Então o que temos é: um benchmark público operado por terceiro, com escopo declarado de três modelos de pesos abertos contra racks GB200 e GB300, e a documentação técnica completa ainda no forno
É bem mais do que a média dos anúncios de chip entrega, mas não é a palavra final
O que o Jalapeño muda para quem usa IA no dia a dia
Resposta curta e sem enrolação: por enquanto, quase nada
O Jalapeño é a primeira etapa de uma plataforma de computação de várias gerações, com implantação inicial prevista para o fim de 2026 em data centers operados pela Microsoft e outros parceiros
E a própria OpenAI fala em implantação em escala muito pequena até o fim de 2026, com um rollout maior em 2027
Ou seja: você não vai acordar semana que vem com a API mais barata porque o chip existe
O que interessa é o médio prazo. Segundo o CEO da Broadcom, Hock Tan, o acelerador mostra economia de custo de cerca de 50% em comparação com GPUs de IA típicas
Se isso se confirmar em escala, o efeito chega em você por dois caminhos: preço (custo de servir cai, e historicamente parte disso vira preço de API) e latência (menos tempo de espera nas cargas interativas)
Mas repare que eu escrevi "se". Nada disso foi anunciado como promessa de preço, e não existe declaração oficial sobre custo por token atrelado ao Jalapeño
Tome cuidado com quem já está fazendo planilha de economia em cima de um chip que ainda vai ser implantado 😛
OpenAI em movimento: vídeo do canal
O movimento de ter silício próprio não acontece no vácuo: ele faz parte de uma expansão bem maior da OpenAI em várias frentes ao mesmo tempo
Pra começar do zero com o momento atual da empresa, este vídeo do canal mostra o assunto:
O que acompanhar daqui pra frente
Recapitulando o que sabemos de fato
O Jalapeño é o primeiro chip próprio da OpenAI, um ASIC de inferência co-desenvolvido com a Broadcom, anunciado em 24 de junho de 2026 e detalhado no Hot Chips em 25 de agosto de 2026
A ficha técnica divulgada fala em 13,4 petaFLOPS em MXFP4, 216 GB de HBM4 e 15,4 TB/s por acelerador, com 128 aceleradores por rack em processo de 3 nm
Os números de desempenho vêm do InferenceX, benchmark público operado pela SemiAnalysis, contra racks GB200 e GB300 da NVIDIA, em três modelos de pesos abertos
E o relatório técnico prometido pela OpenAI ainda não saiu
Então o que vale acompanhar é exatamente isso: a publicação do relatório técnico, que é onde os detalhes de arquitetura vão poder ser destrinchados, e os sinais de rollout ampliado em 2027, que é quando o Jalapeño da OpenAI deixa de ser notícia de conferência e começa a aparecer na conta de quem consome inferência
Até lá, o resto é especulação…
Até o próximo post! 🙂
Perguntas frequentes
Quando o Jalapeño vai estar disponível para uso?
A implantação inicial está prevista para o fim de 2026, em data centers operados pela Microsoft e outros parceiros. A própria OpenAI descreve essa primeira fase como escala muito pequena, com um rollout maior planejado só para 2027.
O Jalapeño substitui as GPUs da NVIDIA na OpenAI?
Não há indicação disso nos fatos divulgados até agora. Os benchmarks públicos comparam o Jalapeño com os racks GB200 e GB300 da NVIDIA, mas a implantação inicial do chip é em escala muito pequena, o que aponta pra convivência no curto prazo, não substituição.
O Jalapeño serve para treinar modelos de IA?
Não. O Jalapeño é um ASIC dedicado a inferência, ou seja, rodar modelos já treinados em resposta a comandos. Ele não foi projetado para a etapa de treinamento, que é o processo de criar e ajustar os pesos do modelo.
Quem fabrica e desenvolve o chip Jalapeño?
O Jalapeño é o primeiro chip próprio da OpenAI, co-desenvolvido com a Broadcom. Foi levado do design inicial até o tape-out de fabricação em nove meses, ciclo que as duas empresas descrevem como o mais rápido já alcançado em semicondutores avançados de alto desempenho.
O Jalapeño realmente economiza custo em relação a GPUs de IA?
Segundo o CEO da Broadcom, Hock Tan, o acelerador mostra economia de custo de cerca de 50% em comparação com GPUs de IA típicas. Vale lembrar que esse número é uma declaração da Broadcom, e o relatório técnico completo do Jalapeño ainda não foi publicado.
O que é o InferenceX, o benchmark usado para testar o Jalapeño?
É um benchmark público de inferência operado pela SemiAnalysis, usado para medir o Jalapeño contra sistemas comerciais líderes. Os testes cobriram três modelos de pesos abertos (GPT-OSS 120B, DeepSeek R1 670B e Kimi K2.5 1T) comparados aos racks GB200 e GB300 da NVIDIA.
Formações
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Blog | Mais populares
O que significa “ChatGPT network error” e como resolver
O “ChatGPT Network Error” é uma ocorrência frequente na rotina de muitos usuários do ChatGPT. Porém, poucos compreendem seu significado, quando esse erro surge, etc. […]

Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação
Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação A popularidade da automação de processos com o n8n está em alta, principalmente […]

Como usar o Antigravity do Google: guia completo do zero ao primeiro app
Aprenda neste guia prático como usar o Antigravity do Google: descubra a instalação, configuração, criação de projetos com o Agent Manager e o primeiro deploy, […]
