Chip Jalapeño: como a IA ajudou a projetar o chip da OpenAI feito para ser programado por IA

O chip Jalapeño é o primeiro chip próprio da OpenAI, feito em parceria com a Broadcom e voltado só para inferência de LLM, anunciado em 24 de junho de 2026. O ângulo mais interessante não é benchmark: a IA participou do projeto do próprio chip, explorando implementações, encurtando a verificação e otimizando circuitos aritméticos com um modelo interno e a toolchain XLS. E o hardware foi desenhado como alvo de programação previsível justamente para que a IA também escreva os kernels, em Gluon, linguagem construída sobre o Triton. Os primeiros resultados saíram no Hot Chips 2026, mas o chip ainda não está implantado
Fala aí, beleza? A OpenAI fez uma coisa que parece piada de recursão: usou IA pra ajudar a projetar um chip, e projetou esse chip pra ser programado por IA 😀
O Jalapeño foi anunciado em 24 de junho de 2026, co-desenvolvido com a Broadcom, e é o primeiro chip customizado da OpenAI, exclusivo para inferência de LLM
Tem muito post por aí só comparando número contra a Nvidia
Esse aqui é outro recorte: bastidor de engenharia
O que interessa é a escolha de projeto, a IA dentro do fluxo de design e o motivo de terem desenhado o hardware como um alvo de programação previsível
Bora entender?
O anúncio e o que já se sabe do chip:
A linha do tempo é curta e vale ter na cabeça
Em 24 de junho de 2026 a OpenAI e a Broadcom apresentaram o Jalapeño como um Intelligence Processor voltado a inferência de LLM, o primeiro chip próprio da casa
Em 25 de agosto de 2026, no Hot Chips 2026, saíram os primeiros resultados e os detalhes de engenharia
Formação Claude Code
Domine Claude Code do absoluto zero até o avançado
- 120 aulas
- 4 projetos
- 9h 45min
A parceria com a Broadcom é descrita como uma plataforma de computação multi-geração, ou seja, tem roadmap além do Jalapeño
As especificações divulgadas:
- 13,4 PFLOP/s de computação matricial mxfp4 por mxfp4
- 216 GiB de HBM4
- 15,4 TB/s de banda, em seis stacks
- pacote de 700 W
Repara num detalhe que muda todo o resto do texto: o chip é só de inferência
Ele não treina modelos
Todo o projeto foi feito olhando pra uma carga de trabalho específica, e é aí que a história de engenharia começa a ficar massa
Como a IA entrou no projeto do próprio chip:
Aqui não é marketing genérico de "usamos IA no processo"
A OpenAI descreve papéis bem concretos da IA no desenvolvimento do Jalapeño:
- explorou implementações possíveis
- encurtou os laços de design, medição e verificação
- iterou continuamente sobre cargas de trabalho de modelos
- ajudou a otimizar os circuitos aritméticos do chip
Pra isso, a equipe usou um modelo de IA interno próprio junto com a XLS no fluxo de design de hardware
E o que é XLS?
É uma toolchain open source criada pelo Google, o XLS (Accelerated HW Synthesis), que gera designs sintetizáveis (RTL em Verilog ou SystemVerilog) a partir de descrições de alto nível, e que inclui uma DSL própria, a DSLX
Se você conhece a ideia de escrever em uma linguagem mais alta e deixar um compilador cuspir o código de baixo nível, é bem esse espírito, só que a saída é descrição de circuito em vez de binário
E isso importa MUITO pro assunto do post
Descrição de alto nível é território onde um modelo de linguagem se vira bem
Traduzir intenção em RTL correto e sintetizável é o tipo de trabalho braçal e cheio de armadilha que a toolchain resolve melhor que a mão humana repetindo o mesmo padrão
O ciclo curto de medir, verificar e mudar:
O fluxo que a OpenAI enfatiza é quase um mantra: medir, verificar, aprender, mudar e repetir
A sacada é encurtar o feedback entre etapas que normalmente vivem separadas:
- simulação de carga
- RTL
- análise de qualidade de resultados
- verificação
- design físico
Em projeto de chip, essas fases costumam ser sequenciais e pesadas
Quando o ciclo é longo, você congela decisão cedo com medo de quebrar o cronograma
Com o laço curto, a equipe conseguiu aceitar mudanças relevantes até o dia do congelamento do RTL
Isso é o tipo de coisa que soa detalhe e é justamente onde mora o resultado
O chip foi co-desenvolvido do design inicial até o tape-out de fabricação em nove meses
Nove meses, com mudança entrando até o RTL freeze
É um ritmo de desenvolvimento de software aplicado a silício, e é o que explica o resto da história
IA contra a baseline humana: os números apresentados
Os ganhos abaixo foram apresentados pela própria OpenAI no Hot Chips 2026, medidos contra uma baseline humana
Vale ler com esse rótulo na testa: são números da empresa que fez o chip
| O que foi medido | Ganho apresentado | Comparado com |
|---|---|---|
| Multiplicador BF16 (PPA) | 56% | baseline humana |
| Unidade de matriz (área) | 10% menor | baseline humana |
| Kernels de blocos selecionados de attention e MoE | 1,5x a 1,8x mais rápido | código já existente escrito por engenheiros humanos especialistas |
O recado dos dois primeiros: a IA mexeu no circuito aritmético, na parte mais "hardware" da coisa
O recado do terceiro: a IA também escreveu o software que roda em cima
É o mesmo modelo de trabalho atacando as duas pontas
Por que o chip foi desenhado como alvo de programação previsível?
Esse é o coração do assunto, e é a decisão de projeto mais interessante do Jalapeño
Computação, memória, comunicação e sincronização foram expostas como um alvo de programação claro e previsível, para humanos e para IA
Na prática, o engenheiro descreve o trabalho por tensores locais, comunicação explícita e sincronização previsível
Nada de mágica escondida embaixo do tapete
E por que fazer isso?
A tese da OpenAI é direta: programação paralela é um problema historicamente difícil, e uma estrutura clara e previsível é o que dá à IA uma forma tratável de atacar esse problema
Com o comportamento do hardware previsível, a IA passa a otimizar o que realmente rende: como o trabalho é mapeado, alocado, agendado e coordenado no sistema
Pensa no contrário pra sentir o peso
Um alvo cheio de comportamento implícito e heurística escondida é um pesadelo até pra humano especialista
Pra um modelo gerando código, é pior ainda: ele não tem como raciocinar sobre o que não está exposto
Previsibilidade aqui não é conservadorismo, é pré-condição
Gluon, Codex e os kernels do Jalapeño:
Na prática, o Jalapeño é programado com Gluon, a linguagem de kernel da OpenAI construída sobre o Triton
O Gluon é de nível mais baixo que o Triton, preserva o modelo SPMD e expõe abstrações de baixo nível, com destaque pra abstração de layout baseada em Linear Layouts
E ele não é um projeto solto: faz parte do projeto Triton, roda sobre a mesma pilha de compilação, tem tutorial oficial do Gluon e código no repositório triton-lang/triton
Do lado do chip, a arquitetura é espacial
O Gluon programa cada core físico como um thread block, com engines tensor, SIMD e escalar organizadas em torno de uma memória local rápida
E a informação de layout captura explicitamente a posição física
Ou seja: onde o dado está no chip é parte do que você escreve, não um detalhe que o compilador esconde de você
Agora a parte que mais me chamou atenção
O trabalho inicial de kernels foi human-in-the-loop
Depois migrou pra uma versão interna e escalada do Codex, que escreve kernels do Jalapeño
Alguns desses kernels chegam a cerca de 3.000 linhas, apoiados por checagens de corretude e sanitizers customizados
Se você acompanha as tarefas de código que a IA toca sozinha, é o mesmo padrão levado ao extremo: o modelo escreve, e o que segura a peteca é a camada de verificação em volta
E tem o caso mais concreto de todos: usando o Codex com o GPT-Astra, modelo interno citado pela SemiAnalysis, a equipe levou três modelos de pesos abertos que não estavam no plano original de produção a alto desempenho no Jalapeño em dois meses
Essa é a prova de conceito real da ideia toda
Não é "a IA ajudou"
É portar carga que não estava prevista, em dois meses, num chip novo
O que os primeiros resultados mostram e o que fica de fora:
Os primeiros resultados saíram em 25 de agosto de 2026, no InferenceX, benchmark público operado pela SemiAnalysis
Contra um sistema Nvidia Blackwell GB300, o Jalapeño entregou:
- de 1,5x a 1,9x mais trabalho por quilowatt
- latência ponta a ponta de 1,7x a 3,6x menor
Agora as ressalvas, que são tão importantes quanto os números
O Jalapeño não foi testado contra o Vera Rubin, geração mais nova da Nvidia que começou a ser entregue
O chip não treina modelos, então a comparação nunca é maçã com maçã em relação a uma GPU de propósito geral
E quando você olha o ponto de pico de throughput no mesmo modelo, a vantagem fica em 1,7x por quilowatt
Boa parte desse número vem justamente de decisão de projeto, não de força bruta
O design mantém o KV cache local no Jalapeño e varia a proporção ativa de computação, memória e rede conforme a fase da inferência
Bloco que fica ocioso em uma fase é desligado
De novo: chip de propósito específico, otimizado pra uma carga que a equipe conhece bem
O que isso muda para quem programa e acompanha IA:
Primeiro, o mais honesto: no curto prazo, nada muda no seu acesso a modelo
Em 26 de agosto de 2026 o Jalapeño ainda não está implantado
A previsão é começar a operar na infraestrutura da OpenAI no fim de 2026, em volumes muito pequenos, com implantação mais significativa em 2027
Segundo, a ideia que dá pra levar pro seu trabalho hoje: projetar um sistema previsível o suficiente pra IA operar bem dentro dele
Comportamento explícito, contrato claro, verificação automática por perto
É a mesma lógica do chip, só que na sua base de código
Terceiro, o Gluon e o Triton são camada real de kernel, com documentação pública, que dá pra estudar agora se você quer entender como se descreve trabalho pra acelerador
E antes de sair escrevendo kernel, lembra que o mínimo pra ser um programador não mudou por causa de chip novo: continua sendo entender o que a máquina faz com o que você escreve
Quarto, o limite que a própria OpenAI registra: dar suporte a cada nova família de modelos ainda exige novos kernels e otimizações específicas do modelo
Ou seja, não virou botão mágico
O custo de portar caiu, mas não zerou
Conclusão
O Jalapeño é interessante por causa do laço: usaram IA pra ajudar a desenhar o hardware, e desenharam o hardware pra que a IA consiga programá-lo bem
Uma coisa depende da outra
Sem a previsibilidade exposta em computação, memória, comunicação e sincronização, o Codex interno não teria como escrever kernel de 3.000 linhas que ganha de especialista humano em bloco selecionado
O que dá pra acompanhar daqui pra frente:
- o roadmap multi-geração com a Broadcom, já que o Jalapeño é o primeiro e não o último
- a implantação, prevista pro fim de 2026 em volume muito pequeno e maior em 2027
- a documentação do Gluon dentro do projeto Triton, se você quer entender o modelo de programação por dentro
O resto é esperar os próximos números, de preferência contra a geração nova da Nvidia…
Até o próximo post! 🙂
Perguntas frequentes
O chip Jalapeño da OpenAI já está em produção?
Não. Em 26 de agosto de 2026 o Jalapeño ainda não está implantado. A previsão é começar a operar na infraestrutura da OpenAI no fim de 2026, em volume muito pequeno, com implantação mais significativa apenas em 2027.
O Jalapeño treina modelos de IA ou só roda inferência?
O Jalapeño é exclusivo para inferência de LLM, não treina modelos. Essa é a própria ressalva que a OpenAI registra ao comparar o chip com a Nvidia.
O Jalapeño foi comparado com a geração mais nova da Nvidia?
Não. A comparação divulgada no Hot Chips 2026 foi contra um sistema Nvidia Blackwell GB300, e o Jalapeño não foi testado contra o Vera Rubin, a geração mais nova da Nvidia que começou a ser entregue.
Qual a diferença entre Gluon e Triton na programação do Jalapeño?
Gluon é a linguagem de kernel da OpenAI construída sobre o Triton, faz parte do mesmo projeto e roda sobre a mesma pilha de compilação. A diferença é o nível: Gluon preserva o modelo SPMD do Triton, mas expõe abstrações de mais baixo nível, com destaque para a abstração de layout baseada em Linear Layouts.
Que IA escreveu os kernels do Jalapeño?
O trabalho começou human-in-the-loop e depois migrou para uma versão interna e escalada do Codex, que passou a escrever os kernels do chip, alguns com cerca de 3.000 linhas, apoiados por checagens de corretude e sanitizers customizados. Usando o Codex junto com o GPT-Astra, modelo interno citado pela SemiAnalysis, a equipe levou três modelos de pesos abertos fora do plano original de produção a alto desempenho no Jalapeño em dois meses.
O que é o benchmark InferenceX usado para testar o Jalapeño?
InferenceX é um benchmark público operado pela SemiAnalysis. Nele, divulgado em 25 de agosto de 2026 no Hot Chips 2026, o Jalapeño entregou de 1,5x a 1,9x mais trabalho por quilowatt e latência ponta a ponta de 1,7x a 3,6x menor que um sistema Nvidia Blackwell GB300.
Formações
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Blog | Mais populares
O que é o GPT-6 Astra e para que ele serve no dia a dia de quem programa?
GPT-6 Astra é o modelo mais avançado da OpenAI, com foco em coding e raciocínio complexo. Veja preço, contexto e uso no dia a dia de quem programa.
Jalapeño: por que o chip da OpenAI não obriga a escolher entre throughput e latência?
Jalapeño OpenAI é o chip de inferência feito com a Broadcom que promete throughput alto e latência baixa ao mesmo tempo. Veja os benchmarks da Hot Chips 2026.
Em quais modelos o chip Jalapeño da OpenAI foi testado? GPT-OSS 120B, DeepSeek R1 e Kimi K2.5
Jalapeño modelos testados: veja como o chip da OpenAI performou com GPT-OSS 120B, DeepSeek R1 e Kimi K2.5 contra a Nvidia.
