Chip Jalapeño: como a IA ajudou a projetar o chip da OpenAI feito para ser programado por IA

Chip Jalapeño da OpenAI, projetado com apoio de IA para inferência de LLM
Resposta rápida

O chip Jalapeño é o primeiro chip próprio da OpenAI, feito em parceria com a Broadcom e voltado só para inferência de LLM, anunciado em 24 de junho de 2026. O ângulo mais interessante não é benchmark: a IA participou do projeto do próprio chip, explorando implementações, encurtando a verificação e otimizando circuitos aritméticos com um modelo interno e a toolchain XLS. E o hardware foi desenhado como alvo de programação previsível justamente para que a IA também escreva os kernels, em Gluon, linguagem construída sobre o Triton. Os primeiros resultados saíram no Hot Chips 2026, mas o chip ainda não está implantado

Fala aí, beleza? A OpenAI fez uma coisa que parece piada de recursão: usou IA pra ajudar a projetar um chip, e projetou esse chip pra ser programado por IA 😀

O Jalapeño foi anunciado em 24 de junho de 2026, co-desenvolvido com a Broadcom, e é o primeiro chip customizado da OpenAI, exclusivo para inferência de LLM

Tem muito post por aí só comparando número contra a Nvidia

Esse aqui é outro recorte: bastidor de engenharia

O que interessa é a escolha de projeto, a IA dentro do fluxo de design e o motivo de terem desenhado o hardware como um alvo de programação previsível

Bora entender?

O anúncio e o que já se sabe do chip:

A linha do tempo é curta e vale ter na cabeça

Em 24 de junho de 2026 a OpenAI e a Broadcom apresentaram o Jalapeño como um Intelligence Processor voltado a inferência de LLM, o primeiro chip próprio da casa

Em 25 de agosto de 2026, no Hot Chips 2026, saíram os primeiros resultados e os detalhes de engenharia

Formação Claude Code
Formação Recomendada

Formação Claude Code

Domine Claude Code do absoluto zero até o avançado

  • 114 aulas
  • 4 projetos
  • 9h 18min

A parceria com a Broadcom é descrita como uma plataforma de computação multi-geração, ou seja, tem roadmap além do Jalapeño

As especificações divulgadas:

  • 13,4 PFLOP/s de computação matricial mxfp4 por mxfp4
  • 216 GiB de HBM4
  • 15,4 TB/s de banda, em seis stacks
  • pacote de 700 W

Repara num detalhe que muda todo o resto do texto: o chip é só de inferência

Ele não treina modelos

Todo o projeto foi feito olhando pra uma carga de trabalho específica, e é aí que a história de engenharia começa a ficar massa

Como a IA entrou no projeto do próprio chip:

Aqui não é marketing genérico de "usamos IA no processo"

A OpenAI descreve papéis bem concretos da IA no desenvolvimento do Jalapeño:

  • explorou implementações possíveis
  • encurtou os laços de design, medição e verificação
  • iterou continuamente sobre cargas de trabalho de modelos
  • ajudou a otimizar os circuitos aritméticos do chip

Pra isso, a equipe usou um modelo de IA interno próprio junto com a XLS no fluxo de design de hardware

E o que é XLS?

É uma toolchain open source criada pelo Google, o XLS (Accelerated HW Synthesis), que gera designs sintetizáveis (RTL em Verilog ou SystemVerilog) a partir de descrições de alto nível, e que inclui uma DSL própria, a DSLX

Se você conhece a ideia de escrever em uma linguagem mais alta e deixar um compilador cuspir o código de baixo nível, é bem esse espírito, só que a saída é descrição de circuito em vez de binário

E isso importa MUITO pro assunto do post

Descrição de alto nível é território onde um modelo de linguagem se vira bem

Traduzir intenção em RTL correto e sintetizável é o tipo de trabalho braçal e cheio de armadilha que a toolchain resolve melhor que a mão humana repetindo o mesmo padrão

O ciclo curto de medir, verificar e mudar:

O fluxo que a OpenAI enfatiza é quase um mantra: medir, verificar, aprender, mudar e repetir

A sacada é encurtar o feedback entre etapas que normalmente vivem separadas:

  • simulação de carga
  • RTL
  • análise de qualidade de resultados
  • verificação
  • design físico

Em projeto de chip, essas fases costumam ser sequenciais e pesadas

Quando o ciclo é longo, você congela decisão cedo com medo de quebrar o cronograma

Com o laço curto, a equipe conseguiu aceitar mudanças relevantes até o dia do congelamento do RTL

Isso é o tipo de coisa que soa detalhe e é justamente onde mora o resultado

O chip foi co-desenvolvido do design inicial até o tape-out de fabricação em nove meses

Nove meses, com mudança entrando até o RTL freeze

É um ritmo de desenvolvimento de software aplicado a silício, e é o que explica o resto da história

IA contra a baseline humana: os números apresentados

Os ganhos abaixo foram apresentados pela própria OpenAI no Hot Chips 2026, medidos contra uma baseline humana

Vale ler com esse rótulo na testa: são números da empresa que fez o chip

O que foi medido Ganho apresentado Comparado com
Multiplicador BF16 (PPA) 56% baseline humana
Unidade de matriz (área) 10% menor baseline humana
Kernels de blocos selecionados de attention e MoE 1,5x a 1,8x mais rápido código já existente escrito por engenheiros humanos especialistas

O recado dos dois primeiros: a IA mexeu no circuito aritmético, na parte mais "hardware" da coisa

O recado do terceiro: a IA também escreveu o software que roda em cima

É o mesmo modelo de trabalho atacando as duas pontas

Por que o chip foi desenhado como alvo de programação previsível?

Esse é o coração do assunto, e é a decisão de projeto mais interessante do Jalapeño

Computação, memória, comunicação e sincronização foram expostas como um alvo de programação claro e previsível, para humanos e para IA

Na prática, o engenheiro descreve o trabalho por tensores locais, comunicação explícita e sincronização previsível

Nada de mágica escondida embaixo do tapete

E por que fazer isso?

A tese da OpenAI é direta: programação paralela é um problema historicamente difícil, e uma estrutura clara e previsível é o que dá à IA uma forma tratável de atacar esse problema

Com o comportamento do hardware previsível, a IA passa a otimizar o que realmente rende: como o trabalho é mapeado, alocado, agendado e coordenado no sistema

Pensa no contrário pra sentir o peso

Um alvo cheio de comportamento implícito e heurística escondida é um pesadelo até pra humano especialista

Pra um modelo gerando código, é pior ainda: ele não tem como raciocinar sobre o que não está exposto

Previsibilidade aqui não é conservadorismo, é pré-condição

Gluon, Codex e os kernels do Jalapeño:

Na prática, o Jalapeño é programado com Gluon, a linguagem de kernel da OpenAI construída sobre o Triton

O Gluon é de nível mais baixo que o Triton, preserva o modelo SPMD e expõe abstrações de baixo nível, com destaque pra abstração de layout baseada em Linear Layouts

E ele não é um projeto solto: faz parte do projeto Triton, roda sobre a mesma pilha de compilação, tem tutorial oficial do Gluon e código no repositório triton-lang/triton

Do lado do chip, a arquitetura é espacial

O Gluon programa cada core físico como um thread block, com engines tensor, SIMD e escalar organizadas em torno de uma memória local rápida

E a informação de layout captura explicitamente a posição física

Ou seja: onde o dado está no chip é parte do que você escreve, não um detalhe que o compilador esconde de você

Agora a parte que mais me chamou atenção

O trabalho inicial de kernels foi human-in-the-loop

Depois migrou pra uma versão interna e escalada do Codex, que escreve kernels do Jalapeño

Alguns desses kernels chegam a cerca de 3.000 linhas, apoiados por checagens de corretude e sanitizers customizados

Se você acompanha as tarefas de código que a IA toca sozinha, é o mesmo padrão levado ao extremo: o modelo escreve, e o que segura a peteca é a camada de verificação em volta

E tem o caso mais concreto de todos: usando o Codex com o GPT-Astra, modelo interno citado pela SemiAnalysis, a equipe levou três modelos de pesos abertos que não estavam no plano original de produção a alto desempenho no Jalapeño em dois meses

Essa é a prova de conceito real da ideia toda

Não é "a IA ajudou"

É portar carga que não estava prevista, em dois meses, num chip novo

O que os primeiros resultados mostram e o que fica de fora:

Os primeiros resultados saíram em 25 de agosto de 2026, no InferenceX, benchmark público operado pela SemiAnalysis

Contra um sistema Nvidia Blackwell GB300, o Jalapeño entregou:

  • de 1,5x a 1,9x mais trabalho por quilowatt
  • latência ponta a ponta de 1,7x a 3,6x menor

Agora as ressalvas, que são tão importantes quanto os números

O Jalapeño não foi testado contra o Vera Rubin, geração mais nova da Nvidia que começou a ser entregue

O chip não treina modelos, então a comparação nunca é maçã com maçã em relação a uma GPU de propósito geral

E quando você olha o ponto de pico de throughput no mesmo modelo, a vantagem fica em 1,7x por quilowatt

Boa parte desse número vem justamente de decisão de projeto, não de força bruta

O design mantém o KV cache local no Jalapeño e varia a proporção ativa de computação, memória e rede conforme a fase da inferência

Bloco que fica ocioso em uma fase é desligado

De novo: chip de propósito específico, otimizado pra uma carga que a equipe conhece bem

O que isso muda para quem programa e acompanha IA:

Primeiro, o mais honesto: no curto prazo, nada muda no seu acesso a modelo

Em 26 de agosto de 2026 o Jalapeño ainda não está implantado

A previsão é começar a operar na infraestrutura da OpenAI no fim de 2026, em volumes muito pequenos, com implantação mais significativa em 2027

Segundo, a ideia que dá pra levar pro seu trabalho hoje: projetar um sistema previsível o suficiente pra IA operar bem dentro dele

Comportamento explícito, contrato claro, verificação automática por perto

É a mesma lógica do chip, só que na sua base de código

Terceiro, o Gluon e o Triton são camada real de kernel, com documentação pública, que dá pra estudar agora se você quer entender como se descreve trabalho pra acelerador

E antes de sair escrevendo kernel, lembra que o mínimo pra ser um programador não mudou por causa de chip novo: continua sendo entender o que a máquina faz com o que você escreve

Quarto, o limite que a própria OpenAI registra: dar suporte a cada nova família de modelos ainda exige novos kernels e otimizações específicas do modelo

Ou seja, não virou botão mágico

O custo de portar caiu, mas não zerou

Conclusão

O Jalapeño é interessante por causa do laço: usaram IA pra ajudar a desenhar o hardware, e desenharam o hardware pra que a IA consiga programá-lo bem

Uma coisa depende da outra

Sem a previsibilidade exposta em computação, memória, comunicação e sincronização, o Codex interno não teria como escrever kernel de 3.000 linhas que ganha de especialista humano em bloco selecionado

O que dá pra acompanhar daqui pra frente:

  • o roadmap multi-geração com a Broadcom, já que o Jalapeño é o primeiro e não o último
  • a implantação, prevista pro fim de 2026 em volume muito pequeno e maior em 2027
  • a documentação do Gluon dentro do projeto Triton, se você quer entender o modelo de programação por dentro

O resto é esperar os próximos números, de preferência contra a geração nova da Nvidia…

Até o próximo post! 🙂

Perguntas frequentes

O chip Jalapeño da OpenAI já está em produção?

Não. Em 26 de agosto de 2026 o Jalapeño ainda não está implantado. A previsão é começar a operar na infraestrutura da OpenAI no fim de 2026, em volume muito pequeno, com implantação mais significativa apenas em 2027.

O Jalapeño treina modelos de IA ou só roda inferência?

O Jalapeño é exclusivo para inferência de LLM, não treina modelos. Essa é a própria ressalva que a OpenAI registra ao comparar o chip com a Nvidia.

O Jalapeño foi comparado com a geração mais nova da Nvidia?

Não. A comparação divulgada no Hot Chips 2026 foi contra um sistema Nvidia Blackwell GB300, e o Jalapeño não foi testado contra o Vera Rubin, a geração mais nova da Nvidia que começou a ser entregue.

Qual a diferença entre Gluon e Triton na programação do Jalapeño?

Gluon é a linguagem de kernel da OpenAI construída sobre o Triton, faz parte do mesmo projeto e roda sobre a mesma pilha de compilação. A diferença é o nível: Gluon preserva o modelo SPMD do Triton, mas expõe abstrações de mais baixo nível, com destaque para a abstração de layout baseada em Linear Layouts.

Que IA escreveu os kernels do Jalapeño?

O trabalho começou human-in-the-loop e depois migrou para uma versão interna e escalada do Codex, que passou a escrever os kernels do chip, alguns com cerca de 3.000 linhas, apoiados por checagens de corretude e sanitizers customizados. Usando o Codex junto com o GPT-Astra, modelo interno citado pela SemiAnalysis, a equipe levou três modelos de pesos abertos fora do plano original de produção a alto desempenho no Jalapeño em dois meses.

O que é o benchmark InferenceX usado para testar o Jalapeño?

InferenceX é um benchmark público operado pela SemiAnalysis. Nele, divulgado em 25 de agosto de 2026 no Hot Chips 2026, o Jalapeño entregou de 1,5x a 1,9x mais trabalho por quilowatt e latência ponta a ponta de 1,7x a 3,6x menor que um sistema Nvidia Blackwell GB300.



Escrito por | Matheus Battisti

Matheus Battisti
Fundador da Hora de Codar

Programador apaixonado pelo mundo das tecnologias, sempre buscando em aprender e se aprofundar em linguagens, frameworks e o que mais for necessário para executar um bom trabalho. Agora tem uma nova missão que é de passar seu conhecimento adiante para formar novos programadores e especializar mais os que já são.

Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares