Em quais modelos o chip Jalapeño da OpenAI foi testado? GPT-OSS 120B, DeepSeek R1 e Kimi K2.5

chip Jalapeño da OpenAI e os modelos testados GPT-OSS 120B, DeepSeek R1 e Kimi K2.5
Resposta rápida

A OpenAI publicou em 25/08/2026 os primeiros resultados medidos do Jalapeño, seu primeiro chip customizado de inferência. Entre os Jalapeño modelos testados estão três de pesos abertos rodados no InferenceX, benchmark da SemiAnalysis: GPT-OSS 120B (da própria OpenAI), DeepSeek R1 670B e Kimi K2.5 1T. Nos três, a empresa relata de 1,5x a 1,9x mais trabalho por watt no pico e de 1,7x a 3,6x menos latência ponta a ponta contra GB200 e GB300 da Nvidia. Os números são autorreportados e ainda sem execução independente da suíte completa

Fala aí, beleza? A OpenAI acabou de medir o primeiro chip que ela mesma projetou, e dois dos três modelos usados no teste não são da casa

No dia 25/08/2026 saíram os primeiros resultados medidos do Jalapeño, o chip customizado de inferência da empresa

E a parte que mais interessa não é o gráfico bonito, é a LISTA

Porque quando uma empresa mede o próprio silício rodando só o próprio modelo, a desconfiança é imediata: será que o chip foi afinado pra aquele grafo específico e desaba em qualquer outra coisa? A escolha dos modelos é o que responde isso

O que é o Jalapeño e o que é o InferenceX

Formação Claude Code
Formação Recomendada

Formação Claude Code

Domine Claude Code do absoluto zero até o avançado

  • 120 aulas
  • 4 projetos
  • 9h 45min

O Jalapeño foi anunciado em 24/06/2026, numa parceria entre OpenAI e Broadcom, como um processador dedicado a inferência de LLM

Inferência, só pra alinhar: é a hora em que o modelo já está treinado e está lá respondendo suas requisições. Não é treino

Segundo Greg Brockman, o chip foi projetado de ponta a ponta em nove meses, com auxílio dos próprios modelos da OpenAI

Nove meses pra um chip é rápido pra caramba

E o InferenceX? É o benchmark usado na medição

Ele é operado pela SemiAnalysis, é aberto e automatizado, tem dashboard público e as execuções são auditáveis via GitHub Actions, no repositório SemiAnalysisAI/InferenceX

Ou seja: a régua não é uma planilha interna da OpenAI, é uma suíte pública que qualquer um pode ir olhar como funciona

Guarda essa distinção, porque ela volta lá embaixo 😉

Os três modelos lado a lado: quem fez, licença e tamanho

Modelo Quem fez Licença / pesos Parâmetros
GPT-OSS 120B OpenAI Apache 2.0 117B totais / 5,1B ativos por token
DeepSeek R1 670B DeepSeek (China) MIT 671B totais / ~37B ativos
Kimi K2.5 1T Moonshot AI (China) Pesos abertos 1T totais / ~32B ativos (Mixture of Experts)

O GPT-OSS 120B é o modelo de pesos abertos da própria OpenAI, publicado sob Apache 2.0

Ele tem 117 bilhões de parâmetros totais, mas cerca de 5,1 bilhões ativos por token (o 120B do nome é arredondamento comercial, a contagem real é de 117 bilhões)

Esse perfil é o mais leve dos três em ativação: o hardware sofre menos com movimentação de peso por token e mais com o ritmo da geração

O DeepSeek R1 veio do laboratório chinês DeepSeek, com pesos abertos sob licença MIT, e é um Mixture of Experts de 671 bilhões de parâmetros totais com cerca de 37 bilhões ativos por passagem (no benchmark da OpenAI ele aparece listado como 670B)

Aqui a conta muda de figura: o modelo inteiro precisa estar acessível, mas só uma fatia trabalha a cada passagem

É um teste de memória e de roteamento, não só de força bruta. Se você quiser entender melhor onde cada modelo da casa se encaixa, já falamos sobre a diferença entre o R1 e o V3 por aqui

O Kimi K2.5 foi lançado pela Moonshot AI em 27/01/2026, também de pesos abertos, com 1 trilhão de parâmetros totais em arquitetura Mixture of Experts e cerca de 32 bilhões ativos

Esse é o extremo da lista: trilhão de parâmetros pra segurar, ativação pequena pra executar

Três perfis bem diferentes, e é exatamente esse o ponto de ter escolhido eles

O que os números mostraram nos três modelos

A OpenAI reporta o mesmo padrão nos três, sem exceção

  • 1,5x a 1,9x mais trabalho de IA por watt no pico de throughput
  • 1,7x a 3,6x menor latência ponta a ponta
  • 2,1x a 4,1x mais desempenho em cargas altamente interativas

A comparação foi feita contra os sistemas GB200 e GB300 da Nvidia, da geração Blackwell

E o número que amarra a conversa de eficiência é o de potência

O TDP de pacote declarado nos testes foi de 700 W para o Jalapeño, contra 1.200 W do GB200 e 1.400 W do GB300

Mais que isso: a potência sustentada medida do Jalapeño ficou igual ou abaixo de 550 W nas cargas testadas, ou seja, abaixo do próprio TDP nominal

Esse é o tipo de dado que sustenta a alegação de trabalho por watt, e não só de velocidade bruta

Repara que os ganhos vêm em FAIXA, não em número cravado

Faixa aqui é sinal de honestidade: o comportamento varia conforme o modelo e o tipo de carga, e a empresa preferiu mostrar o intervalo

Testar em modelo de terceiros muda o peso da alegação? Sim, mas até certo ponto

Vamos ao que interessa

Rodar em dois modelos de laboratórios chineses (DeepSeek e Moonshot AI) afasta bastante a suspeita de chip costurado sob medida pro modelo da casa

A OpenAI não tem controle sobre a arquitetura do R1 nem do K2.5. Ela não escolheu como esses modelos ativam experts, como distribuem parâmetros, nada disso

E a variação de tamanho ajuda: 117B, 671B e 1T

Se o ganho aparecesse só no GPT-OSS 120B, a leitura seria completamente outra

Agora o contrapeso, sem passar pano

Os resultados são autorreportados pela OpenAI

A SemiAnalysis acompanhou as execuções presencialmente, o que já é mais do que costuma acontecer nesse tipo de anúncio, mas ainda não rodou a suíte completa de forma independente nem testou o chip no AgentX

Acompanhar não é reproduzir

Segundo ponto: a comparação parou na geração Blackwell

O Jalapeño não foi comparado à geração Vera Rubin da Nvidia, que já começou a ser enviada

Então o "bate o GB300" é verdade dentro do recorte escolhido, e o recorte não é o topo atual da linha do concorrente

Terceiro: o escopo é só inferência

O chip não endereça treinamento. Nada do que foi medido diz qualquer coisa sobre custo de treinar modelo

Juntando tudo: a lista de modelos fortalece MUITO a alegação, e a falta de execução independente da suíte completa continua sendo o buraco

O que isso muda para quem usa a API da OpenAI

Agora? Nada

O cronograma anunciado prevê implantação inicial do Jalapeño até o fim de 2026, em volumes muito pequenos, com expansão em 2027

Seu app não vai acordar amanhã mais rápido por causa disso

O que vale observar com calma:

  1. Como o chip é só de inferência, ele não mexe no ciclo de treino dos modelos. Qualquer expectativa de "modelo novo mais rápido por causa do chip" está olhando pro lugar errado
  2. A lista de modelos testados sugere um alvo mais amplo que o catálogo próprio da OpenAI. Um chip validado em GPT-OSS, DeepSeek R1 e Kimi K2.5 não parece pensado pra rodar uma família só
  3. O ramp de 2027 é o marco que realmente importa pra quem consome API. Antes disso, é notícia de arquitetura, não de fatura

Calma no debate do hype, beleza? A medição existe, os números são específicos, e o prazo de valer alguma coisa na prática é longo

Vídeo: como sistemas que combinam vários modelos funcionam

Falando em rodar modelos diferentes dentro do mesmo sistema, esse assunto tem um lado de software que é muito massa

Esse vídeo do canal mostra a Sakana Fugu e como esse tipo de sistema é montado

Conclusão

Recapitulando o que ficou de pé

O Jalapeño foi medido no InferenceX em três modelos de pesos abertos: GPT-OSS 120B (117B totais / 5,1B ativos, Apache 2.0), DeepSeek R1 670B (671B totais / ~37B ativos, MIT) e Kimi K2.5 1T (1T totais / ~32B ativos, da Moonshot AI)

Nos três, a OpenAI relata 1,5x a 1,9x mais trabalho por watt no pico, 1,7x a 3,6x menos latência ponta a ponta e 2,1x a 4,1x mais desempenho em cargas altamente interativas, contra GB200 e GB300, com 700 W de TDP de pacote e potência sustentada medida igual ou abaixo de 550 W

O que falta é claro: execução independente da suíte completa e comparação com a geração Vera Rubin

O próximo passo pra quem quer acompanhar sem depender de release: ficar de olho no dashboard público do InferenceX e no ramp anunciado pra 2027

Até o próximo post! 😀

Perguntas frequentes

O Jalapeño já está disponível para quem usa a API da OpenAI?

Não. O cronograma anunciado prevê implantação inicial do Jalapeño só até o fim de 2026, em volumes muito pequenos, com expansão maior em 2027. Por enquanto os resultados são só de benchmark, ninguém está rodando produção nele ainda.

Os resultados do Jalapeño foram confirmados por alguém fora da OpenAI?

Não de forma independente. A SemiAnalysis acompanhou as execuções presencialmente, mas ainda não rodou a suíte completa do InferenceX por conta própria nem testou o chip no AgentX. Os números divulgados são autorreportados pela OpenAI.

O Jalapeño foi comparado com a geração Vera Rubin da Nvidia?

Não. A comparação nos testes ficou restrita à geração Blackwell, contra o GB200 e o GB300, que já estavam no mercado. A Vera Rubin, que já começou a ser enviada pela Nvidia, não entrou no recorte

O chip Jalapeño também acelera o treinamento de modelos de IA?

Não, o escopo dele é restrito a inferência. Ou seja, ele entra na hora de responder requisições de um modelo já treinado, não no processo de treinar o modelo do zero.

Qual foi o consumo de energia real do Jalapeño nos testes, contra o TDP declarado?

O TDP de pacote declarado foi de 700 W, mas a potência sustentada medida nas cargas testadas ficou igual ou abaixo de 550 W. Esse número abaixo do próprio TDP nominal é parte do que sustenta a alegação de mais trabalho por watt.

Por que a OpenAI testou o Jalapeño em modelos de laboratórios chineses como DeepSeek e Moonshot AI?

Porque rodar em modelos que a própria OpenAI não controla afasta a suspeita de chip afinado sob medida pro modelo da casa. O DeepSeek R1 e o Kimi K2.5 têm arquitetura e tamanho bem diferentes do GPT-OSS 120B, o que dá mais peso ao padrão de ganho repetido nos três.




Escrito por | Matheus Battisti

Matheus Battisti
Fundador da Hora de Codar

Programador apaixonado pelo mundo das tecnologias, sempre buscando em aprender e se aprofundar em linguagens, frameworks e o que mais for necessário para executar um bom trabalho. Agora tem uma nova missão que é de passar seu conhecimento adiante para formar novos programadores e especializar mais os que já são.

Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares