Em quais modelos o chip Jalapeño da OpenAI foi testado? GPT-OSS 120B, DeepSeek R1 e Kimi K2.5

A OpenAI publicou em 25/08/2026 os primeiros resultados medidos do Jalapeño, seu primeiro chip customizado de inferência. Entre os Jalapeño modelos testados estão três de pesos abertos rodados no InferenceX, benchmark da SemiAnalysis: GPT-OSS 120B (da própria OpenAI), DeepSeek R1 670B e Kimi K2.5 1T. Nos três, a empresa relata de 1,5x a 1,9x mais trabalho por watt no pico e de 1,7x a 3,6x menos latência ponta a ponta contra GB200 e GB300 da Nvidia. Os números são autorreportados e ainda sem execução independente da suíte completa
Fala aí, beleza? A OpenAI acabou de medir o primeiro chip que ela mesma projetou, e dois dos três modelos usados no teste não são da casa
No dia 25/08/2026 saíram os primeiros resultados medidos do Jalapeño, o chip customizado de inferência da empresa
E a parte que mais interessa não é o gráfico bonito, é a LISTA
Porque quando uma empresa mede o próprio silício rodando só o próprio modelo, a desconfiança é imediata: será que o chip foi afinado pra aquele grafo específico e desaba em qualquer outra coisa? A escolha dos modelos é o que responde isso
O que é o Jalapeño e o que é o InferenceX
Formação Claude Code
Domine Claude Code do absoluto zero até o avançado
- 120 aulas
- 4 projetos
- 9h 45min
O Jalapeño foi anunciado em 24/06/2026, numa parceria entre OpenAI e Broadcom, como um processador dedicado a inferência de LLM
Inferência, só pra alinhar: é a hora em que o modelo já está treinado e está lá respondendo suas requisições. Não é treino
Segundo Greg Brockman, o chip foi projetado de ponta a ponta em nove meses, com auxílio dos próprios modelos da OpenAI
Nove meses pra um chip é rápido pra caramba
E o InferenceX? É o benchmark usado na medição
Ele é operado pela SemiAnalysis, é aberto e automatizado, tem dashboard público e as execuções são auditáveis via GitHub Actions, no repositório SemiAnalysisAI/InferenceX
Ou seja: a régua não é uma planilha interna da OpenAI, é uma suíte pública que qualquer um pode ir olhar como funciona
Guarda essa distinção, porque ela volta lá embaixo 😉
Os três modelos lado a lado: quem fez, licença e tamanho
| Modelo | Quem fez | Licença / pesos | Parâmetros |
|---|---|---|---|
| GPT-OSS 120B | OpenAI | Apache 2.0 | 117B totais / 5,1B ativos por token |
| DeepSeek R1 670B | DeepSeek (China) | MIT | 671B totais / ~37B ativos |
| Kimi K2.5 1T | Moonshot AI (China) | Pesos abertos | 1T totais / ~32B ativos (Mixture of Experts) |
O GPT-OSS 120B é o modelo de pesos abertos da própria OpenAI, publicado sob Apache 2.0
Ele tem 117 bilhões de parâmetros totais, mas cerca de 5,1 bilhões ativos por token (o 120B do nome é arredondamento comercial, a contagem real é de 117 bilhões)
Esse perfil é o mais leve dos três em ativação: o hardware sofre menos com movimentação de peso por token e mais com o ritmo da geração
O DeepSeek R1 veio do laboratório chinês DeepSeek, com pesos abertos sob licença MIT, e é um Mixture of Experts de 671 bilhões de parâmetros totais com cerca de 37 bilhões ativos por passagem (no benchmark da OpenAI ele aparece listado como 670B)
Aqui a conta muda de figura: o modelo inteiro precisa estar acessível, mas só uma fatia trabalha a cada passagem
É um teste de memória e de roteamento, não só de força bruta. Se você quiser entender melhor onde cada modelo da casa se encaixa, já falamos sobre a diferença entre o R1 e o V3 por aqui
O Kimi K2.5 foi lançado pela Moonshot AI em 27/01/2026, também de pesos abertos, com 1 trilhão de parâmetros totais em arquitetura Mixture of Experts e cerca de 32 bilhões ativos
Esse é o extremo da lista: trilhão de parâmetros pra segurar, ativação pequena pra executar
Três perfis bem diferentes, e é exatamente esse o ponto de ter escolhido eles
O que os números mostraram nos três modelos
A OpenAI reporta o mesmo padrão nos três, sem exceção
- 1,5x a 1,9x mais trabalho de IA por watt no pico de throughput
- 1,7x a 3,6x menor latência ponta a ponta
- 2,1x a 4,1x mais desempenho em cargas altamente interativas
A comparação foi feita contra os sistemas GB200 e GB300 da Nvidia, da geração Blackwell
E o número que amarra a conversa de eficiência é o de potência
O TDP de pacote declarado nos testes foi de 700 W para o Jalapeño, contra 1.200 W do GB200 e 1.400 W do GB300
Mais que isso: a potência sustentada medida do Jalapeño ficou igual ou abaixo de 550 W nas cargas testadas, ou seja, abaixo do próprio TDP nominal
Esse é o tipo de dado que sustenta a alegação de trabalho por watt, e não só de velocidade bruta
Repara que os ganhos vêm em FAIXA, não em número cravado
Faixa aqui é sinal de honestidade: o comportamento varia conforme o modelo e o tipo de carga, e a empresa preferiu mostrar o intervalo
Testar em modelo de terceiros muda o peso da alegação? Sim, mas até certo ponto
Vamos ao que interessa
Rodar em dois modelos de laboratórios chineses (DeepSeek e Moonshot AI) afasta bastante a suspeita de chip costurado sob medida pro modelo da casa
A OpenAI não tem controle sobre a arquitetura do R1 nem do K2.5. Ela não escolheu como esses modelos ativam experts, como distribuem parâmetros, nada disso
E a variação de tamanho ajuda: 117B, 671B e 1T
Se o ganho aparecesse só no GPT-OSS 120B, a leitura seria completamente outra
Agora o contrapeso, sem passar pano
Os resultados são autorreportados pela OpenAI
A SemiAnalysis acompanhou as execuções presencialmente, o que já é mais do que costuma acontecer nesse tipo de anúncio, mas ainda não rodou a suíte completa de forma independente nem testou o chip no AgentX
Acompanhar não é reproduzir
Segundo ponto: a comparação parou na geração Blackwell
O Jalapeño não foi comparado à geração Vera Rubin da Nvidia, que já começou a ser enviada
Então o "bate o GB300" é verdade dentro do recorte escolhido, e o recorte não é o topo atual da linha do concorrente
Terceiro: o escopo é só inferência
O chip não endereça treinamento. Nada do que foi medido diz qualquer coisa sobre custo de treinar modelo
Juntando tudo: a lista de modelos fortalece MUITO a alegação, e a falta de execução independente da suíte completa continua sendo o buraco
O que isso muda para quem usa a API da OpenAI
Agora? Nada
O cronograma anunciado prevê implantação inicial do Jalapeño até o fim de 2026, em volumes muito pequenos, com expansão em 2027
Seu app não vai acordar amanhã mais rápido por causa disso
O que vale observar com calma:
- Como o chip é só de inferência, ele não mexe no ciclo de treino dos modelos. Qualquer expectativa de "modelo novo mais rápido por causa do chip" está olhando pro lugar errado
- A lista de modelos testados sugere um alvo mais amplo que o catálogo próprio da OpenAI. Um chip validado em GPT-OSS, DeepSeek R1 e Kimi K2.5 não parece pensado pra rodar uma família só
- O ramp de 2027 é o marco que realmente importa pra quem consome API. Antes disso, é notícia de arquitetura, não de fatura
Calma no debate do hype, beleza? A medição existe, os números são específicos, e o prazo de valer alguma coisa na prática é longo
Vídeo: como sistemas que combinam vários modelos funcionam
Falando em rodar modelos diferentes dentro do mesmo sistema, esse assunto tem um lado de software que é muito massa
Esse vídeo do canal mostra a Sakana Fugu e como esse tipo de sistema é montado
Conclusão
Recapitulando o que ficou de pé
O Jalapeño foi medido no InferenceX em três modelos de pesos abertos: GPT-OSS 120B (117B totais / 5,1B ativos, Apache 2.0), DeepSeek R1 670B (671B totais / ~37B ativos, MIT) e Kimi K2.5 1T (1T totais / ~32B ativos, da Moonshot AI)
Nos três, a OpenAI relata 1,5x a 1,9x mais trabalho por watt no pico, 1,7x a 3,6x menos latência ponta a ponta e 2,1x a 4,1x mais desempenho em cargas altamente interativas, contra GB200 e GB300, com 700 W de TDP de pacote e potência sustentada medida igual ou abaixo de 550 W
O que falta é claro: execução independente da suíte completa e comparação com a geração Vera Rubin
O próximo passo pra quem quer acompanhar sem depender de release: ficar de olho no dashboard público do InferenceX e no ramp anunciado pra 2027
Até o próximo post! 😀
Perguntas frequentes
O Jalapeño já está disponível para quem usa a API da OpenAI?
Não. O cronograma anunciado prevê implantação inicial do Jalapeño só até o fim de 2026, em volumes muito pequenos, com expansão maior em 2027. Por enquanto os resultados são só de benchmark, ninguém está rodando produção nele ainda.
Os resultados do Jalapeño foram confirmados por alguém fora da OpenAI?
Não de forma independente. A SemiAnalysis acompanhou as execuções presencialmente, mas ainda não rodou a suíte completa do InferenceX por conta própria nem testou o chip no AgentX. Os números divulgados são autorreportados pela OpenAI.
O Jalapeño foi comparado com a geração Vera Rubin da Nvidia?
Não. A comparação nos testes ficou restrita à geração Blackwell, contra o GB200 e o GB300, que já estavam no mercado. A Vera Rubin, que já começou a ser enviada pela Nvidia, não entrou no recorte
O chip Jalapeño também acelera o treinamento de modelos de IA?
Não, o escopo dele é restrito a inferência. Ou seja, ele entra na hora de responder requisições de um modelo já treinado, não no processo de treinar o modelo do zero.
Qual foi o consumo de energia real do Jalapeño nos testes, contra o TDP declarado?
O TDP de pacote declarado foi de 700 W, mas a potência sustentada medida nas cargas testadas ficou igual ou abaixo de 550 W. Esse número abaixo do próprio TDP nominal é parte do que sustenta a alegação de mais trabalho por watt.
Por que a OpenAI testou o Jalapeño em modelos de laboratórios chineses como DeepSeek e Moonshot AI?
Porque rodar em modelos que a própria OpenAI não controla afasta a suspeita de chip afinado sob medida pro modelo da casa. O DeepSeek R1 e o Kimi K2.5 têm arquitetura e tamanho bem diferentes do GPT-OSS 120B, o que dá mais peso ao padrão de ganho repetido nos três.
Formações
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Blog | Mais populares
O que é o GPT-6 Astra e para que ele serve no dia a dia de quem programa?
GPT-6 Astra é o modelo mais avançado da OpenAI, com foco em coding e raciocínio complexo. Veja preço, contexto e uso no dia a dia de quem programa.
Jalapeño: por que o chip da OpenAI não obriga a escolher entre throughput e latência?
Jalapeño OpenAI é o chip de inferência feito com a Broadcom que promete throughput alto e latência baixa ao mesmo tempo. Veja os benchmarks da Hot Chips 2026.
Chip Jalapeño: como a IA ajudou a projetar o chip da OpenAI feito para ser programado por IA
O chip Jalapeño é o primeiro chip da OpenAI, feito com a Broadcom para inferência de LLM. Veja como a IA ajudou a projetá-lo e vai programá-lo em Gluon.
