Jalapeño: 700 W nominais e até 550 W sustentados, o que cada número quer dizer?

ficha técnica do chip Jalapeño mostrando 700 watts nominais e potência sustentada
Resposta rápida

Os 700 watts do Jalapeño são classificação de pacote (TDP), não consumo real. A OpenAI diz que, nas cargas testadas, a potência sustentada medida ficou em 550 W ou abaixo. O chip é um ASIC de inferência co-desenvolvido com a Broadcom, apresentado na Hot Chips 2026, e foi medido no InferenceX, benchmark público da SemiAnalysis, com GPT-OSS 120B, DeepSeek R1 670B e Kimi K2.5 1T. Os resultados publicados vão de 1,5x a 1,9x mais throughput por quilowatt contra racks Nvidia GB200 e GB300, com a vantagem encolhendo no recorte de potência all-in

Dois números do mesmo chip, duas histórias completamente diferentes: 700 W na ficha técnica, 550 W ou menos no medidor

O Jalapeño é o ASIC de inferência que a OpenAI co-desenvolveu com a Broadcom, apresentado publicamente na Hot Chips 2026

E a ficha de energia dele é, de longe, a parte mais mal lida do anúncio: gente comparando watt de projeto com watt medido como se fosse a mesma coisa

Bora destrinchar isso? 🙂

O que é o Jalapeño e para que ele serve

Formação Claude Code
Formação Recomendada

Formação Claude Code

Domine Claude Code do absoluto zero até o avançado

  • 114 aulas
  • 4 projetos
  • 9h 18min

Antes dos números, o básico: o Jalapeño é um chip de inferência, feito pra SERVIR modelos de linguagem

Ele não treina modelo, esse escopo está fora

Se você conhece a diferença entre montar o motor e dirigir o carro, é mais ou menos isso: treinar é a fábrica, inferir é a estrada, e o Jalapeño nasceu pra estrada

As especificações apresentadas:

  • 13,4 PFLOP/s de compute matricial mxfp4 por mxfp4
  • 216 GiB de HBM4 com 15,4 TB/s de banda
  • pacote de 700 watts

Em escala, a configuração de 2.048 chips chega a 27 EFLOP/s e 432 TiB, com rede de 600 GB/s no domínio local de 128 ASICs e 200 GB/s no domínio global de 2.048 ASICs

E tem um detalhe de bastidor que é meio insano: do desenho inicial até o tape-out de manufatura foram nove meses, com modelos da própria OpenAI usados em partes do projeto e da otimização

Nove meses pra um ASIC desse porte é um cronograma bem agressivo

TDP não é consumo: a diferença entre nominal e sustentado

Aqui mora a confusão toda

A classificação de pacote (o TDP) é um envelope de projeto

Ela responde uma pergunta de engenharia de infraestrutura: quanto calor e quanta corrente esse negócio pode exigir no pior caso previsto?

É com esse número que se dimensiona refrigeração, distribuição elétrica e densidade de rack

Já a potência sustentada é outra pergunta, bem mais chata de responder: quanto a peça REALMENTE puxa, rodando uma carga de verdade, por um período contínuo?

Pensa no carro de novo: o velocímetro que vai até 240 não diz nada sobre a média que tu faz na estrada

O 240 dimensiona o projeto, a média enche o tanque

Então, quando a OpenAI diz que a potência sustentada medida ficou em 550 watts ou abaixo mesmo com a classificação de 700 W, ela não está corrigindo o TDP

São duas medidas diferentes convivendo, e as duas estão certas ao mesmo tempo

Tome cuidado com um ponto, porém: esses 550 W valem para as cargas testadas divulgadas

Não é promessa universal, não é garantia de que qualquer workload vai se comportar assim

Onde os 550 W foram medidos: InferenceX e os três modelos

Os testes publicados rodaram no InferenceX, benchmark público operado pela SemiAnalysis

O que ele mede? O processo completo de atender uma requisição de IA, não um pedacinho sintético isolado

Isso importa, porque benchmark de acelerador tem uma tradição feia de medir só a parte bonita

Os modelos usados foram três, todos públicos:

  • GPT-OSS 120B
  • DeepSeek R1 670B
  • Kimi K2.5 1T

A comparação foi feita contra os racks Nvidia GB200 e GB300

E tem um contraste que salta aos olhos: a peça de 700 W do Jalapeño foi medida contra aceleradores classificados em 1.200 W e 1.400 W

Ou seja, o ponto de partida da comparação já é de categorias de potência bem distintas

Os números que a OpenAI publicou: throughput por watt e latência

Nos três modelos testados, o Jalapeño entregou de 1,5x a 1,9x mais trabalho de IA por watt em pico de throughput do que os sistemas de comparação

E a latência ponta a ponta ficou de 1,7x a 3,6x menor

O caso mais detalhado é o do DeepSeek R1:

Métrica (DeepSeek R1) Jalapeño Nvidia GB300
Tokens mistos por segundo por kW 19.641 11.781
Latência ponta a ponta 1,65 s 5,99 s

A diferença de latência é o número que mais chama atenção, sinceramente

Cair de quase 6 segundos pra 1,65 s muda a sensação de uso de um chat, não só a planilha do data center

Onde a vantagem encolhe: potência all-in e multi-token prediction

Agora a parte que separa análise de release de imprensa

Um apêndice da própria comparação usa outro recorte: potência total de utilidade por acelerador, o tal do all-in utility power

Nesse recorte são 1,18 kW para o Jalapeño contra 2,55 kW para o GB300

E aí as diferenças ficam menores

Por quê? Porque o all-in não olha só a peça, ele olha o custo elétrico de manter aquele acelerador vivo e servindo

Tem mais: contra um GB300 rodando multi-token prediction, a vantagem de eficiência em pico do Jalapeño encolhe pra cerca de 1,5x

Ainda é vantagem, mas é bem diferente do topo da faixa

E registra aí um limite de escopo importante: não houve comparação com a plataforma Vera Rubin da Nvidia

O teste é contra GB200 e GB300, ponto

O que muda para quem paga (ou paga por) inferência

A régua prática é simples de guardar

Quem dimensiona rack, refrigeração e distribuição elétrica trabalha com o nominal, porque o pior caso é o que derruba a infra

Quem projeta custo por token trabalha com o sustentado e, principalmente, com a potência all-in, porque é ela que aparece na fatura no fim do mês

Usar o número errado pro lado errado é como comprar disjuntor pela média de consumo: funciona até o dia que não funciona

E olha, isso não vira produto na mão do desenvolvedor tão cedo

A implantação inicial é na infraestrutura da própria OpenAI até o fim de 2026, em volumes pequenos, com ampliação ao longo de 2027, seguindo com aceleradores da Nvidia e de outros fornecedores

Na ponta, quem monta fluxo que chama modelo o dia inteiro (tipo esses templates de automação n8n) sente a conta pelo token que consome, não pelo watt do silício lá do outro lado da API

O watt do silício importa lá na frente, quando ele começa a mexer no preço que chega até você

E vale a honestidade: isso é anúncio de fornecedor com números do próprio fornecedor, não medição independente replicada por terceiros

Não é acusação de nada, é só a diferença entre "publicado" e "confirmado por fora"

Um extra do canal sobre IA aplicada a código

Se tu quer ver IA trabalhando dentro do teu projeto de verdade, esse vídeo do canal mostra uma skill que faz a IA ler o código e desenhar a arquitetura sozinha:

Conclusão

A lição que fica desse anúncio serve pra qualquer chip, não só pro Jalapeño

Sempre que aparecer um watt numa manchete, faz três perguntas antes de acreditar:

  1. esse watt é nominal (TDP), sustentado medido ou all-in?
  2. em qual carga ele foi medido?
  3. quem mediu?

No caso aqui: 700 W é a classificação de pacote, 550 W ou menos é o sustentado medido nas cargas divulgadas, e 1,18 kW é o all-in do apêndice

Três números, três significados, zero contradição entre eles

O próximo passo concreto é acompanhar medições independentes no InferenceX e o ramp de 2027, antes de tratar a vantagem de eficiência como fato consolidado

Até o próximo post! 😀

Perguntas frequentes

O Jalapeño da OpenAI realmente consome 700 watts?

Os 700 W são a classificação de pacote (TDP), o pior caso previsto pra dimensionar refrigeração e energia. Na prática, nas cargas testadas no InferenceX, a potência sustentada medida ficou em 550 watts ou abaixo disso. São duas medidas diferentes, e as duas estão certas ao mesmo tempo.

Quais modelos de IA foram usados para testar o Jalapeño?

Os testes publicados rodaram com três modelos públicos: GPT-OSS 120B, DeepSeek R1 670B e Kimi K2.5 1T. O benchmark usado foi o InferenceX, operado pela SemiAnalysis, que mede o processo completo de atender uma requisição de IA.

O Jalapeño é mais eficiente que o Nvidia GB200 e GB300?

Nos três modelos testados, o Jalapeño entregou de 1,5x a 1,9x mais throughput por watt em pico do que os racks Nvidia GB200 e GB300, com latência ponta a ponta de 1,7x a 3,6x menor. Só que a peça de 700 W foi comparada com aceleradores classificados em 1.200 W e 1.400 W, categorias de potência bem diferentes.

A vantagem de eficiência do Jalapeño se mantém em qualquer cenário?

Não. No recorte de potência all-in (utilidade total por acelerador), são 1,18 kW para o Jalapeño contra 2,55 kW para o GB300, e as diferenças ficam menores. Contra um GB300 rodando multi-token prediction, a vantagem em pico encolhe para cerca de 1,5x.

O Jalapeño serve para treinar modelos de IA como o GPT?

Não, o Jalapeño é um ASIC de inferência, feito para servir modelos já treinados, não para treinar. Esse escopo fica de fora do chip, que foi co-desenvolvido pela OpenAI com a Broadcom.

Quando o Jalapeño vai estar disponível para uso?

A OpenAI planeja começar a implantar o Jalapeño na própria infraestrutura até o fim de 2026, em volumes pequenos. A ampliação acontece ao longo de 2027, seguindo em paralelo com aceleradores da Nvidia e de outros fornecedores.




Escrito por | Matheus Battisti

Matheus Battisti
Fundador da Hora de Codar

Programador apaixonado pelo mundo das tecnologias, sempre buscando em aprender e se aprofundar em linguagens, frameworks e o que mais for necessário para executar um bom trabalho. Agora tem uma nova missão que é de passar seu conhecimento adiante para formar novos programadores e especializar mais os que já são.

Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares