Jalapeño: 700 W nominais e até 550 W sustentados, o que cada número quer dizer?

Os 700 watts do Jalapeño são classificação de pacote (TDP), não consumo real. A OpenAI diz que, nas cargas testadas, a potência sustentada medida ficou em 550 W ou abaixo. O chip é um ASIC de inferência co-desenvolvido com a Broadcom, apresentado na Hot Chips 2026, e foi medido no InferenceX, benchmark público da SemiAnalysis, com GPT-OSS 120B, DeepSeek R1 670B e Kimi K2.5 1T. Os resultados publicados vão de 1,5x a 1,9x mais throughput por quilowatt contra racks Nvidia GB200 e GB300, com a vantagem encolhendo no recorte de potência all-in
Dois números do mesmo chip, duas histórias completamente diferentes: 700 W na ficha técnica, 550 W ou menos no medidor
O Jalapeño é o ASIC de inferência que a OpenAI co-desenvolveu com a Broadcom, apresentado publicamente na Hot Chips 2026
E a ficha de energia dele é, de longe, a parte mais mal lida do anúncio: gente comparando watt de projeto com watt medido como se fosse a mesma coisa
Bora destrinchar isso? 🙂
O que é o Jalapeño e para que ele serve
Formação Claude Code
Domine Claude Code do absoluto zero até o avançado
- 114 aulas
- 4 projetos
- 9h 18min
Antes dos números, o básico: o Jalapeño é um chip de inferência, feito pra SERVIR modelos de linguagem
Ele não treina modelo, esse escopo está fora
Se você conhece a diferença entre montar o motor e dirigir o carro, é mais ou menos isso: treinar é a fábrica, inferir é a estrada, e o Jalapeño nasceu pra estrada
As especificações apresentadas:
- 13,4 PFLOP/s de compute matricial mxfp4 por mxfp4
- 216 GiB de HBM4 com 15,4 TB/s de banda
- pacote de 700 watts
Em escala, a configuração de 2.048 chips chega a 27 EFLOP/s e 432 TiB, com rede de 600 GB/s no domínio local de 128 ASICs e 200 GB/s no domínio global de 2.048 ASICs
E tem um detalhe de bastidor que é meio insano: do desenho inicial até o tape-out de manufatura foram nove meses, com modelos da própria OpenAI usados em partes do projeto e da otimização
Nove meses pra um ASIC desse porte é um cronograma bem agressivo
TDP não é consumo: a diferença entre nominal e sustentado
Aqui mora a confusão toda
A classificação de pacote (o TDP) é um envelope de projeto
Ela responde uma pergunta de engenharia de infraestrutura: quanto calor e quanta corrente esse negócio pode exigir no pior caso previsto?
É com esse número que se dimensiona refrigeração, distribuição elétrica e densidade de rack
Já a potência sustentada é outra pergunta, bem mais chata de responder: quanto a peça REALMENTE puxa, rodando uma carga de verdade, por um período contínuo?
Pensa no carro de novo: o velocímetro que vai até 240 não diz nada sobre a média que tu faz na estrada
O 240 dimensiona o projeto, a média enche o tanque
Então, quando a OpenAI diz que a potência sustentada medida ficou em 550 watts ou abaixo mesmo com a classificação de 700 W, ela não está corrigindo o TDP
São duas medidas diferentes convivendo, e as duas estão certas ao mesmo tempo
Tome cuidado com um ponto, porém: esses 550 W valem para as cargas testadas divulgadas
Não é promessa universal, não é garantia de que qualquer workload vai se comportar assim
Onde os 550 W foram medidos: InferenceX e os três modelos
Os testes publicados rodaram no InferenceX, benchmark público operado pela SemiAnalysis
O que ele mede? O processo completo de atender uma requisição de IA, não um pedacinho sintético isolado
Isso importa, porque benchmark de acelerador tem uma tradição feia de medir só a parte bonita
Os modelos usados foram três, todos públicos:
- GPT-OSS 120B
- DeepSeek R1 670B
- Kimi K2.5 1T
A comparação foi feita contra os racks Nvidia GB200 e GB300
E tem um contraste que salta aos olhos: a peça de 700 W do Jalapeño foi medida contra aceleradores classificados em 1.200 W e 1.400 W
Ou seja, o ponto de partida da comparação já é de categorias de potência bem distintas
Os números que a OpenAI publicou: throughput por watt e latência
Nos três modelos testados, o Jalapeño entregou de 1,5x a 1,9x mais trabalho de IA por watt em pico de throughput do que os sistemas de comparação
E a latência ponta a ponta ficou de 1,7x a 3,6x menor
O caso mais detalhado é o do DeepSeek R1:
| Métrica (DeepSeek R1) | Jalapeño | Nvidia GB300 |
|---|---|---|
| Tokens mistos por segundo por kW | 19.641 | 11.781 |
| Latência ponta a ponta | 1,65 s | 5,99 s |
A diferença de latência é o número que mais chama atenção, sinceramente
Cair de quase 6 segundos pra 1,65 s muda a sensação de uso de um chat, não só a planilha do data center
Onde a vantagem encolhe: potência all-in e multi-token prediction
Agora a parte que separa análise de release de imprensa
Um apêndice da própria comparação usa outro recorte: potência total de utilidade por acelerador, o tal do all-in utility power
Nesse recorte são 1,18 kW para o Jalapeño contra 2,55 kW para o GB300
E aí as diferenças ficam menores
Por quê? Porque o all-in não olha só a peça, ele olha o custo elétrico de manter aquele acelerador vivo e servindo
Tem mais: contra um GB300 rodando multi-token prediction, a vantagem de eficiência em pico do Jalapeño encolhe pra cerca de 1,5x
Ainda é vantagem, mas é bem diferente do topo da faixa
E registra aí um limite de escopo importante: não houve comparação com a plataforma Vera Rubin da Nvidia
O teste é contra GB200 e GB300, ponto
O que muda para quem paga (ou paga por) inferência
A régua prática é simples de guardar
Quem dimensiona rack, refrigeração e distribuição elétrica trabalha com o nominal, porque o pior caso é o que derruba a infra
Quem projeta custo por token trabalha com o sustentado e, principalmente, com a potência all-in, porque é ela que aparece na fatura no fim do mês
Usar o número errado pro lado errado é como comprar disjuntor pela média de consumo: funciona até o dia que não funciona
E olha, isso não vira produto na mão do desenvolvedor tão cedo
A implantação inicial é na infraestrutura da própria OpenAI até o fim de 2026, em volumes pequenos, com ampliação ao longo de 2027, seguindo com aceleradores da Nvidia e de outros fornecedores
Na ponta, quem monta fluxo que chama modelo o dia inteiro (tipo esses templates de automação n8n) sente a conta pelo token que consome, não pelo watt do silício lá do outro lado da API
O watt do silício importa lá na frente, quando ele começa a mexer no preço que chega até você
E vale a honestidade: isso é anúncio de fornecedor com números do próprio fornecedor, não medição independente replicada por terceiros
Não é acusação de nada, é só a diferença entre "publicado" e "confirmado por fora"
Um extra do canal sobre IA aplicada a código
Se tu quer ver IA trabalhando dentro do teu projeto de verdade, esse vídeo do canal mostra uma skill que faz a IA ler o código e desenhar a arquitetura sozinha:
Conclusão
A lição que fica desse anúncio serve pra qualquer chip, não só pro Jalapeño
Sempre que aparecer um watt numa manchete, faz três perguntas antes de acreditar:
- esse watt é nominal (TDP), sustentado medido ou all-in?
- em qual carga ele foi medido?
- quem mediu?
No caso aqui: 700 W é a classificação de pacote, 550 W ou menos é o sustentado medido nas cargas divulgadas, e 1,18 kW é o all-in do apêndice
Três números, três significados, zero contradição entre eles
O próximo passo concreto é acompanhar medições independentes no InferenceX e o ramp de 2027, antes de tratar a vantagem de eficiência como fato consolidado
Até o próximo post! 😀
Perguntas frequentes
O Jalapeño da OpenAI realmente consome 700 watts?
Os 700 W são a classificação de pacote (TDP), o pior caso previsto pra dimensionar refrigeração e energia. Na prática, nas cargas testadas no InferenceX, a potência sustentada medida ficou em 550 watts ou abaixo disso. São duas medidas diferentes, e as duas estão certas ao mesmo tempo.
Quais modelos de IA foram usados para testar o Jalapeño?
Os testes publicados rodaram com três modelos públicos: GPT-OSS 120B, DeepSeek R1 670B e Kimi K2.5 1T. O benchmark usado foi o InferenceX, operado pela SemiAnalysis, que mede o processo completo de atender uma requisição de IA.
O Jalapeño é mais eficiente que o Nvidia GB200 e GB300?
Nos três modelos testados, o Jalapeño entregou de 1,5x a 1,9x mais throughput por watt em pico do que os racks Nvidia GB200 e GB300, com latência ponta a ponta de 1,7x a 3,6x menor. Só que a peça de 700 W foi comparada com aceleradores classificados em 1.200 W e 1.400 W, categorias de potência bem diferentes.
A vantagem de eficiência do Jalapeño se mantém em qualquer cenário?
Não. No recorte de potência all-in (utilidade total por acelerador), são 1,18 kW para o Jalapeño contra 2,55 kW para o GB300, e as diferenças ficam menores. Contra um GB300 rodando multi-token prediction, a vantagem em pico encolhe para cerca de 1,5x.
O Jalapeño serve para treinar modelos de IA como o GPT?
Não, o Jalapeño é um ASIC de inferência, feito para servir modelos já treinados, não para treinar. Esse escopo fica de fora do chip, que foi co-desenvolvido pela OpenAI com a Broadcom.
Quando o Jalapeño vai estar disponível para uso?
A OpenAI planeja começar a implantar o Jalapeño na própria infraestrutura até o fim de 2026, em volumes pequenos. A ampliação acontece ao longo de 2027, seguindo em paralelo com aceleradores da Nvidia e de outros fornecedores.
Formações
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Blog | Mais populares
Como Recuperar Conversas Apagadas no ChatGPT: É Possível?
Descubra neste artigo tudo o que você precisa saber sobre como recuperar conversas apagadas no ChatGPT, se isso é possível, quais alternativas existem para proteger […]
ChatGPT não funciona: saiba como corrigir erros
ChatGPT não funciona? O ChatGPT pode deixar de funcionar por diversos motivos, e a maioria deles está relacionada a problemas de conexão, cache ou instabilidade […]
Como limpar histórico do ChatGPT e proteger sua privacidade
Veja como limpar o histórico do ChatGPT e proteger sua privacidade de forma simples e eficaz, mantendo seus dados seguros online. Para apagar uma conversa […]
