Chip Jalapeño: o que muda nos modos ultrarrápido, rápido e em lote da inferência?

chip Jalapeño da OpenAI e Broadcom para inferência de IA
Resposta rápida

O chip Jalapeño é o primeiro ASIC de inferência da OpenAI, co-desenvolvido com a Broadcom e anunciado em 24 de junho de 2026. Em 25 de agosto de 2026, na Hot Chips 2026, saíram os primeiros resultados: 1,5x a 1,9x mais tokens mistos por segundo por quilowatt e 1,7x a 3,6x menos latência ponta a ponta que sistemas baseados em NVIDIA GB200 ou GB300. O resumo oficial fala em deslocamento entre modos: o ultrarrápido passa a rodar com a eficiência que antes só existia no rápido, e o rápido com a do modo em lote. Implantação mais significativa só em 2027.

Fala aí, beleza? A OpenAI acabou de soltar os primeiros números do chip que ela mesma desenhou, e a promessa é daquelas que fazem qualquer vibe coder levantar a sobrancelha: rodar o modo mais rápido pagando a eficiência do modo mais lento

O Jalapeño é o primeiro chip customizado de inferência da OpenAI, desenvolvido em colaboração próxima com a Broadcom e anunciado publicamente em 24 de junho de 2026

Os primeiros resultados de desempenho saíram bem depois, em 25 de agosto de 2026, apresentados na conferência Hot Chips 2026, em Stanford

E é aí que a conversa fica interessante, porque o anúncio não fala de modelo mais inteligente, fala de economia de inferência

O que é o Jalapeño e por que a OpenAI fez o próprio chip

Jalapeño é um ASIC de inferência da OpenAI co-desenvolvido com a Broadcom

Que diferença faz ser um ASIC? Significa que o chip nasceu pra fazer UMA coisa, rodar inferência, em vez de ser uma peça de propósito geral que também serve pra treino, gráficos e por aí vai

Segundo Greg Brockman, presidente da empresa, o chip foi projetado de ponta a ponta em nove meses, com apoio dos próprios modelos da OpenAI

Formação Claude Code
Formação Recomendada

Formação Claude Code

Domine Claude Code do absoluto zero até o avançado

  • 114 aulas
  • 4 projetos
  • 9h 18min

Nove meses pra um projeto de silício é o tipo de prazo que costuma virar piada interna de engenheiro de hardware, então já dá pra entender por que o anúncio chamou atenção

A arquitetura foi desenhada em torno das duas fases da inferência de LLM, que têm gargalos bem diferentes:

  • Prefill, o processamento do prompt, é dominado por computação
  • Decode, a geração token a token, pressiona a banda de memória

Se você já sofreu com aquele modelo que demora pra "começar" a responder e depois cospe texto rápido, ou o contrário, é exatamente essa assimetria batendo na sua cara

Desenhar o chip em cima dessa divisão é a aposta central do projeto

Um aviso pra evitar confusão lá na frente: desenhar o silício levando as duas fases em conta NÃO é a mesma coisa que separar prefill e decode em nós diferentes na hora de servir

São duas camadas distintas, uma é hardware, a outra é técnica de serving, e eu volto nisso na parte dos benchmarks

Ultrarrápido, rápido e em lote: as diferenças entre os modos de inferência

Antes de olhar os benchmarks, vale organizar os modos que existem hoje pra quem consome a API, porque eles são a régua mental do anúncio

Um aviso honesto: a página do Jalapeño fala em modos de inferência (ultra-fast, fast e batch), e os service tiers da API têm nomes parecidos

Não está confirmado que são exatamente a mesma coisa, então trate a tabela abaixo como o que ela é: o estado atual dos tiers da API

Modo Velocidade Custo Latência / janela Disponibilidade
Ultrafast mode Até 14x o Standard, com os mesmos pesos do modelo padrão Sem valor confirmado Até 750 tokens de saída por segundo Preview limitado, grupo selecionado de clientes, primeiro na API
Fast mode (ex-Priority) Até 2,5x a velocidade do processamento Standard 2x o preço Standard Síncrono, resposta na hora Por requisição via service_tier ou por configuração de projeto
Batch API Assíncrono, você envia e busca depois 50% de desconto em relação à API síncrona Janela de conclusão de 24 horas Disponível na API
Flex processing Respostas mais lentas que o Standard Mais barato que o Standard Síncrono, com indisponibilidade eventual de recursos Tier alternativo ao Batch e ao Standard

Dois detalhes que confundem muita gente

O primeiro: o antigo Priority processing foi renomeado para Fast mode em 30 de julho de 2026, e os valores service_tier: "priority" e service_tier: "fast" continuam funcionando

Ou seja, código antigo não quebra, mas a documentação mudou de nome debaixo do seu pé

O segundo: o Ultrafast mode foi anunciado em 13 de agosto de 2026 como tier de serviço da API para o GPT-5.6 Sol, e ele roda em hardware da Cerebras, NÃO no Jalapeño

São dois anúncios diferentes que caíram no mesmo mês e viraram uma sopa só na cabeça de muita gente

O deslocamento prometido: cada modo herda a eficiência do modo mais lento

Agora o núcleo do anúncio

A OpenAI descreve o ganho do Jalapeño como um deslocamento entre modos de inferência, em três níveis:

  1. O modo ultrarrápido passa a rodar com a eficiência que antes só existia no modo rápido
  2. O modo rápido passa a rodar com a eficiência que antes só existia no modo em lote
  3. O modo em lote também teve a própria eficiência melhorada

Repetindo a ressalva, porque aqui ela é essencial: "modo ultrarrápido" nessa lista é o vocabulário que a OpenAI usa pra descrever modos de inferência na página do Jalapeño

Não é o Ultrafast mode da API, aquele que roda na Cerebras, beleza? Nomes parecidos, coisas diferentes

Sacou a diferença? Não é "cada tier ficou um pouquinho melhor" 🙂

É a escada inteira andando um degrau: o que você pagava em eficiência pra ter velocidade some, porque a eficiência do vizinho mais lento subiu de posto

Uma analogia de aproximação: é como se o plano de entrega expressa passasse a custar o que custava a entrega normal, e a normal passasse a custar o que custava mandar por navio

A carga é a mesma, a fila é que foi reorganizada

Esse enquadramento importa porque é ele que explica por que a OpenAI investiu em silício próprio em vez de só comprar mais GPU

Os números do Jalapeño contra GB200 e GB300

O benchmark usado é o InferenceX, suíte pública operada pela SemiAnalysis, rodada sobre GPT-OSS 120B, DeepSeek R1 670B e Kimi K2.5 1T

No agregado, o Jalapeño entrega 1,5x a 1,9x mais tokens mistos por segundo por quilowatt no pico e 1,7x a 3,6x menos latência ponta a ponta que sistemas baseados em NVIDIA GB200 ou GB300

Repare no detalhe: mais throughput por quilowatt E menos latência, em vez de trocar um pelo outro

Esse intervalo é o agregado da suíte inteira, que rodou sobre três modelos

Só dois pares de números foram publicados até agora, e os dois caem acima do piso de 1,5x, então não dá pra reconstruir o piso do intervalo pela tabela abaixo

Os dois pares publicados:

Teste Jalapeño NVIDIA Latência ponta a ponta
DeepSeek R1 19.641 tokens mistos por segundo por quilowatt 11.781 no GB300 de 5,99s para 1,65s
GPT-OSS 120B 85.448 tokens mistos por segundo por quilowatt 44.960 no GB200 de 1,80s para 1,03s

E tem o dado que muda o peso da comparação: o Jalapeño testado é uma peça de 700W enfrentando aceleradores classificados em 1.200W e 1.400W

Como a métrica é por quilowatt, o consumo já está embutido na conta, mas ainda assim é uma peça de metade da classe de potência apanhando de igual pra igual

Dá para confiar nesses benchmarks?

Veredito honesto: é melhor que benchmark caseiro, e ainda assim não é auditoria independente completa

A favor: a suíte é pública e operada pela SemiAnalysis, não é uma régua inventada pela OpenAI pra medir a si mesma

Contra: a própria SemiAnalysis registra a ressalva de que todos os números vieram da OpenAI e que a verificação foi parcial

Ela verificou execuções do InferenceX presencialmente no laboratório, mas não rodou a suíte completa nem viu resultados do AgentX

Tem um detalhe técnico que joga a favor do chip, e esse é bem específico

O Jalapeño obteve esses resultados usando predição de token único (STP), sem speculative decoding e sem separação de prefill e decode

Já as configurações NVIDIA comparadas usavam multi-token prediction (MTP)

Aqui é onde aquele aviso lá do começo entra: "separação de prefill e decode" nesse contexto é a técnica de serving, distribuir cada fase em máquinas diferentes pra otimizar cada gargalo

O chip continua tendo sido desenhado levando as duas fases em conta, o que não foi usado na hora do teste foi a técnica de dividir essas fases na infraestrutura

Traduzindo: o chip da OpenAI apanhou de mãos amarradas nas otimizações e mesmo assim marcou esses números

Se as amarras caírem depois, o teto pode ser outro… mas isso é especulação minha, não dado publicado

Qual modo usar em cada tipo de carga

Beleza, e como isso vira decisão prática no seu projeto? Vamos organizar por tipo de carga

Detalhe importante antes de começar: nada aqui depende do Jalapeño, são os tiers da API como estão hoje

Agentes e interfaces que precisam de resposta imediata:

Aqui a latência é o produto

É chat ao vivo, autocomplete, agente que precisa fechar um loop na frente do usuário

O Fast mode existe exatamente pra isso: até 2,5x a velocidade do processamento Standard, por 2x o preço Standard, sem mudança de inteligência do modelo

O Ultrafast mode é o degrau acima, com até 14x a velocidade do Standard e até 750 tokens de saída por segundo, mas ainda em preview limitado

E de novo, pra não misturar: esse ganho vem do hardware da Cerebras, não do chip da OpenAI

Produção síncrona com custo controlado:

Quando a resposta precisa ser síncrona mas o usuário aguenta esperar, o Flex processing é o meio termo: mais barato, em troca de respostas mais lentas e indisponibilidade eventual de recursos

Tome cuidado com esse "indisponibilidade eventual": se o seu fluxo não tem retry, ele vai te morder num dia de pico

Processamento assíncrono em volume:

Geração de descrição pra catálogo, classificação de base histórica, enriquecimento de dados

Nada disso precisa voltar em 300ms, e o Batch API troca latência por custo de forma bem direta: 50% de desconto em relação à API síncrona, com janela de conclusão de 24 horas

Essa lógica de "o que vai por lote e o que vai por execução dedicada" não é exclusiva de API, viu? É a mesma escolha que aparece quando você decide entre subagente por tarefa ou lotes na hora de orquestrar trabalho pesado

As limitações declaradas do Fast mode:

Antes de sair trocando tudo, se liga no que está escrito na documentação:

  • Não suporta modelos fine-tuned nem embeddings
  • Suporta requisições multimodais com imagem
  • Descontos de cached input continuam valendo
  • Existem limites de rampa (ramp rate limits)

Esse primeiro item pega muita gente de surpresa: se o seu pipeline depende de um modelo fine-tuned, o Fast mode simplesmente não é uma opção pra ele

O que muda para quem usa a API da OpenAI hoje

Separando o que é presente do que é promessa

Já disponível hoje: Fast mode (ativado por requisição pelo parâmetro service_tier na Responses API ou na Chat Completions API, ou por configuração de projeto), Batch API e Flex processing

O Ultrafast mode existe, mas em preview limitado para um grupo selecionado de clientes, primeiro na API da OpenAI, com expansão conforme a capacidade crescer

Ainda preso ao cronograma do chip: a implantação do Jalapeño começa na infraestrutura da própria OpenAI até o fim de 2026, em volumes muito pequenos, com implantação mais significativa em 2027

Ou seja, o benchmark é de agora, o efeito em escala é de 2027

O que a OpenAI declara que o ganho significa pra quem consome: respostas mais rápidas, agentes mais responsivos e acesso mais confiável conforme a demanda cresce

É uma promessa de infraestrutura, e infraestrutura só aparece pro usuário final quando já está rodando há um tempo

Um complemento pra quem vive nesse dia a dia

Pra quem quer ver como essa conversa de velocidade e modo de execução aparece na prática do dia a dia com IA, esse vídeo do canal mostra as novidades do Claude Opus 4.7 dentro do Claude Code:

Conclusão

O recado do Jalapeño é sobre economia de inferência, não sobre inteligência do modelo

O chip é o primeiro ASIC de inferência da OpenAI com a Broadcom, os primeiros benchmarks saíram em 25 de agosto de 2026 na Hot Chips 2026, e a tese central é o deslocamento: cada modo herdando a eficiência do modo mais lento, com o modo em lote também melhorando por conta própria

Os números são bons e vêm de uma suíte pública, com a ressalva de que a verificação independente foi parcial

O próximo passo prático não depende de chip nenhum: abra o seu projeto e revise em qual service tier cada chamada roda hoje

Tem chamada assíncrona pagando preço de síncrona? Tem agente interativo esperando na fila do Standard?

Depois é só acompanhar a expansão do Ultrafast e a implantação do chip em 2027, e ver se a escada anda mesmo o degrau prometido

até o próximo post! 😀

Perguntas frequentes

O chip Jalapeño já está disponível para uso na API da OpenAI?

Ainda não como opção pública. A implantação começa na própria infraestrutura da OpenAI até o fim de 2026, em volumes muito pequenos, com uma implantação mais significativa prevista só para 2027.

Qual a diferença entre o chip Jalapeño e o Ultrafast mode da Cerebras?

São coisas diferentes que caíram no mesmo período. O Jalapeño é o ASIC de inferência que a OpenAI co-desenvolveu com a Broadcom, enquanto o Ultrafast mode é um tier de serviço da API para o GPT-5.6 Sol que roda em hardware da Cerebras, não no Jalapeño. Quando a página do Jalapeño fala em "modo ultrarrápido", é vocabulário de modos de inferência, não o tier da API.

Como ativar o Fast mode na API da OpenAI?

Basta passar o parâmetro service_tier com o valor "fast" na Responses API ou na Chat Completions API, por requisição, ou então configurar isso no nível do projeto. Os valores antigos "priority" continuam funcionando, já que o Fast mode é só o Priority processing renomeado em 30 de julho de 2026.

O Fast mode funciona com qualquer tipo de modelo ou requisição?

Não. Ele não suporta modelos fine-tuned nem embeddings, mas aceita requisições multimodais com imagem. Os descontos de cached input continuam valendo, e existem limites de rampa (ramp rate limits) pra quem manda muito volume de uma vez.

Quanto custa e quanto tempo leva o Batch API da OpenAI?

O Batch API dá 50% de desconto em relação à API síncrona, mas em troca você espera: a janela de conclusão é de 24 horas. É a escolha certa quando o custo pesa mais que a velocidade da resposta.

Quem confirmou os números de desempenho do Jalapeño além da própria OpenAI?

A SemiAnalysis, que opera o benchmark InferenceX usado nos testes, verificou execuções presencialmente no laboratório da OpenAI. Mas ela não rodou a suíte completa nem viu resultados do AgentX, então a checagem foi parcial, não uma auditoria independente de ponta a ponta.




Escrito por | Matheus Battisti

Matheus Battisti
Fundador da Hora de Codar

Programador apaixonado pelo mundo das tecnologias, sempre buscando em aprender e se aprofundar em linguagens, frameworks e o que mais for necessário para executar um bom trabalho. Agora tem uma nova missão que é de passar seu conhecimento adiante para formar novos programadores e especializar mais os que já são.

Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares