Chip Jalapeño: o que muda nos modos ultrarrápido, rápido e em lote da inferência?

O chip Jalapeño é o primeiro ASIC de inferência da OpenAI, co-desenvolvido com a Broadcom e anunciado em 24 de junho de 2026. Em 25 de agosto de 2026, na Hot Chips 2026, saíram os primeiros resultados: 1,5x a 1,9x mais tokens mistos por segundo por quilowatt e 1,7x a 3,6x menos latência ponta a ponta que sistemas baseados em NVIDIA GB200 ou GB300. O resumo oficial fala em deslocamento entre modos: o ultrarrápido passa a rodar com a eficiência que antes só existia no rápido, e o rápido com a do modo em lote. Implantação mais significativa só em 2027.
Fala aí, beleza? A OpenAI acabou de soltar os primeiros números do chip que ela mesma desenhou, e a promessa é daquelas que fazem qualquer vibe coder levantar a sobrancelha: rodar o modo mais rápido pagando a eficiência do modo mais lento
O Jalapeño é o primeiro chip customizado de inferência da OpenAI, desenvolvido em colaboração próxima com a Broadcom e anunciado publicamente em 24 de junho de 2026
Os primeiros resultados de desempenho saíram bem depois, em 25 de agosto de 2026, apresentados na conferência Hot Chips 2026, em Stanford
E é aí que a conversa fica interessante, porque o anúncio não fala de modelo mais inteligente, fala de economia de inferência
O que é o Jalapeño e por que a OpenAI fez o próprio chip
Jalapeño é um ASIC de inferência da OpenAI co-desenvolvido com a Broadcom
Que diferença faz ser um ASIC? Significa que o chip nasceu pra fazer UMA coisa, rodar inferência, em vez de ser uma peça de propósito geral que também serve pra treino, gráficos e por aí vai
Segundo Greg Brockman, presidente da empresa, o chip foi projetado de ponta a ponta em nove meses, com apoio dos próprios modelos da OpenAI
Formação Claude Code
Domine Claude Code do absoluto zero até o avançado
- 114 aulas
- 4 projetos
- 9h 18min
Nove meses pra um projeto de silício é o tipo de prazo que costuma virar piada interna de engenheiro de hardware, então já dá pra entender por que o anúncio chamou atenção
A arquitetura foi desenhada em torno das duas fases da inferência de LLM, que têm gargalos bem diferentes:
- Prefill, o processamento do prompt, é dominado por computação
- Decode, a geração token a token, pressiona a banda de memória
Se você já sofreu com aquele modelo que demora pra "começar" a responder e depois cospe texto rápido, ou o contrário, é exatamente essa assimetria batendo na sua cara
Desenhar o chip em cima dessa divisão é a aposta central do projeto
Um aviso pra evitar confusão lá na frente: desenhar o silício levando as duas fases em conta NÃO é a mesma coisa que separar prefill e decode em nós diferentes na hora de servir
São duas camadas distintas, uma é hardware, a outra é técnica de serving, e eu volto nisso na parte dos benchmarks
Ultrarrápido, rápido e em lote: as diferenças entre os modos de inferência
Antes de olhar os benchmarks, vale organizar os modos que existem hoje pra quem consome a API, porque eles são a régua mental do anúncio
Um aviso honesto: a página do Jalapeño fala em modos de inferência (ultra-fast, fast e batch), e os service tiers da API têm nomes parecidos
Não está confirmado que são exatamente a mesma coisa, então trate a tabela abaixo como o que ela é: o estado atual dos tiers da API
| Modo | Velocidade | Custo | Latência / janela | Disponibilidade |
|---|---|---|---|---|
| Ultrafast mode | Até 14x o Standard, com os mesmos pesos do modelo padrão | Sem valor confirmado | Até 750 tokens de saída por segundo | Preview limitado, grupo selecionado de clientes, primeiro na API |
| Fast mode (ex-Priority) | Até 2,5x a velocidade do processamento Standard | 2x o preço Standard | Síncrono, resposta na hora | Por requisição via service_tier ou por configuração de projeto |
| Batch API | Assíncrono, você envia e busca depois | 50% de desconto em relação à API síncrona | Janela de conclusão de 24 horas | Disponível na API |
| Flex processing | Respostas mais lentas que o Standard | Mais barato que o Standard | Síncrono, com indisponibilidade eventual de recursos | Tier alternativo ao Batch e ao Standard |
Dois detalhes que confundem muita gente
O primeiro: o antigo Priority processing foi renomeado para Fast mode em 30 de julho de 2026, e os valores service_tier: "priority" e service_tier: "fast" continuam funcionando
Ou seja, código antigo não quebra, mas a documentação mudou de nome debaixo do seu pé
O segundo: o Ultrafast mode foi anunciado em 13 de agosto de 2026 como tier de serviço da API para o GPT-5.6 Sol, e ele roda em hardware da Cerebras, NÃO no Jalapeño
São dois anúncios diferentes que caíram no mesmo mês e viraram uma sopa só na cabeça de muita gente
O deslocamento prometido: cada modo herda a eficiência do modo mais lento
Agora o núcleo do anúncio
A OpenAI descreve o ganho do Jalapeño como um deslocamento entre modos de inferência, em três níveis:
- O modo ultrarrápido passa a rodar com a eficiência que antes só existia no modo rápido
- O modo rápido passa a rodar com a eficiência que antes só existia no modo em lote
- O modo em lote também teve a própria eficiência melhorada
Repetindo a ressalva, porque aqui ela é essencial: "modo ultrarrápido" nessa lista é o vocabulário que a OpenAI usa pra descrever modos de inferência na página do Jalapeño
Não é o Ultrafast mode da API, aquele que roda na Cerebras, beleza? Nomes parecidos, coisas diferentes
Sacou a diferença? Não é "cada tier ficou um pouquinho melhor" 🙂
É a escada inteira andando um degrau: o que você pagava em eficiência pra ter velocidade some, porque a eficiência do vizinho mais lento subiu de posto
Uma analogia de aproximação: é como se o plano de entrega expressa passasse a custar o que custava a entrega normal, e a normal passasse a custar o que custava mandar por navio
A carga é a mesma, a fila é que foi reorganizada
Esse enquadramento importa porque é ele que explica por que a OpenAI investiu em silício próprio em vez de só comprar mais GPU
Os números do Jalapeño contra GB200 e GB300
O benchmark usado é o InferenceX, suíte pública operada pela SemiAnalysis, rodada sobre GPT-OSS 120B, DeepSeek R1 670B e Kimi K2.5 1T
No agregado, o Jalapeño entrega 1,5x a 1,9x mais tokens mistos por segundo por quilowatt no pico e 1,7x a 3,6x menos latência ponta a ponta que sistemas baseados em NVIDIA GB200 ou GB300
Repare no detalhe: mais throughput por quilowatt E menos latência, em vez de trocar um pelo outro
Esse intervalo é o agregado da suíte inteira, que rodou sobre três modelos
Só dois pares de números foram publicados até agora, e os dois caem acima do piso de 1,5x, então não dá pra reconstruir o piso do intervalo pela tabela abaixo
Os dois pares publicados:
| Teste | Jalapeño | NVIDIA | Latência ponta a ponta |
|---|---|---|---|
| DeepSeek R1 | 19.641 tokens mistos por segundo por quilowatt | 11.781 no GB300 | de 5,99s para 1,65s |
| GPT-OSS 120B | 85.448 tokens mistos por segundo por quilowatt | 44.960 no GB200 | de 1,80s para 1,03s |
E tem o dado que muda o peso da comparação: o Jalapeño testado é uma peça de 700W enfrentando aceleradores classificados em 1.200W e 1.400W
Como a métrica é por quilowatt, o consumo já está embutido na conta, mas ainda assim é uma peça de metade da classe de potência apanhando de igual pra igual
Dá para confiar nesses benchmarks?
Veredito honesto: é melhor que benchmark caseiro, e ainda assim não é auditoria independente completa
A favor: a suíte é pública e operada pela SemiAnalysis, não é uma régua inventada pela OpenAI pra medir a si mesma
Contra: a própria SemiAnalysis registra a ressalva de que todos os números vieram da OpenAI e que a verificação foi parcial
Ela verificou execuções do InferenceX presencialmente no laboratório, mas não rodou a suíte completa nem viu resultados do AgentX
Tem um detalhe técnico que joga a favor do chip, e esse é bem específico
O Jalapeño obteve esses resultados usando predição de token único (STP), sem speculative decoding e sem separação de prefill e decode
Já as configurações NVIDIA comparadas usavam multi-token prediction (MTP)
Aqui é onde aquele aviso lá do começo entra: "separação de prefill e decode" nesse contexto é a técnica de serving, distribuir cada fase em máquinas diferentes pra otimizar cada gargalo
O chip continua tendo sido desenhado levando as duas fases em conta, o que não foi usado na hora do teste foi a técnica de dividir essas fases na infraestrutura
Traduzindo: o chip da OpenAI apanhou de mãos amarradas nas otimizações e mesmo assim marcou esses números
Se as amarras caírem depois, o teto pode ser outro… mas isso é especulação minha, não dado publicado
Qual modo usar em cada tipo de carga
Beleza, e como isso vira decisão prática no seu projeto? Vamos organizar por tipo de carga
Detalhe importante antes de começar: nada aqui depende do Jalapeño, são os tiers da API como estão hoje
Agentes e interfaces que precisam de resposta imediata:
Aqui a latência é o produto
É chat ao vivo, autocomplete, agente que precisa fechar um loop na frente do usuário
O Fast mode existe exatamente pra isso: até 2,5x a velocidade do processamento Standard, por 2x o preço Standard, sem mudança de inteligência do modelo
O Ultrafast mode é o degrau acima, com até 14x a velocidade do Standard e até 750 tokens de saída por segundo, mas ainda em preview limitado
E de novo, pra não misturar: esse ganho vem do hardware da Cerebras, não do chip da OpenAI
Produção síncrona com custo controlado:
Quando a resposta precisa ser síncrona mas o usuário aguenta esperar, o Flex processing é o meio termo: mais barato, em troca de respostas mais lentas e indisponibilidade eventual de recursos
Tome cuidado com esse "indisponibilidade eventual": se o seu fluxo não tem retry, ele vai te morder num dia de pico
Processamento assíncrono em volume:
Geração de descrição pra catálogo, classificação de base histórica, enriquecimento de dados
Nada disso precisa voltar em 300ms, e o Batch API troca latência por custo de forma bem direta: 50% de desconto em relação à API síncrona, com janela de conclusão de 24 horas
Essa lógica de "o que vai por lote e o que vai por execução dedicada" não é exclusiva de API, viu? É a mesma escolha que aparece quando você decide entre subagente por tarefa ou lotes na hora de orquestrar trabalho pesado
As limitações declaradas do Fast mode:
Antes de sair trocando tudo, se liga no que está escrito na documentação:
- Não suporta modelos fine-tuned nem embeddings
- Suporta requisições multimodais com imagem
- Descontos de cached input continuam valendo
- Existem limites de rampa (ramp rate limits)
Esse primeiro item pega muita gente de surpresa: se o seu pipeline depende de um modelo fine-tuned, o Fast mode simplesmente não é uma opção pra ele
O que muda para quem usa a API da OpenAI hoje
Separando o que é presente do que é promessa
Já disponível hoje: Fast mode (ativado por requisição pelo parâmetro service_tier na Responses API ou na Chat Completions API, ou por configuração de projeto), Batch API e Flex processing
O Ultrafast mode existe, mas em preview limitado para um grupo selecionado de clientes, primeiro na API da OpenAI, com expansão conforme a capacidade crescer
Ainda preso ao cronograma do chip: a implantação do Jalapeño começa na infraestrutura da própria OpenAI até o fim de 2026, em volumes muito pequenos, com implantação mais significativa em 2027
Ou seja, o benchmark é de agora, o efeito em escala é de 2027
O que a OpenAI declara que o ganho significa pra quem consome: respostas mais rápidas, agentes mais responsivos e acesso mais confiável conforme a demanda cresce
É uma promessa de infraestrutura, e infraestrutura só aparece pro usuário final quando já está rodando há um tempo
Um complemento pra quem vive nesse dia a dia
Pra quem quer ver como essa conversa de velocidade e modo de execução aparece na prática do dia a dia com IA, esse vídeo do canal mostra as novidades do Claude Opus 4.7 dentro do Claude Code:
Conclusão
O recado do Jalapeño é sobre economia de inferência, não sobre inteligência do modelo
O chip é o primeiro ASIC de inferência da OpenAI com a Broadcom, os primeiros benchmarks saíram em 25 de agosto de 2026 na Hot Chips 2026, e a tese central é o deslocamento: cada modo herdando a eficiência do modo mais lento, com o modo em lote também melhorando por conta própria
Os números são bons e vêm de uma suíte pública, com a ressalva de que a verificação independente foi parcial
O próximo passo prático não depende de chip nenhum: abra o seu projeto e revise em qual service tier cada chamada roda hoje
Tem chamada assíncrona pagando preço de síncrona? Tem agente interativo esperando na fila do Standard?
Depois é só acompanhar a expansão do Ultrafast e a implantação do chip em 2027, e ver se a escada anda mesmo o degrau prometido
até o próximo post! 😀
Perguntas frequentes
O chip Jalapeño já está disponível para uso na API da OpenAI?
Ainda não como opção pública. A implantação começa na própria infraestrutura da OpenAI até o fim de 2026, em volumes muito pequenos, com uma implantação mais significativa prevista só para 2027.
Qual a diferença entre o chip Jalapeño e o Ultrafast mode da Cerebras?
São coisas diferentes que caíram no mesmo período. O Jalapeño é o ASIC de inferência que a OpenAI co-desenvolveu com a Broadcom, enquanto o Ultrafast mode é um tier de serviço da API para o GPT-5.6 Sol que roda em hardware da Cerebras, não no Jalapeño. Quando a página do Jalapeño fala em "modo ultrarrápido", é vocabulário de modos de inferência, não o tier da API.
Como ativar o Fast mode na API da OpenAI?
Basta passar o parâmetro service_tier com o valor "fast" na Responses API ou na Chat Completions API, por requisição, ou então configurar isso no nível do projeto. Os valores antigos "priority" continuam funcionando, já que o Fast mode é só o Priority processing renomeado em 30 de julho de 2026.
O Fast mode funciona com qualquer tipo de modelo ou requisição?
Não. Ele não suporta modelos fine-tuned nem embeddings, mas aceita requisições multimodais com imagem. Os descontos de cached input continuam valendo, e existem limites de rampa (ramp rate limits) pra quem manda muito volume de uma vez.
Quanto custa e quanto tempo leva o Batch API da OpenAI?
O Batch API dá 50% de desconto em relação à API síncrona, mas em troca você espera: a janela de conclusão é de 24 horas. É a escolha certa quando o custo pesa mais que a velocidade da resposta.
Quem confirmou os números de desempenho do Jalapeño além da própria OpenAI?
A SemiAnalysis, que opera o benchmark InferenceX usado nos testes, verificou execuções presencialmente no laboratório da OpenAI. Mas ela não rodou a suíte completa nem viu resultados do AgentX, então a checagem foi parcial, não uma auditoria independente de ponta a ponta.
Formações
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Blog | Mais populares
Como Recuperar Conversas Apagadas no ChatGPT: É Possível?
Descubra neste artigo tudo o que você precisa saber sobre como recuperar conversas apagadas no ChatGPT, se isso é possível, quais alternativas existem para proteger […]
ChatGPT não funciona: saiba como corrigir erros
ChatGPT não funciona? O ChatGPT pode deixar de funcionar por diversos motivos, e a maioria deles está relacionada a problemas de conexão, cache ou instabilidade […]
Como limpar histórico do ChatGPT e proteger sua privacidade
Veja como limpar o histórico do ChatGPT e proteger sua privacidade de forma simples e eficaz, mantendo seus dados seguros online. Para apagar uma conversa […]
