OpenAI Jalapeño: o chip que desafia a Nvidia em eficiência de inferência
OpenAI divulga benchmarks do Jalapeño: chip próprio entrega até 1,9x mais trabalho por watt e latência 3,6x menor que o Blackwell da Nvidia.

O dia em que a OpenAI entrou no negócio de silício
Em 25 de agosto de 2026, a OpenAI publicou em seu blog oficial os primeiros resultados de benchmark do Jalapeño, seu chip de inferência desenvolvido em parceria com a Broadcom (NASDAQ: AVGO). No dia seguinte, 26 de agosto, os números foram apresentados no Hot Chips, conferência realizada na Universidade de Stanford — um palco historicamente reservado a grandes fabricantes de semicondutores. A mensagem era inequívoca: a OpenAI não é mais apenas uma empresa de modelos. Ela agora compete na camada de silício.
Isso muda o jogo. Não porque o Jalapeño torne a Nvidia obsoleta — não torna, pelo menos não ainda. Mas porque demonstra, pela primeira vez com números verificáveis, que um hyperscaler pode projetar hardware de inferência competitivo com o líder absoluto do mercado. Para quem opera negócios que dependem de APIs de IA, isso importa diretamente na equação de custo por token.
O que é o Jalapeño e como ele foi construído
O Jalapeño é o primeiro chip customizado da OpenAI, projetado exclusivamente para inferência de LLMs — ou seja, para rodar modelos já treinados, não para treiná-los. A distinção é importante: treinamento ainda é território da Nvidia, com seus clusters de GPUs Blackwell. O Jalapeño mira o outro lado da operação: a entrega de respostas em tempo real para usuários e agentes.
O projeto teve início em meados de 2024. A parceria com a Broadcom foi divulgada em outubro de 2025, e o programa de chip foi formalmente apresentado em junho de 2026, descrito pela própria OpenAI como construído "do zero para LLMs atuais e futuros em toda a indústria." Da contratação inicial da equipe até o tape-out de fabricação, o processo levou aproximadamente 16 meses — um ritmo notavelmente agressivo para o setor de semicondutores. A própria OpenAI utilizou seus modelos para auxiliar no desenvolvimento do chip.
Um detalhe técnico que merece atenção: os benchmarks publicados foram feitos com o stepping A0 do silício — uma amostra de engenharia. A versão atual em fabricação é o stepping B0, que oferece aproximadamente 25% mais desempenho por watt que o A0 testado. Os números divulgados já são, na prática, conservadores em relação ao que estará disponível em produção.
Especificações que definem o posicionamento
O Jalapeño B0, em um único die do tamanho de um reticle, entrega 13,4 PFLOPs de computação em MXFP4, fabricado no processo TSMC N3P para o die de computação e TSMC N3E para o chiplet de I/O. O TDP nominal é de 700 watts, mas os workloads testados sustentaram consumo médio em ou abaixo de 550 watts.
A escolha de memória é estratégica: o chip usa HBM4, com 216 gigabytes por acelerador e largura de banda de 15,4 TB/s por pacote — o que, segundo a análise da SemiAnalysis, supera todos os aceleradores que atualmente utilizam HBM3E. A OpenAI está entre os primeiros adotantes de HBM4 no mercado, ao lado de Nvidia e AMD, e à frente dos programas TPU e Trainium.
Em escala de rack com 128 chips, o sistema entrega 1,7 exaflops de computação 4-bit e 27,5 terabytes de memória HBM4. O pod completo suporta até 2.048 ASICs em domínio de scale-up global multi-rack.
Os benchmarks: o que os números dizem — e o que não dizem
A metodologia usada foi o SemiAnalysis InferenceX, um benchmark público que mede o ciclo completo de atendimento de uma requisição de IA de ponta a ponta. Analistas da SemiAnalysis estiveram fisicamente nos laboratórios da OpenAI para observar as medições — o que confere credibilidade direcional aos resultados, ainda que os números sejam auto-reportados pela OpenAI.
Os três modelos testados, com seus respectivos sistemas de comparação da Nvidia:
- GPT-OSS 120B (vs. Nvidia GB200): throughput por kW ~1,9x maior; latência reduzida de 1,80 s para 1,03 s — melhora de 1,7x. O modelo atingiu aproximadamente 1.400 tokens por segundo por usuário.
- DeepSeek R1 670B (vs. Nvidia GB300): throughput por kW ~1,7x maior; latência caiu de 5,99 s para 1,65 s — melhora de 3,6x. O chip superou 700 tokens por segundo por usuário com concorrência 1.
- Kimi K2.5 1T (vs. Nvidia GB300): throughput por watt ~1,5x maior; latência de 5,31 s para 1,56 s — melhora de 3,4x.
Para workloads altamente interativos — o perfil do ChatGPT e de agentes de IA — a vantagem foi ainda maior: 2,1x a 4,1x de ganho de performance.
A ressalva que não pode ser ignorada
A própria SemiAnalysis flagou que a comparação é parcialmente incompleta e injusta: o Jalapeño usa HBM4, enquanto os sistemas GB200 e GB300 da Nvidia operam com HBM3E — memória de geração anterior. A comparação mais equilibrada seria contra a plataforma Nvidia Vera Rubin, ainda não amplamente disponível. O Rubin tem TDP de 900 W a 1.150 W por die e entrega 17,5 PFLOPs em NVFP4 denso — contra os 13,4 PFLOPs do Jalapeño B0 em MXFP4. Em custo por token, uma análise da financefeeds.com aponta equivalência "praticamente igual" entre os dois, com o Jalapeño ainda "ligeiramente superior" em performance por megawatt — mas com a ressalva de que o Rubin já incorpora otimizações de speculative decoding que o Jalapeño ainda não tem. (A fonte original desse trecho específico apresenta trechos parcialmente imprecisos; o dado deve ser lido com cautela.)
Adrien Sanchez, analista de tecnologia do Yole Group, foi direto ao CNBC: "Um chip projetado por hyperscaler agora pode igualar ou superar as GPUs Blackwell da Nvidia em eficiência de inferência."
O que muda na prática — e quando
Antes de qualquer entusiasmo operacional: o Jalapeño não está disponível comercialmente. Em 1º de setembro de 2026, a OpenAI mantém apenas amostras de engenharia. O deployment interno em volumes pequenos está previsto para o fim de 2026, como declarou Richard Ho, head de hardware da OpenAI, que descreveu explicitamente "volumes muito pequenos" para esse período. O ramp de produção plena ocorre gradualmente ao longo de 2027, com maior parte da capacidade prevista para o final daquele ano.
Quanto ao futuro da plataforma: Richard Ho confirmou que a segunda geração do chip está "deep into development". De forma independente, a OpenAI e o BigGo Finance reportaram que uma terceira geração já está em andamento. A OpenAI descreve o Jalapeño como uma plataforma multigeracional — chips, modelos e memória desenvolvidos em conjunto —, o que deixa claro que este é um investimento de longo prazo, não um projeto isolado.
Por que isso interessa a quem toma decisões de negócio
Estamos diante de uma inflexão estrutural: as grandes labs de IA estão verticalizando até a camada de silício. Isso comprime o espaço de diferenciação dos fornecedores tradicionais de hardware e cria pressão real sobre margens e road maps de players estabelecidos. Para PMEs que adotam IA, o sinal prático é que o custo de inferência continuará caindo, e os modelos mais capazes tendem a se tornar progressivamente mais acessíveis à medida que a estrutura de custos operacionais das grandes labs melhora.
A questão estratégica não é se você vai usar IA na operação. É se você vai estar posicionado para aproveitar a próxima onda de redução de custo — ou vai chegar tarde, como chegou na anterior.
Fontes
- OpenAI Jalapeño AI chip challenges Nvidia in inference
- Jalapeño's first results show industry-leading speed and ...
- OpenAI Jalapeño: Better Than Nvidia Blackwell
- Chip 'Jalapeño' da OpenAI supera Nvidia Blackwell em ...
- OpenAI Claims Its First Custom Chip Beats Nvidia's Blackwell in Inference Efficiency — BigGo Finance
- OpenAI's Jalapeño chip is built for fast inference at scale, ...


