CFO da OpenAI: Jalapeño para IA barata e escalável
Como a estratégia full stack da OpenAI, ancorada no chip Jalapeño e em uma base de fornecedores diversificada, busca entregar inteligência abundante com melhor custo, velocidade e confiabilidade
Danilo Gato
Autor
Introdução
Em 25 de agosto de 2026, a CFO da OpenAI, Sarah Friar, detalhou a estratégia full stack que sustenta a promessa de inteligência abundante, conectando data centers, chips, modelos, plataforma de desenvolvedores, produtos e até dispositivos. No anúncio, o chip Jalapeño, desenvolvido com a Broadcom, ganhou destaque por resultados iniciais em benchmarks públicos e por seu papel no objetivo de IA escalável e de baixo custo. (openai.com)
A peça central é clara, chip Jalapeño OpenAI como vetor de eficiência, com ganhos em throughput por quilowatt e menor latência de tokens no InferenceX usando o GPT‑OSS 120B, além de boa performance em modelos de outras famílias, como DeepSeek R1 e Kimi K2. Isso amplia o controle sobre como os modelos rodam e sobre a economia de servir inteligência em escala. (openai.com)
O plano não depende de um único fornecedor. A OpenAI descreve um portfólio que inclui Microsoft, NVIDIA, AWS, AMD, Broadcom, Cerebras, CoreWeave, Oracle, SB Energy e SoftBank, com cada parceiro contribuindo em infraestrutura, chips, baixa latência, rede e energia. Esse desenho busca preservar escolha credível, otimizar desempenho por dólar e manter disciplina de preços conforme o mercado evolui. (openai.com)
1. O que é a estratégia full stack da OpenAI
A abordagem parte de uma premissa prática, melhorar todas as camadas do sistema ao mesmo tempo. Software mais inteligente extrai mais do hardware. Hardware projetado para workloads de LLM melhora velocidade e eficiência. Modelos mais capazes destravam produtos melhores, que geram uso, dados e receita, realimentando o ciclo. Essa visão integra desde o design de chips, memória e rede, até o agendamento de inferência e a experiência do produto. (openai.com)
Impacto direto para clientes e desenvolvedores, resultados mais rápidos, menos tentativas, maiores taxas de sucesso em agentes que executam fluxos longos e custo total menor por tarefa concluída. O objetivo declarado é permanecer na fronteira de Pareto de capacidade, velocidade, confiabilidade, eficiência e custo, direcionando cargas para o sistema mais forte na melhor economia possível. (openai.com)
2. Jalapeño, o chip de inferência feito para LLMs
Anunciado em 24 de junho de 2026, jalapeño foi descrito como o primeiro Intelligence Processor da OpenAI, focado em inferência de LLMs. O desenvolvimento, do design ao tape‑out, aconteceu em nove meses, acelerado pelo uso de modelos da própria OpenAI para automatizar partes do design e da otimização, um caso concreto de IA projetando silício que roda a próxima geração de IA. O comunicado conjunto com a Broadcom enfatiza ainda a ambição de implantar o sistema em escala de gigawatts, em múltiplas gerações. (openai.com)
Os primeiros testes de engenharia indicaram desempenho por watt substancialmente melhor do que o estado da arte, com arquitetura voltada a reduzir movimentação de dados e equilibrar computação, memória e rede, aumentando a utilização realizada, mais próxima do pico teórico. O desenho nasceu para inferência de LLMs atuais e futuros, cobrindo produtos como ChatGPT, Codex, a API e aplicações de agentes. (openai.com)
Resultados publicados pela CFO destacam ganhos de throughput por quilowatt e latência de token no InferenceX, além de boa performance em famílias de modelos diferentes, sinalizando que a vantagem não se limita a um único stack de modelo. Na prática, isso se traduz em respostas mais rápidas, maior estabilidade em picos de demanda e preço mais previsível para quem constrói com a plataforma. (openai.com)
3. Parcerias estratégicas e o caminho do silício próprio
A OpenAI reconhece o papel histórico da Microsoft e dos chips NVIDIA no crescimento da companhia, mas posiciona o futuro em um portfólio diversificado, que agora inclui AWS, AMD, Broadcom, Cerebras, CoreWeave, Oracle, SB Energy e SoftBank. Essa diversidade é usada como alavanca de capacidade e economia, preservando alternativas, movendo a demanda conforme o melhor desempenho por dólar e evitando dependência excessiva de um único fornecedor. (openai.com)
O Jalapeño cria uma via de primeira parte, lado a lado com aceleradores de parceiros, para casar cada workload ao sistema mais forte com a economia certa. Ao combinar silício próprio com a experiência industrial de Broadcom e Celestica, incluindo redes de alto desempenho como Tomahawk, a OpenAI aponta para industrializar placas, racks e sistemas inteiros. Isso não substitui todos os chips do ecossistema, reforça a liberdade de escolher o melhor para cada tarefa. (openai.com)
No nível de infraestrutura física, o Project Camellia, na Geórgia, exemplifica como data centers podem ser projetados em torno de workloads de clientes, com auditoria pública anual e metas de água e energia. Essa integração de site, energia e silício é parte do que torna a estratégia realmente full stack, indo além do software. (openai.com)
4. Eficiência que vira valor econômico
A CFO enfatiza um indicador prático, inteligência útil por dólar. Menos tokens de saída para chegar à resposta, roteamento mais esperto, contextos geridos com menos desperdício e hardware sob medida geram ganhos compostos em velocidade, energia e custo. No lado de modelos, a OpenAI reportou avanços de preço‑desempenho com a série GPT‑5.6, além de maiores taxas de reutilização de cache em agentes com loop de ferramentas completo, um ajuste que tem efeito direto na conta ao fim do mês. (openai.com)
Na ótica empresarial, eficiência abre trabalho que antes não era economicamente viável. Times conseguem revisar cada contrato com IA, rodar cenários financeiros ao vivo, oferecer análise personalizada a cada cliente ou testar mais ideias de engenharia com ciclos mais curtos. A própria OpenAI descreve esse efeito como um paradoxo de Jevons aplicado à inteligência, mais eficiência torna viáveis mais usos, o que expande consumo e receita. (openai.com)
5. Benchmarks, latência e o que muda para desenvolvedores
A combinação de throughput elevado por quilowatt e redução de latência de token implica servidores que fazem mais trabalho por unidade de energia e respondem mais rápido, algo crítico para experiências interativas e para agentes que encadeiam chamadas. Na prática, aplicações que usam a API tendem a ver menos timeouts, respostas mais estáveis e custos mais baixos por tarefa bem sucedida, principalmente em fluxos longos que antes exigiam múltiplas tentativas. Esses pontos foram explicitados nos resultados e na descrição do ciclo de produto, modelo e infraestrutura. (openai.com)
Exemplos práticos para agora:
- Atendimento e venda assistidos por agente, com menos latência por passo, melhorando taxa de conversão em jornadas conversacionais.
- Engenharia de software com agentes que planejam, chamam ferramentas, escrevem e validam código com mais consistência, já que a plataforma reporta menos tokens de saída para alcançar a mesma tarefa com GPT‑5.6 Sol em cenários de código. (openai.com)
- Pesquisa e análise com roteamento inteligente entre modelos, explorando o melhor custo por dólar em cada subtarefa, beneficiando‑se do portfólio de hardware e da integração de cache e memória.
6. Cronograma industrial e a rota de múltiplas gerações
O comunicado conjunto com a Broadcom indica que Jalapeño é o primeiro passo de uma plataforma multigeracional, com implantação inicial prevista a partir do fim de 2026 e expansão nos anos seguintes. A promessa é combinar design da OpenAI com implementação de silício, rede e conectividade da Broadcom, além de integração de placas e racks pela Celestica. Em termos de gestão de risco e abastecimento, isso significa menor exposição a gargalos pontuais e mais poder de barganha em preço e capacidade. (openai.com)
Para o ecossistema, a mensagem é que os grandes laboratórios de IA caminham para arquiteturas próprias de inferência, otimizadas para seus kernels e padrões de serviço, equilibrando treinos de fronteira em aceleradores amplamente disponíveis e inferência massiva em silício sob medida. A OpenAI enxerga esse arranjo como um motor de vantagem composta, melhor tecnologia gera melhor economia, que financia a próxima onda de progresso. (openai.com)
7. Energia, data centers e o custo de servir inteligência
A escala de gigawatts citada no pipeline industrial aponta que o custo dominante da IA passa por energia e refrigeração, além de redes internas de alta performance. Quando a CFO liga eficiência técnica a valor econômico, o subtexto é infraestrutura, cada ponto percentual de utilização realizada perto do pico teórico reduz o custo por inferência. Com projetos como o Camellia e um mix que inclui provedores de nuvem e energia, a OpenAI sinaliza que preço competitivo depende de engenharia de ponta a ponta, não apenas do número de FLOPs. (openai.com)
8. Oportunidades e limites, um olhar equilibrado
Há oportunidades claras, preço por tarefa menor, latências mais curtas, estabilidade sob picos, novos casos economicamente viáveis. Para startups e empresas estabelecidas, isso pode redefinir a curva de custo de agentes, permitindo que mais rotinas passem de prova de conceito para produção. Por outro lado, ainda existem incógnitas, volume real de produção, yield em nós avançados, disponibilidade de rede de altíssima largura e o tempo para que ganhos de laboratório virem capacidade entregue com SLA público. Os próprios materiais indicam que parte das medições finais viria em relatórios técnicos subsequentes. (openai.com)
Para quem constrói produtos, o caminho prudente é projetar arquiteturas que possam aproveitar ganhos de custo e latência quando disponíveis, sem depender de uma única linha de suprimento. Esse é, inclusive, o espírito do portfólio descrito pela OpenAI, preservar alternativa crível e mover cargas para onde o desempenho por dólar for melhor em cada momento. (openai.com)
Conclusão
A estratégia full stack apresentada por Sarah Friar sintetiza o que há de mais pragmático em computação de IA hoje, encadear software, modelos, hardware, rede e energia para transformar eficiência técnica em valor econômico. O chip Jalapeño é a materialização desse plano, um acelerador feito para a realidade da inferência de LLMs, com metas de latência baixa, alto throughput por quilowatt e implantação em larga escala.
Se os resultados de benchmark e a rota industrial se confirmarem no campo, desenvolvedores e empresas tendem a ver IA mais rápida, mais acessível e mais previsível em custo. É esse efeito composto, mais inteligência útil por dólar, que pode destravar a próxima leva de aplicações práticas e levar a noção de inteligência abundante do discurso à rotina diária. (openai.com)
Leia também
OpenAI lança plugin Admin no ChatGPT Work e Codex para gestão
O novo plugin Admin do ChatGPT Work e Codex concentra analytics, permissões e tarefas do Admin Console em uma conversa. Com automações para Slack e Teams e controles corporativos, a TI ganha velocidade, consistência e governança para escalar o uso de IA com segurança.
10 min de leituraTecnologia e IAJensen Huang, da Nvidia, fala com Trump no viva voz no All-In Summit
No All-In Summit, Jensen Huang, CEO da Nvidia, atendeu uma ligação de Donald Trump no viva voz, diante da plateia. Trump chamou temores de IA de “hoax” e disse que “os robôs não vão dominar o mundo”, enquanto Huang destacou ganhos econômicos de data centers e a corrida de IA. Veja implicações para regulação, mercado e estratégia de produto.
9 min de leituraTecnologia e IAApple lança Siri AI, contexto pessoal, tela e saber global
Siri AI estreia com conversas ricas, contexto pessoal, visão da tela e conhecimento do mundo, impulsionando produtividade e privacidade via Apple Intelligence. Veja o que muda, limitações, casos práticos, impacto para negócios e como tirar valor real desde hoje.
10 min de leituraTecnologia e IAAnthropic lança Claude for Financial Advisors com integrações de CRM, custodiantes e portfólios
A Anthropic lançou em 14 de setembro de 2026 o Claude for Financial Advisors, conectando o assistente a CRMs, custodiante e plataformas de portfólio como BlackRock, Schwab, Addepar e Envestnet. O objetivo é reduzir tarefas administrativas e fortalecer governança e compliance, liberando tempo para relacionamento e planejamento de clientes.
11 min de leitura