OpenAI于2026年8月25日在Hot Chips大会上正式发布了其首款自主研发的AI推理专用芯片Jalapeño,该芯片在功率效率和延迟方面表现超过了英伟达GB200和GB300芯片系列 [1, 2, 3, 4, 5, 6]。

Jalapeño芯片的峰值吞吐功耗效率比英伟达GB200和GB300高出1.5至1.9倍,且在三个开放模型的端到端延迟测试中表现出1.7至3.6倍的显著降低 [1, 2, 3, 4, 5, 6]。芯片的热设计功率(TDP)约为700瓦,远低于英伟达GB200(1200瓦)和GB300(1400瓦),甚至也优于英伟达正在开发的Vera Rubin芯片(900至1150瓦TDP) [1, 3, 6]。

OpenAI硬件负责人Richard Ho表示,Jalapeño能够同时实现高吞吐量和低延迟,优化功率使用以降低数据中心的电力和运营成本。他称:“我们基于前沿AI模型的核心程序、内存数据流及网络架构做了优化,努力接近硬件的理论极限,达成高效能。” [2, 4]该芯片专门针对大规模语言模型推理任务而设计,如GPT-OSS 120B、DeepSeek-R1和Moonshot AI模型,着重提升数据中心的推理效率而非训练能力 [1, 2, 5, 6]。

Jalapeño使用台积电的N3P工艺和HBM4内存制造,由OpenAI联合博通协助完成芯片设计,从2024年6月组建团队起,仅用了16个月实现了芯片的流片,显示出极为迅速的开发效率 [2, 3, 4, 6]。单芯片理论计算能力约为13.4 PFLOPs,内存带宽达到15.4 TB/s [6]。芯片开发过程中,OpenAI还借助自研的Codex AI进行了核心代码编写,并推出了新的GPU编程语言Gluon [3, 6]。

目前Jalapeño的工程样片主要在8k1k工作负载下接受测试,完整的基准测试套件尚未全部完成 [6]。OpenAI计划在2026年底前有限度地将该芯片部署到自家AI服务中,预计将在2027年实现量产和规模化应用 [2, 3, 5, 6]。OpenAI强调,Jalapeño是对英伟达产品的有益补充,英伟达仍是重要的合作伙伴和供应商,芯片不会完全替代英伟达芯片 [2, 3, 5]。

半导体分析机构SemiAnalysis在OpenAI实验室使用InferenceX基准套件进行了测试,但指出与英伟达Blackwell芯片的对比并不完全公平,测试数据主要由OpenAI提供,尚不包括英伟达下一代的Vera Rubin芯片的完整表现 [1, 3, 6]。

OpenAI基于Celestica制造的ASIC服务器将承载Jalapeño芯片,若产量提升,鸿海、广达、纬创、魏略和英业达等台湾ODM厂商有望获得订单 [4, 6]。业界整体正经历云服务商包括微软、谷歌、Meta和亚马逊等开发定制AI芯片、减弱对英伟达GPU依赖的大趋势 [6]。

OpenAI与英伟达高层均指出,数据中心的电力供应和用电限制已成为AI大规模部署的关键瓶颈,Jalapeño的优势意义在于降低单位功耗完成更多AI任务,以应对电力资源紧张的现实挑战 [1]。