OpenAI 公布 Jalapeño 推理芯片实测,自研算力进入部署准备阶段
OpenAI 公布首款自研推理芯片 Jalapeño 的首批实测结果。该芯片面向低延迟推理与 Agent 工作负载设计,目前仍在生产验证和软件完善阶段,计划于 2026 年底前开始部署。
模型厂商开始把芯片、内存、网络和服务软件作为一套系统优化。对 API 用户,推理成本和响应速度将越来越取决于完整服务栈,而不是单一加速器型号。
自研芯片开始从路线图走向实测
Jalapeño 的意义首先在于产品进度。OpenAI 已经完成芯片和配套系统的首轮测试,不再只是公布合作或设计计划。公司称芯片正在接受生产验证,服务软件也在继续完善,目标是在 2026 年底前接入自有计算基础设施。
这并不代表它已经大规模替代现有 GPU。OpenAI 同时表示会继续部署 NVIDIA 等合作伙伴的加速器。更现实的变化是,自研芯片将成为额外的推理选项,让不同模型和任务能够按性能、功耗、延迟与成本进行分配。
性能数据需要放回测试条件中理解
OpenAI 在公开的 InferenceX 测试框架下比较了 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T。按其公布的数据,Jalapeño 在峰值吞吐时每瓦完成的工作量约为对比系统的 1.5 至 1.9 倍,端到端延迟低约 1.7 至 3.6 倍。上述数字均属于厂商实测结果,并不等于独立机构对所有场景的通用结论。
芯片额定功耗为 700W,OpenAI 称三组测试中的持续功耗不高于 550W。比较时仍需注意模型精度、输入输出长度、量化格式、并行方式和对比硬件不同。采购方应等待更多第三方复测与线上负载数据,再判断单位任务成本。
Agent 让低延迟和能效同时变得重要
Agent 会连续执行推理、工具调用和状态更新,单步延迟会在长流程中累积。Jalapeño 把预填充、逐 Token 生成、KV 缓存放置和芯片间通信纳入统一设计,目标是在提高吞吐的同时缩短交互等待,而不是只追求批处理峰值。
对中转服务而言,芯片层面的提升只有经过模型部署、路由、缓存和限流策略后才会传递到用户。后续应持续观察实际首 Token 时间、任务完成率、单位任务功耗和高峰期可用容量,避免把实验室吞吐直接换算成 API 体验。
