评测
OpenAI Jalapeño 首批实测:AI 推理开始进入自研芯片时代
OpenAI 在 2026 年 8 月 25 日公布了首款自研推理芯片 Jalapeño 的第一批公开实测结果。它不是训练芯片,也不是一张面向消费市场的 GPU,而是专门围绕大语言模型推理设计的 Intelligence Processor。OpenAI 使用 SemiAnalysis 的 InferenceX 对 GPT‑OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 进行测试:跨这三类公开模型,Jalapeño 在峰值吞吐功耗比上约高 1.5~1.9 倍,端到端延迟约低 1.7~3.6 倍;在高度交互式负载下,性能优势达到约 2.1~4.1 倍。更值得关注的是,OpenAI 还让模型参与芯片软件优化,在选定的 Attention 与 MoE Block 上,AI 生成实现比已有人工专家实现快 1.5~1.8 倍。Jalapeño 的意义不只是“多一款 AI 芯片”,而是模型、编译器、内存、网络和推理服务开始形成真正的全栈闭环。
# OpenAI Jalapeño 首批实测:AI 推理开始进入自研芯片时代
## 文章摘要
OpenAI 在 2026 年 8 月 25 日公布了首款自研推理芯片 Jalapeño 的第一批公开实测结果。它不是训练芯片,也不是一张面向消费市场的 GPU,而是专门围绕大语言模型推理设计的 Intelligence Processor。OpenAI 使用 SemiAnalysis 的 InferenceX 对 GPT‑OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 进行测试:跨这三类公开模型,Jalapeño 在峰值吞吐功耗比上约高 1.5~1.9 倍,端到端延迟约低 1.7~3.6 倍;在高度交互式负载下,性能优势达到约 2.1~4.1 倍。更值得关注的是,OpenAI 还让模型参与芯片软件优化,在选定的 Attention 与 MoE Block 上,AI 生成实现比已有人工专家实现快 1.5~1.8 倍。Jalapeño 的意义不只是“多一款 AI 芯片”,而是模型、编译器、内存、网络和推理服务开始形成真正的全栈闭环。
---
## 一、Jalapeño 到底是什么?
Jalapeño 是 OpenAI 的第一代自定义推理芯片。
它和很多人熟悉的训练 GPU 有一个非常重要的区别:
> 它的首要目标不是训练大模型,而是让已经训练好的模型更快、更省电地服务真实请求。
推理阶段包括两个非常不同的过程。
### Prefill
处理用户输入 Prompt。
特点是:
- 计算量大;
- 并行度高;
- 对算力要求高。
### Decode
逐 Token 生成输出。
特点是:
- 很依赖内存带宽;
- 每一步都要访问模型状态;
- 用户对延迟极其敏感。
Agent 工作负载更加复杂。
一次 Agent Task 可能:
```text
模型思考
↓
调用工具
↓
拿结果
↓
再次推理
↓
再次调用工具
↓
继续推理
```
如果每轮多 500ms,20 个步骤以后就是明显的等待。
所以 Agent 时代的关键指标已经不只是:
> 一张卡每秒能吐多少 Token。
还包括:
- Time Between Tokens;
- End-to-End Latency;
- 每瓦吞吐;
- 多轮任务总完成时间。
## 二、OpenAI 为什么强调“相同用户体验下比较”?
硬件 Benchmark 很容易被误读。
如果一个系统为了吞吐量把请求攒成超大 Batch,每瓦吞吐可能很好,但用户会觉得很慢。
另一个系统延迟极低,但功耗巨大,也不一定经济。
OpenAI 这次强调的是:
> 在满足相近交互体验的条件下,比较完成多少有用 AI 工作。
所以核心不是最高 TPS,而更接近:
```text
Useful Work
÷
Power
+
Latency Constraint
```
这正好符合在线 Agent 的实际场景。
## 三、三组公开模型的结果怎么看?
OpenAI 测试了:
- GPT‑OSS 120B;
- DeepSeek R1 670B;
- Kimi K2.5 1T。
这三个模型跨度很大。
意义是:
> Jalapeño 并不是只针对某一个 OpenAI 私有模型做 Hardcode。
### GPT‑OSS 120B
OpenAI 报告在测试点上:
- 峰值 mixed TPS / kW 约高 1.9×;
- 端到端延迟约低 1.7×;
- 最低 TBT 约低 2.7×。
### DeepSeek R1 670B
报告:
- 峰值 mixed TPS / kW 约高 1.7×;
- 端到端延迟约低 3.6×;
- 最低 TBT 约低 4.1×。
### Kimi K2.5 1T
报告:
- 峰值 mixed TPS / kW 约高 1.5×;
- 端到端延迟约低 3.4×;
- 最低 TBT 约低 3.8×。
这里必须强调:
> 这些数字是 OpenAI 在 InferenceX 指定配置和对比系统下的结果,不应该简单外推成“Jalapeño 在所有场景都比任何 GPU 快 X 倍”。
这是写技术文章最重要的边界。
## 四、为什么“每瓦性能”越来越重要?
AI 基础设施真正昂贵的并不只是买芯片。
还有:
- 电力;
- 机房;
- 制冷;
- 网络;
- 内存;
- 运维。
如果相同电力可以完成更多推理,就能在同一数据中心服务更多用户,或者在相同请求量下降低成本。
当 AI 从聊天升级成持续运行的 Agent 时,这个指标会越来越重要。
## 五、700W TDP 为什么不能直接拿来比较?
OpenAI 披露 Jalapeño 的额定功耗为 700W。
但其测试工作负载中的持续实测功耗不高于约 550W。
这也提醒我们:
> TDP 不是实际应用功耗。
真正比较基础设施时至少要看:
```text
实际功耗
+
吞吐
+
延迟
+
利用率
```
不能只看芯片宣传参数。
## 六、最有意思的一点:AI 参与优化自己的芯片
OpenAI 还公布了一个很有意思的实验。
在部分 GPT‑OSS Attention Block 与 Mixture-of-Experts Block 上,AI 生成的实现比已有人工专家实现快约 1.5~1.8 倍。
注意:
> 这不是整个模型加速 1.8 倍。
只是选定 Kernel / Block 的结果。
但它说明了一个很重要的闭环:
```text
更强模型
↓
优化芯片软件
↓
芯片推理更快
↓
运行更强模型
↓
模型继续优化系统
```
## 七、为什么 Agent 会让低延迟更重要?
普通 Chat:
```text
User
↓
Model
↓
Answer
```
Agent:
```text
User
↓
Model
↓
Tool
↓
Model
↓
Tool
↓
Model
```
如果每轮模型调用 2 秒,10 轮就是 20 秒以上。
如果每轮只有 0.8 秒,10 轮就会明显缩短。
Agent 的延迟是:
> 连乘式体验问题。
所以未来推理芯片的优势很可能不是单轮 Benchmark,而是一个完整任务能提前多少秒结束。
## 八、为什么 OpenAI 还不会放弃 NVIDIA?
OpenAI 在同一篇文章里明确表示,仍会继续广泛部署 NVIDIA 和其他合作伙伴的加速器。
Jalapeño 不是 NVIDIA replacement,更像是 OpenAI 推理算力组合中的新增一层。
原因很现实:
> AI 需求增长速度太快,不可能只依赖一种算力来源。
## 九、Jalapeño 什么时候真正投入使用?
OpenAI 计划在 2026 年年底前开始把 Jalapeño 部署进自己的计算基础设施。
目前仍然在:
- Production Qualification;
- 软件成熟;
- 大规模运维准备;
- 更多模型验证。
所以今天应该把它理解为:
> 已有工作芯片和公开实测结果,但还没有完成大规模生产部署。
## 十、这对普通开发者意味着什么?
短期你不会 `pip install jalapeno`。
但长期会影响:
- API 延迟;
- Coding Agent 响应速度;
- Voice Agent 实时性;
- Browser Agent 多轮任务;
- 推理成本经济性。
当模型调用足够便宜、足够快后,很多以前成本太高的高频 Agent 场景会变得现实。
## 十一、AI 芯片竞争正在从 FLOPS 转向“完整请求”
过去芯片营销常看 TFLOPS、TOPS、HBM、Bandwidth。
Agent 时代更应该看:
```text
Prompt Processing
+
Decode
+
KV Cache
+
Network
+
Batching
+
Latency
+
Power
```
也就是一次完整 AI Request。
Jalapeño 的架构思路正是尽可能减少数据移动、通信等待和 KV Cache 搬运。
## 十二、真正的竞争是全栈竞争
未来顶级 AI 平台的竞争很可能越来越像:
```text
Model
+
Compiler
+
Serving
+
Chip
+
Memory
+
Network
+
Data Center
```
而不是只比谁的大模型 Benchmark 高几分。
## 最终判断
Jalapeño 最重要的意义并不是 OpenAI 也开始造芯片。
而是 OpenAI 正试图把模型需求、推理软件、芯片设计、机架系统和真实产品负载连成一个优化闭环。
当前公开数据必须严格限定在 OpenAI 的 InferenceX 实测范围内:
- 峰值每瓦 AI 工作约高 1.5~1.9×;
- 端到端延迟约低 1.7~3.6×;
- 高交互负载性能约高 2.1~4.1×;
- 选定 AI 生成 Kernel / Block 比已有人工实现快 1.5~1.8×。
如果 Jalapeño 能在大规模生产部署中维持这些优势,它真正改变的可能不是一次模型调用,而是 Agent 可以以多低的延迟、多低的电力成本连续运行。
想继续了解 AI 芯片、推理基础设施与最新模型工程,可以访问 **智元选**:https://www.zyentorpicks.com/。