2026 大模型 API 成本真相:为什么最便宜的模型不一定最省钱
文章摘要
大模型 API 的价格表通常以“每百万 tokens 输入多少钱、输出多少钱”呈现,但企业最终账单还会受到缓存命中率、输出长度、长上下文溢价、Batch 或 Flex 折扣、搜索与工具调用、失败重试、模型路由和人工返工等因素影响。2026 年主流模型的单价差距已经非常大:低成本模型每百万输出 tokens 可能不足 1 美元,旗舰模型则可能达到数十美元。本文基于 2026 年 7 月 31 日可核验的官方价格,建立一套更接近真实业务的成本计算方法,并给出客服、RAG、内容生成和 Agent 场景的选型建议。
---
一、为什么 API 价格表经常误导决策?
很多团队选择模型时,只做一张类似这样的表:
| 模型 | 输入价格 | 输出价格 |
|---|---|---|
| A | 0.1 美元 | 0.6 美元 |
| B | 1 美元 | 6 美元 |
| C | 5 美元 | 25 美元 |
然后得出结论:A 一定最省钱。
但真实成本不是单价,而是:
```text
真实成本
= 有效输入成本
+ 输出成本
+ 缓存写入与存储
+ 搜索和工具调用
+ 重试与失败请求
+ 长上下文或优先处理溢价
+ 数据处理与基础设施
+ 人工复核和返工
```
便宜模型如果需要更长提示词、输出更多内容、调用更多次、频繁重试,或者产生更高人工审核成本,最终总成本可能高于更强的模型。
---
二、2026 年主流 API 价格对比
以下价格核验于 2026 年 7 月 31 日,均按每百万 tokens 的美元价格整理。模型厂商可能随时调整价格,正式采购和上线前应再次核对官方页面。
1. OpenAI
| 模型 | 标准输入 | 缓存输入 | 标准输出 |
|---|---|---|---|
| GPT-5.6 Sol | $2.50 | $0.25 | $15.00 |
| GPT-5.6 Terra | $1.00 | $0.10 | $6.00 |
| GPT-5.6 Luna | $0.10 | $0.01 | $0.60 |
| GPT-5.4 Mini | $0.375 | $0.0375 | $2.25 |
| GPT-5.4 Nano | $0.10 | $0.01 | $0.625 |
OpenAI 还区分短上下文和长上下文。以 GPT-5.6 Sol 为例,长上下文输入和输出价格分别提高到 5 美元和 22.5 美元。需要数据驻留的区域处理端点,对符合条件的新模型还可能收取 10% 溢价。
2. Anthropic Claude
| 模型 | 基础输入 | 缓存命中 | 输出 |
|---|---|---|---|
| Claude Opus 5 | $5.00 | $0.50 | $25.00 |
| Claude Sonnet 5(截至 2026-08-31) | $2.00 | $0.20 | $10.00 |
| Claude Sonnet 5(自 2026-09-01) | $3.00 | $0.30 | $15.00 |
| Claude Haiku 4.5 | $1.00 | $0.10 | $5.00 |
Claude Sonnet 5 在 2026 年 8 月 31 日前处于优惠价阶段,因此使用它做长期成本预算时,不能只按当前价格计算。Anthropic 还区分 5 分钟缓存写入、1 小时缓存写入和缓存命中,缓存写入本身可能高于标准输入价。
3. Google Gemini
| 模型/模式 | 输入 | 输出 |
|---|---|---|
| Gemini 3.5 Flash Standard | $1.50 | $9.00 |
| Gemini 3.5 Flash Batch / Flex | $0.75 | $4.50 |
| Gemini 3.5 Flash-Lite Standard | $0.30 | $2.50 |
| Gemini 3.5 Flash-Lite Batch / Flex | $0.15 | $1.25 |
Gemini 的价格体系还包含 Standard、Batch、Flex、Priority 等层级。对于不要求实时响应的任务,Batch 或 Flex 可以显著降低价格。使用 Google Search Grounding 时,还应考虑超出免费额度后的搜索请求费用。
4. DeepSeek
| 模型 | 缓存命中输入 | 未命中输入 | 输出 |
|---|---|---|---|
| DeepSeek-V4-Flash | $0.0028 | $0.14 | $0.28 |
| DeepSeek-V4-Pro | $0.003625 | $0.435 | $0.87 |
从表面单价看,DeepSeek-V4 系列非常低。但成本分析仍需考虑可用性、区域访问、并发、任务成功率、输出稳定性、模型适配和企业合规要求。
---
三、先统一 token 口径
不同厂商使用不同 tokenizer。同一段中文或英文,在不同模型上可能产生不同 token 数。
因此,不能简单地用“1,000 个汉字等于 1,000 tokens”做预算。更可靠的方法是:
1. 从真实业务日志中抽取 500 至 1,000 条请求;
2. 使用目标模型的 tokenizer 或 token counting API 计算;
3. 分别统计 P50、P90 和 P99 输入长度;
4. 统计输出长度;
5. 按任务类型分组,而不是用一个全局平均值。
例如,客服问答、合同分析和代码 Agent 的上下文结构完全不同。把它们平均在一起,会掩盖真正的成本热点。
---
四、一个更准确的单次调用公式
单次调用可使用以下公式估算:
```text
单次成本
= 未缓存输入 tokens × 未缓存输入单价
+ 缓存命中 tokens × 缓存命中单价
+ 缓存写入 tokens × 缓存写入单价
+ 输出 tokens × 输出单价
+ 工具与搜索费用
```
月度成本则是:
```text
月度模型成本
= 单次平均成本
× 请求量
× 重试系数
× 路由系数
```
其中:
- 重试系数:请求超时、JSON 失败、内容安全拒绝和业务校验失败造成的额外调用;
- 路由系数:部分请求升级到更强模型,或同时调用多个模型进行评审;
- 工具费用:搜索、代码执行、文件解析、向量检索或第三方 API;
- 缓存费用:不仅有命中价,还可能有写入和存储成本。
---
五、四个真实业务场景的成本计算
为了便于比较,以下示例只计算 token 成本,不包含网络、数据库、向量检索和人工成本。具体数字用于说明方法,不代表所有项目的实际账单。
场景一:客服分类
每次请求:
- 输入 800 tokens;
- 输出 80 tokens;
- 每月 100 万次;
- 不使用缓存。
使用 GPT-5.6 Luna:
```text
输入:800 / 1,000,000 × $0.10 = $0.00008
输出:80 / 1,000,000 × $0.60 = $0.000048
单次:$0.000128
月度:约 $128
```
使用 DeepSeek-V4-Flash:
```text
输入:800 / 1,000,000 × $0.14 = $0.000112
输出:80 / 1,000,000 × $0.28 = $0.0000224
单次:$0.0001344
月度:约 $134.40
```
这说明不能只看输出单价。对于输入占比更高的短输出任务,两款模型的差距可能没有直觉中那么大。
场景二:RAG 知识问答
每次请求:
- 固定系统提示与企业规则 6,000 tokens;
- 检索内容 4,000 tokens;
- 用户问题 300 tokens;
- 输出 700 tokens;
- 每月 10 万次;
- 固定部分缓存命中。
使用 GPT-5.6 Terra,并假设 6,000 tokens 命中缓存:
```text
缓存输入:6,000 × $0.10 / 1,000,000 = $0.0006
普通输入:4,300 × $1.00 / 1,000,000 = $0.0043
输出:700 × $6.00 / 1,000,000 = $0.0042
单次:$0.0091
月度:约 $910
```
若没有缓存:
```text
输入:10,300 × $1.00 / 1,000,000 = $0.0103
输出:$0.0042
单次:$0.0145
月度:约 $1,450
```
仅缓存固定上下文,月度 token 费用就下降约 37%。
场景三:批量商品文案
每个 SKU:
- 输入 2,000 tokens;
- 输出 1,200 tokens;
- 共 50 万个 SKU;
- 不要求实时返回。
使用 Gemini 3.5 Flash-Lite Standard:
```text
输入成本:2,000 × $0.30 / 1,000,000 = $0.0006
输出成本:1,200 × $2.50 / 1,000,000 = $0.003
单个 SKU:$0.0036
总计:约 $1,800
```
使用 Batch / Flex:
```text
输入成本:2,000 × $0.15 / 1,000,000 = $0.0003
输出成本:1,200 × $1.25 / 1,000,000 = $0.0015
单个 SKU:$0.0018
总计:约 $900
```
仅改变服务层级,在不改变模型的情况下即可节省约 50%。
场景四:复杂代码 Agent
一次任务可能包含:
- 初始上下文 30,000 tokens;
- 多轮工具结果累计 80,000 tokens;
- 最终输出 8,000 tokens;
- 平均调用 12 轮;
- 20% 任务需要重新规划。
这种场景不能只按一次 API 请求计算。需要记录每一轮的上下文增长、工具输出、重复传输、缓存命中、失败重试和最终成功率。
如果较便宜的模型平均需要 18 轮才能完成,而较强模型只需要 8 轮,后者即使单价更高,也可能拥有更低的“每个成功任务成本”。
---
六、输出 tokens 往往比输入更贵
主流模型普遍对输出收取更高价格。原因之一是生成过程难以像输入处理那样并行,且推理和解码占用更多计算时间。
因此,降低成本最直接的方法之一是限制输出。
可以采用:
- 严格的 `max_output_tokens`;
- JSON Schema;
- 要求只返回必要字段;
- 避免让模型复述输入;
- 将解释性内容改为可选;
- 长报告先生成提纲,再按需展开;
- 低风险请求使用更短模板。
在商品分类、意图识别、信息抽取等任务中,输出只需要几十个 tokens。让模型返回完整分析过程会显著增加费用,也会提高解析失败率。
---
七、缓存不是免费午餐
提示词缓存非常适合重复的大段内容,例如:
- 企业规则;
- 产品目录;
- 固定 system prompt;
- API 文档;
- 代码仓库公共上下文;
- 长期不变的知识片段。
但需要注意三个问题。
1. 缓存写入可能更贵
部分厂商对第一次缓存写入收取高于普通输入的价格,只有后续多次命中才能摊薄。
2. 缓存存在有效期
如果请求间隔超过缓存窗口,或者前缀发生变化,可能无法命中。
3. 前缀必须稳定
把时间戳、随机 ID、动态用户信息放在提示词开头,会破坏缓存前缀。应将稳定内容放在前面,动态内容放在后面。
可计算缓存盈亏平衡点:
```text
盈亏平衡命中次数
= 缓存写入额外成本
÷ 每次命中节省成本
```
只有预计命中次数高于盈亏平衡点时,缓存才真正省钱。
---
八、Batch、Flex 和异步处理为什么重要?
实时请求通常需要供应商预留低延迟容量,因此价格更高。大量后台任务并不需要秒级返回,例如:
- 商品文案;
- 文档分类;
- 历史数据清洗;
- 离线评测;
- 向量化;
- 日报和周报生成;
- 内容审核。
这类任务适合 Batch、Flex 或异步队列。除了价格更低,还能:
- 平滑流量峰值;
- 减少 429 限流;
- 简化重试;
- 更容易统计成功和失败批次;
- 避免实时链路被长任务阻塞。
设计系统时,应先问“这个任务真的需要实时吗”,而不是默认所有请求都走标准在线接口。
---
九、搜索、工具调用和 Agent 会怎样放大账单?
一个 Agent 请求可能触发:
1. 模型规划;
2. 搜索;
3. 网页抓取;
4. 数据库查询;
5. 第二次模型判断;
6. 代码执行;
7. 结果校验;
8. 最终回答。
每一步都可能产生 token 或工具费用。更复杂的是,工具返回内容会进入后续上下文,继续按输入 tokens 计费。
因此 Agent 的成本指标不应是“每次模型调用多少钱”,而应是:
```text
每个成功完成任务的总成本
= 全部模型调用
+ 全部工具调用
+ 重试
+ 失败任务
+ 人工接管
```
应记录:
- 每个任务调用了多少轮;
- 每个工具返回了多少 tokens;
- 哪些工具最容易失败;
- 模型是否重复调用相同工具;
- 是否存在无限循环;
- 最终任务是否真正完成。
---
十、最便宜模型可能更贵的五种情况
1. 输出质量差导致人工返工
若每 100 条内容中有 30 条需要人工修改,人工成本通常远高于 token 成本。
2. 结构化输出不稳定
频繁出现无效 JSON,会造成重试、解析修复和任务延迟。
3. 工具调用能力弱
Agent 选错工具、参数错误或反复调用,会迅速放大总调用次数。
4. 需要更长提示词
为了让能力较弱的模型理解任务,团队可能加入大量示例和规则,导致输入成本上升。
5. 任务成功率低
应该比较“成功完成 1,000 个任务的成本”,而不是“发出 1,000 次请求的成本”。
---
十一、推荐的模型分层策略
企业不应只选择一个模型覆盖所有任务。更合理的是建立四层路由。
第一层:规则与传统程序
能用正则、SQL、检索、模板和业务规则解决的问题,不调用大模型。
第二层:低成本模型
适合:
- 分类;
- 标签;
- 短文本提取;
- 格式转换;
- 简单翻译;
- 内容初筛。
第三层:主力通用模型
适合:
- RAG 问答;
- 复杂摘要;
- 商品与营销内容;
- 多步骤业务判断;
- 中等复杂度代码任务。
第四层:高能力模型
只处理:
- 长上下文推理;
- 高价值客户请求;
- 复杂代码与架构;
- 法务、财务等高风险辅助任务;
- 低成本模型失败后的升级请求。
路由规则可以基于任务类型、输入长度、风险等级、客户等级和历史失败率,而不是让所有请求默认使用同一模型。
---
十二、企业应该监控哪些成本指标?
至少建立以下指标:
| 指标 | 说明 |
|---|---|
| Cost per request | 每次请求平均成本 |
| Cost per successful task | 每个成功任务成本 |
| Input/output ratio | 输入与输出 token 比例 |
| Cache hit rate | 缓存命中率 |
| Retry rate | 重试比例 |
| Escalation rate | 升级到高价模型的比例 |
| Tool cost per task | 每个任务的工具调用成本 |
| Human review rate | 人工审核比例 |
| Cost by tenant | 每个客户或租户成本 |
| Cost by feature | 每项产品功能成本 |
| P95 task cost | 95 分位单任务成本 |
| Revenue-to-AI-cost ratio | 收入与 AI 成本比例 |
平均值可能掩盖极端长上下文和异常 Agent 循环,因此必须同时观察 P95 和 P99。
---
总结
2026 年的大模型 API 价格战,让模型单价变得越来越低,但也让成本结构更加复杂。企业不能再用一张“每百万 tokens 价格表”完成选型。
真正应该比较的是:
- 每个成功业务任务的总成本;
- 输出质量和人工返工;
- 缓存能否稳定命中;
- Batch、Flex 或异步任务是否可用;
- 长上下文是否触发溢价;
- 搜索和工具调用会产生多少额外费用;
- 模型失败后需要多少次重试;
- 高风险任务是否需要更强模型。
最有效的降本通常不是把所有请求切换到最便宜模型,而是建立分层路由、压缩输出、稳定缓存前缀、使用批处理、减少无效工具结果,并持续按“成功任务”监控成本。
想持续查看大模型价格、AI 工具对比和实际选型建议,可以访问 智元选:https://www.zyentorpicks.com/。我们会把不断变化的模型信息转化为更容易执行的决策依据。
---
📌 原文链接: 本文首发于 [智元选 AI 工具指南](https://www.zyentorpicks.com),未经许可不得转载。