推理模型价格战之后:大模型 API 成本、毛利与商业模式推演
一个三人团队做合同审阅 SaaS,原来用普通模型审一份合同大约 0.1 元,换成推理模型后,答案更细,但单份成本跳到 0.6 元。用户付费没涨,毛利被吃掉。2026 年各家 API 单价还在降,可推理模型输出 token 多,账单不一定跟着降。
算清楚一笔推理 API 账单,比等下一轮降价更实在。
一笔推理 API 账单由哪些 token 组成
大多数厂商的计费公式是:
单次成本 = 输入未命中 tokens × 输入单价 + 输入命中 tokens × 缓存单价 + 输出 tokens × 输出单价
推理模型特殊的地方在输出:思维链 token 通常按输出 token 计费。用户看到 800 字答案,后台可能跑了 2500 个推理 token。
表格里用一次合同审阅做量级对比,单价取公开定价中的常见档位,不针对具体厂商。
| 项目 | 普通模型 | 推理模型 |
|---|---|---|
| 系统提示 + 用户问题 | 3000 tokens | 3000 tokens |
| 检索到的合同条款 | 8000 tokens | 8000 tokens |
| 最终答案 | 800 tokens | 800 tokens |
| 推理 token | 0 | 2500 tokens |
| 按输出计费的总量 | 800 tokens | 3300 tokens |
- 普通模型:输入 11000 × $3/1M = $0.033,输出 800 × $15/1M = $0.012,合计约 $0.045。
- 推理模型:输入 11000 × $3/1M = $0.033,输出 3300 × $15/1M = $0.0495,合计约 $0.083。
下面是几个公开定价参照,用来建立量级感。价格会变,采购前必须按官网当期页面重算。
| 模型 | 输入 | 输出 | 备注 |
|---|---|---|---|
| GPT-4o | $2.50/1M | $10/1M | 通用模型 |
| o3-mini | $1.10/1M | $4.40/1M | 推理模型 |
| Claude 3.7 Sonnet | $3/1M | $15/1M | 支持扩展思考 |
| DeepSeek-V3 | 2 元/1M 未命中 | 8 元/1M | 2025-02 调价后 |
| DeepSeek-R1 | 4 元/1M 未命中 | 16 元/1M | 推理模型 |
- OpenAI:https://openai.com/api/pricing/
- Anthropic:https://www.anthropic.com/pricing
- DeepSeek:https://api-docs.deepseek.com/quick_start/pricing
- 阿里云百炼:https://help.aliyun.com/zh/model-studio/models
- 火山引擎:https://www.volcengine.com/docs/82379/1099320
推理成本降不动的四个环节
1. 输出 token 很难压缩
推理模型的输出包含答案和思维链。把 max_tokens 调小,复杂任务会截断推理,答案质量下降。调大,账单上限又不可控。
2. 缓存命中率决定输入成本
Anthropic 的 prompt caching 公开规则是:缓存写入按基础输入价的 1.25 倍计费,缓存读取按 0.1 倍计费。OpenAI 对缓存输入也有折扣。合同审阅场景里,系统提示、法规库、产品文档适合缓存;合同正文每次不同,缓存命中低。
3. 批处理折扣需要排队
OpenAI Batch API 提供 50% 折扣,但延迟高。实时客服等不了,离线报告生成可以等。把任务分成实时和离线两条队列,能省下一块成本。
4. GPU 利用率决定云厂商毛利
同样一张 H100,跑满和跑一半,单位 token 成本差一倍。云厂商卖 API 时,如果请求稀疏,毛利率会被 GPU 闲置吃掉。推理模型占用显存久,并发低,单位成本更难压。
先做一次成本体检:
- 导出最近 7 天调用日志,按模型名、输入 token、输出 token、缓存命中分组
- 算出 P50 和 P95 单次成本,不要只看平均值
- 检查
max_tokens是否默认设得过大 - 检查是否所有请求都走了推理模型
- 把批处理、缓存、小模型路由的节省写进预算表
开源与闭源:价格差在哪,什么时候自托管
开源模型权重公开,可以下载、量化、私有化部署。闭源 API 按 token 收费,免运维,但数据要经过厂商。
| 维度 | 闭源 API | 开源自托管 |
|---|---|---|
| 初始成本 | 低,注册即用 | 高,GPU、网络、存储、运维 |
| 单价 | 按 token 计费 | 电费 + 折旧 + 运维 |
| 质量 | 通常更强,更新快 | 取决于模型和评测 |
| 数据合规 | 依赖厂商协议 | 数据留在自己 VPC |
| 弹性 | 高,按量扩容 | 需要 K8s、vLLM、SGLang |
| 适合 | 快速上线、复杂推理 | 高频、稳定、隐私敏感 |
限制要说清楚:R1 671B 这类大模型不可能单机跑,通常用 7B、14B、32B 蒸馏版。蒸馏版在合同审阅、法律解释等任务上,未必能达到闭源推理模型的准确率。上线前要用自己的测试集跑一遍,不要只看榜单。
自托管的边界可以粗算:
月自托管 TCO = GPU 租用/折旧 + 电力 + 带宽 + 存储 + 运维人力
如果每月 API token 成本已经超过自托管 TCO 的 60%,并且请求量稳定、数据敏感,再评估迁移。
云厂商补贴与毛利:谁在补贴,补什么
云厂商补贴常见形式:
- 新用户免费 tokens
- 限时折扣
- 模型蒸馏服务
- GPU 预留实例折扣
- 针对特定模型的低价促销
通用模型 API 的毛利,公开财报里很少单独拆。按行业常见结构推演:
- 普通模型 API:毛利率可能在 10% 到 30% 之间,取决于 GPU 利用率和缓存命中。
- 推理模型 API:输出 token 多,GPU 占用久,毛利率可能接近成本线,甚至为负。
- 云厂商整体:靠存储、数据库、网络等产品把利润拉回来。
下面是一个路由决策图。简单任务不要喂给推理模型,非实时任务不要走实时 API。
按 token、订阅、按结果:三种计费怎么选
| 计费方式 | 用户感受 | 厂商风险 | 适合场景 | 例子 |
|---|---|---|---|---|
| 按 token | 用多少付多少 | 用户账单不可预测 | API、Agent、开发者 | OpenAI API |
| 订阅 | 固定月费 | 少数重度用户吃掉毛利 | 个人高频、轻量使用 | ChatGPT Plus $20/月 |
| 按结果 | 按份/按解决付费 | 交付质量定义难 | 垂直工作流 | 合同审阅按份、客服按解决 |
- B2B 工具:订阅底费 + 按结果超额。底费覆盖固定成本,超额按份或按工单收费。
- B2C 工具:订阅 + 用量上限。超过上限降级到小模型或排队。
- API 转售:按 token + 预算告警。给每个用户设日预算,超过后限流。
- 一份合同多少页以内
- 修改意见几条以上算交付
- 人工复核时间多久
- 争议时怎么退款
中小 AI 应用的生存策略
1. 不做通用聊天,做垂直工作流
合同审阅、工单分类、报告生成、代码审查、简历筛选,这些场景有明确输入输出,容易按结果定价。通用聊天要和巨头拼模型质量、拼免费额度,中小团队很难赢。
2. 路由:简单任务用小模型
分类、抽取、格式化输出用 7B 到 14B 模型,或者便宜的小模型 API。只有需要多步推理、数学、复杂代码时才调推理模型。路由规则先用关键词和规则引擎,再逐步上轻量分类器。
3. 缓存:把不变的内容放进 prompt cache
系统提示、法规库、产品文档、少样本示例,都是缓存候选。Anthropic 缓存读只要基础输入价的 0.1 倍,写要 1.25 倍。命中率高的场景,输入成本能降到原来的两三成。
4. 批处理:非实时任务走 Batch API
日报、周报、离线合同初审、批量标签,可以接受几分钟到几小时延迟。OpenAI Batch API 有 50% 折扣。把实时队列和离线队列分开,能省的钱比换模型更确定。
5. 护栏:给每个用户设预算
在应用层记录每次调用的 token 和成本。Langfuse、Helicone 这类工具可以按用户、会话、模型看花费。设置日预算、月预算、重试上限。max_tokens 不要默认 4096,按任务类型设。
6. 自托管边界:算 TCO,不要只看模型免费
月 API 成本超过自托管 TCO 的 60%,且请求量稳定、数据敏感,再考虑自托管。自托管后还要维护 GPU 驱动、推理框架、模型更新、故障转移。
7. 数据飞轮:用领域数据微调小模型
把人工复核结果、用户修改记录、工单解决记录存下来。积累几千条高质量样本后,微调 7B 到 14B 模型,替换一部分推理模型调用。微调不是一次完成,要持续评测。
一个合同审阅 SaaS 的算例
假设每天 5000 份合同,每份输入 12000 tokens,输出 3000 tokens,其中含推理 token。
用 Claude 3.7 Sonnet 公开价 $3/1M 输入、$15/1M 输出:
5000 × (12000 × 3/1M + 3000 × 15/1M) = 5000 × (0.036 + 0.045) = 405 美元/天
约合人民币 1.2 万元/天,一个月 36 万元。
如果 70% 输入走缓存,缓存读单价按 0.1 倍算,输入成本变成 0.0108 美元/份:
5000 × (0.0108 + 0.045) = 279 美元/天
一个月约 8.4 万元。还是高,但已经砍掉大半。
如果换成 DeepSeek-V3,输入 2 元/1M、输出 8 元/1M:
5000 × (12000 × 2/1M + 3000 × 8/1M) = 5000 × (0.024 + 0.024) = 240 元/天
一个月约 7200 元。代价是质量可能下降,需要用自己的合同测试集评测。
结论不复杂:先做缓存和路由,再考虑换模型。单纯等单价下降,降不过推理 token 的增长。
下一步做什么
打开你最近的 API 账单,导出 7 天调用日志,按输入、输出、缓存命中、模型名分组。算一次 P95 单次成本。如果输出 token 占比超过 60%,先限制 max_tokens、加缓存、把非实时任务移到批处理队列,不要先换更贵的模型。
免责声明:本文价格与政策来自各厂商公开定价页,随时可能调整。采购前以官网当期页面为准。本文不构成投资建议。
推荐视频:在 B 站、腾讯视频、优酷、抖音搜索“大模型 API 价格战 成本拆解”,优先看发布日期在 2025 到 2026 年、且贴出官方定价页的视频。本文不嵌入具体链接,避免链接过期;不对第三方视频内容负责。