价格战留下的不是低价,是新的成本结构
2024 年 5 月,DeepSeek 给 DeepSeek-V2 报出输入 1 元/百万 tokens、输出 2 元/百万 tokens。同一个月,火山引擎把豆包 doubao-pro-32k 的输入价压到 0.8 元/百万 tokens,阿里通义千问 Qwen-Long 报到 0.5 元/百万 tokens,百度把 ERNIE Speed 和 ERNIE Lite 直接免费开放。
两年后回看,单 token 价格这条线已经低到不像成本项。但换过模型的公司大多有同样的体感:账单没有按比例下降。
几轮公开定价的锚点
单位:元/百万 tokens。下表为各家发布时的公开报价,后续经过多次调整,实际以官方定价页为准。
| 时间 | 模型 | 输入 | 输出 |
|---|---|---|---|
| 2024-05 | DeepSeek-V2 | 1 | 2 |
| 2024-05 | 豆包 doubao-pro-32k | 0.8 | 2 |
| 2024-05 | 通义千问 Qwen-Long | 0.5 | 2 |
| 2024-05 | 文心 ERNIE Speed / ERNIE Lite | 免费 | 免费 |
| 2024-12 | DeepSeek-V3 | 2(缓存命中 0.5) | 8 |
| 2025-01 | DeepSeek-R1 | 4(缓存命中 1) | 16 |
| 2025-09 | DeepSeek-V3.2-Exp | 缓存命中 0.2 | 3 |
决定账单的四个变量
输入输出比。 客服问答、摘要、分类这类场景,输入往往是输出的 5 到 20 倍;写作、代码生成可能接近 1:1 甚至倒挂。输出 token 的单价一般是输入的 3 到 4 倍,比例一变,成本结构就跟着变。
缓存命中率。 多数厂商对命中前缀缓存的输入按 1/4 到 1/10 计价。系统提示词固定、知识库拼接方式稳定的应用,命中率能到 60% 以上;每次把检索结果随机插在最前面的应用,命中率接近 0。
长上下文。 请求从 4K 涨到 128K,输入 token 是 32 倍,注意力计算量的增长还更快,长上下文档位常常单独计价。
单任务调用次数。 Agent 类应用一次用户请求可能触发 5 到 30 次模型调用,中间还夹着工具返回的大段 JSON。按 token 单价算它很便宜,按"完成一次任务"算,差距可能有一个数量级。
单价下降发生在 token 层面,账单上涨发生在任务层面,两者之间隔着调用次数和重试。
把推理成本压下去的四条路
MoE:省算力,不省显存
DeepSeek-V3 总参数 671B,每个 token 激活 37B;Qwen3 的 235B 版本激活 22B。稀疏激活把每 token 的浮点运算量拉低一个量级,代价是显存得装下全部专家权重。
自部署时这个区别很关键:MoE 模型的显存下限由总参数决定,吞吐优势由激活参数决定。想靠 MoE 省钱,前提是并发足够高,能把显存摊薄。
量化:用精度换显存和带宽
| 精度 | 权重显存(相对 FP16) | 常见格式 | 用在哪 |
|---|---|---|---|
| FP16 / BF16 | 1.0x | safetensors | 服务端高并发、质量敏感任务 |
| INT8 | 约 0.5x | GPTQ、AWQ、SmoothQuant | 服务端省显存 |
| INT4 | 约 0.25x | GPTQ、AWQ、GGUF Q4 | 单卡部署、端侧 |
| 2-3 bit | 约 0.15x | GGUF Q2 / Q3 | 极限压缩,质量损失明显 |
做法上,先在目标任务集上跑一遍量化前后对比,再决定用哪一档。拿通用榜单分数选量化档位,误差往往很大。
蒸馏:把大模型的能力搬到小模型
DeepSeek 在 2025 年 1 月开源了 R1 的蒸馏版本,覆盖 1.5B 到 70B 多档参数,底座包括 Qwen 和 Llama 系列。蒸馏让小模型在特定分布上接近教师模型,泛化面会收窄。
适合什么样的团队:任务边界清晰、有几千到几万条标注或半标注数据、愿意持续迭代。任务每周都在变的团队,做蒸馏的投入很难收回。
端侧小模型:把边际成本压到零
Qwen3 系列有 0.6B、1.7B、4B 几档,面壁智能的 MiniCPM 系列主打手机和边缘设备,苹果端侧模型量级在 3B 左右。
端侧真正解决的问题有三个:调用量大到 API 费用不可控、数据不能出设备、网络不稳定或需要离线。代价是能力上限、内存和功耗预算,以及模型更新要走应用发版。
端侧和云端不冲突。常见的分工是端侧做分类、改写、意图识别、敏感信息过滤,云端做复杂推理和长文档处理。
四条路对比
| 手段 | 主要降低 | 主要代价 | 适合谁 |
|---|---|---|---|
| MoE | 每 token 算力 | 显存下限高 | 高并发云端服务 |
| 量化 | 显存与带宽 | 部分任务质量下降 | 单卡部署、端侧 |
| 蒸馏 | 推理成本与延迟 | 泛化面收窄 | 任务边界固定的团队 |
| 端侧小模型 | 边际调用成本 | 能力上限、更新成本 | 高频、隐私敏感场景 |
商业模式:从卖 token 到卖什么
免费额度加增值
免费额度换的是开发者的默认选择。增值点落在并发上限、上下文长度、SLA、数据隔离、专属实例上。这套模式的前提是免费用户的推理成本能被付费用户摊掉,所以厂商会严格区分免费档的模型规格和速率。
采购方要提前读免费档的限流和降级条款,别把原型期的体验当成生产可用性。
按结果付费
按成功工单、按处理通过的简历、按上架的商品文案计费。这种模式把模型风险从买方转到卖方,报价通常高 2 到 5 倍,用来覆盖失败调用。
落地难点在口径:什么算"成功"、谁来判定、失败重试算不算钱。合同里要把判定规则写死,否则结算时扯皮。
私有化部署与一体机
按一次性授权加年度维保报价,价格和 token 用量脱钩,和"数据不出内网"这条合规要求挂钩。
选这条路的团队常低估两件事:推理硬件的显存需求(MoE 模型尤其),以及模型版本升级时的重新验证工作量。
订阅制
面向个人开发者和中小团队,按月给固定额度和若干高级功能。毛利取决于额度设计——给 token 额度容易亏,给功能权限更容易算清楚。
云厂商和模型厂商在争什么
云厂商关心的是算力消耗和客户留存,模型在它眼里是可替换的部件。它愿意同时托管十家模型让客户自己挑,只要算力还在自家机房里。
模型厂商关心的是调用量、反馈数据和品牌。它希望用户记住模型名字,而不是记住某朵云。
开源权重是模型厂商的谈判筹码。权重公开意味着客户随时可以自部署,云厂商就只能拼托管服务的工程能力:部署速度、并发弹性、缓存优化、可观测性。
这几年的走向是两边互相侵入。模型厂商自己提供 API 和托管服务,云厂商一边托管第三方模型,一边推自研模型。
采购方要盯的是锁定风险。选型时问三个问题:换模型要改多少代码、评估集能不能复用、数据能不能导出。这三个问题的答案决定了你下一轮谈判的位置。
企业选型:一张可以照着填的清单
先算单任务成本,再比 token 单价。
单任务成本 =(输入 tokens × 输入单价 + 输出 tokens × 输出单价 × 重试系数 + 工具调用开销)× 单任务调用次数。
重试系数和调用次数是最容易漏的两项。
选型检查项:
- 导出过去一个月账单,按输入 tokens、输出 tokens、缓存命中率、调用次数四项拆开
- 统计真实请求的输入长度分布,看 P50 和 P95 差多少
- 检查系统提示词是否固定,能不能把前缀缓存命中率做上去
- 统计一次业务任务平均触发几次模型调用
- 准备 50 到 200 条自己的评估样本,覆盖边界情况
- 自部署方案要问清显存下限、量化档位、并发下的首 token 延迟
- 端侧方案要问清内存占用、模型更新方式、是否支持热更新
- 合同里确认限流条款、降级策略、数据留存和导出方式
下一步做什么
把上个月的大模型账单导出来,按"业务任务"而不是"API 调用"重新聚合一次。如果聚不出来,说明日志里缺少任务 ID、输入长度和重试次数的埋点,先把这三项加上,再谈降本。
参考视频
下面几场发布会的回放可以在 B 站、腾讯视频、优酷、抖音上搜到,关键词:
- 火山引擎 2024 年 5 月 Force 原动力大会(豆包大模型定价发布)
- DeepSeek-V3.2-Exp 发布与 API 降价说明
- Qwen3 系列开源模型发布