2026 中国大模型价格战下半场:谁在靠推理成本赚钱?
假设一个 SaaS 客服团队月调用 8 亿输入 token、1.2 亿输出 token。只看官网输入输出价,按 DeepSeek-V2 2024 年 5 月公开价估算:输入 800 元,输出 240 元,合计 1040 元。真实账单常比这高,差在缓存命中、超长上下文、重试、向量检索、网关和私有化运维。2026 年选型,先把这些科目拆开。
2026 年还能查到的公开定价锚点
下表只放历史公开价,用来解释计费维度。2026 年各平台价格和折扣已变化,签合同前以官网账单页和销售报价为准。
| 平台 | 模型/系列 | 计费维度 | 历史公开锚点(需按官网复核) |
|---|---|---|---|
| DeepSeek | DeepSeek-V2 | 输入、输出、缓存命中 | 2024-05 前后:输入 1 元/百万 tokens,输出 2 元/百万 tokens |
| 火山引擎 | 豆包 Pro-32k | 输入、输出 | 2024-05 前后:输入 0.0008 元/千 tokens,输出 0.002 元/千 tokens |
| 阿里云百炼 | Qwen-Long 等 | 输入、输出、上下文长度分档 | 2024 年有大幅降价,具体档位看百炼定价页 |
| 百度千帆 | ERNIE Speed/Lite | 输入、输出 | 2024 年 3 月有免费策略,免费额度和 QPS 需复核 |
| 腾讯云混元 | 混元 lite | 输入、输出 | 2024 年有 lite 免费策略,企业并发限制需复核 |
| 智谱 | GLM-4-Flash | 输入、输出 | 2024 年有免费/低价策略,限流和商用条款需复核 |
MoE 省的是算力,不是显存
DeepSeek-V2 是 236B 总参数、21B 激活参数的 MoE。每个 token 只走部分专家,计算量接近 21B 稠密模型,推理 FLOPs 降下来。显存仍要承载总参数或专家分片,专家并行会带来通信开销。小 batch 下专家利用率低,单位 token 成本可能比稠密模型高。
企业侧要看服务商的 batch 调度和专家并行效率。并发低、延迟要求高的在线客服,未必能吃到 MoE 的便宜。离线批量摘要、代码补全后台任务,更适合把 batch 拉高。
量化把显存和带宽打下来,质量要单独测
FP16 换 FP8 或 INT8,显存占用和显存带宽下降,同样卡能跑更高吞吐。INT4 更省,但长链推理、数学、代码生成容易掉点。国产芯片对 INT8 支持较好,FP8 工具链还在补。
做错的情况:为了省卡直接上 INT4,模型开始漏字段、JSON 格式错、代码编译失败。重试两次,省下的算力又花回去。上线前用 200 条真实任务做量化前后对比,记录准确率、格式合规率、P95 延迟。
缓存命中率比单价更能改账单
前缀缓存适合固定 system prompt、RAG 模板、多轮对话。相同前缀第二次进来,服务端跳过重复计算,按缓存命中价计费。DeepSeek 历史价里缓存命中输入远低于未命中输入。
用公式算:
月输入成本 = 未命中输入 token × 输入价 + 命中输入 token × 缓存价
如果 8 亿输入里 70% 命中,按 1 元/百万未命中、0.1 元/百万命中估算,输入从 800 元降到 296 元。输出价不变,总成本仍看输出。
缓存不会自动生效。prompt 前缀频繁变、时间戳放开头、用户 ID 混在 system prompt,命中率会接近零。把固定指令放前面,动态内容放后面,缓存命中率才起得来。
国产芯片:租还是买,先算适配账
昇腾 910B、寒武纪思元 590、海光 DCU 等推理卡在云上可租。自购适合稳定高负载、数据不出域的场景。成本别只看卡价:
- 卡价按 3 年折旧
- 电费、机房、交换机
- 运维人力
- 算子适配和性能调优
- 故障备件
云厂商为什么敢把 API 卖便宜
API 单价低,云资源能把钱赚回来。模型调用起来后,向量数据库、对象存储、日志、网关、专线、安全、GPU 实例跟着上。毛利模型大致分三层:
| 模式 | 收入项 | 毛利特点 | 风险 |
|---|---|---|---|
| 公有 API | token 费、预留吞吐 | 规模大后毛利改善,价格透明 | 价格战、客户迁移 |
| 云资源捆绑 | 存储、数据库、网络、安全 | 续费稳定,毛利较高 | 被多云策略拆单 |
| 私有化部署 | License、硬件、实施、维保 | 项目毛利高 | 交付重、回款慢、版本碎片 |
企业选型框架
执行清单:
- 抽 1 万条真实请求,统计输入输出 token 的 P50、P95。
- 记录缓存命中率、重试率、JSON 解析失败率。
- 算单位任务成本:
单次成本 = 输入 token×价 + 输出 token×价 + 缓存命中修正 + 重试成本 + 向量检索 + 网关 + 运维分摊。 - 同评测集跑 2 到 3 家模型,比准确率、P95 延迟、每千次任务成本。
- 谈承诺消费折扣、缓存折扣、批量任务折扣、预留吞吐。
- 用统一 API 网关,保留模型替换开关和请求日志。
视频资料与免责声明
需要视频资料时,去 B 站、腾讯视频、优酷、抖音搜索“DeepSeek-V2 API 计费”“昇腾 910B 推理实测”“MoE 推理成本”。优先看官方账号或带账单截图、压测脚本的 UP 主。这里不附具体视频链接,避免 2026 年链接失效或出处错误。视频内容不代表这些结论,价格和性能以平台官网、合同和你的实测为准。
下一步:拿上个月真实请求日志,抽 1 万条,算 P95 输入输出 token 和缓存命中率。把这个数填进单位任务成本表,再找两家云厂商要 2026 年当前账单价。