先看两个数字:0.5 元/百万 tokens 和 2025-06-18 版 MCP
DeepSeek 把 V3 的缓存命中输入价压到 0.5 元/百万 tokens 后,2026 年做 AI 应用的人算账方式变了:模型选型先看缓存命中率和输出价格,再看跑分。另一边,MCP 规范在 2025-06-18 版之后,工具调用从每家 SDK 各写一套,变成客户端和服务器可以互相复用。两条线叠在一起,中国 AI 生态的竞争面落在成本曲线和连接协议上。
下面用官方文档能查到的价格和规范版本,拆一下云厂商、开发者、创业公司各自该站哪。
一、DeepSeek 开源模型如何压低推理成本
DeepSeek-V3 和 DeepSeek-R1 的模型权重已经开源,V3 权重使用 MIT 许可。开源带来两个直接结果:云厂商可以托管同一份模型打价格战;企业可以拿权重自建推理,不必只买 API。
以 DeepSeek API 定价 在 2025 年 2 月恢复后的标准价为例:
| 模型 | 缓存命中输入 | 缓存未命中输入 | 输出 | 说明 |
|---|---|---|---|---|
| DeepSeek-V3 | 0.5 元/百万 tokens | 2 元/百万 tokens | 8 元/百万 tokens | 通用对话、摘要、分类 |
| DeepSeek-R1 | 1 元/百万 tokens | 4 元/百万 tokens | 16 元/百万 tokens | 推理模型,输出更贵 |
压低成本的关键动作有四个:
- 缓存命中:系统提示、工具说明、长文档前缀固定,重复请求走缓存。很多团队账单高,是因为每轮对话都改前缀。
- 控制输出:输出 token 单价通常是输入的 4 倍。客服摘要、分类任务先限制 max tokens。
- 批处理:离线任务攒批调用,比逐条请求更容易拿折扣和提升 GPU 利用率。
- 自托管:用 vLLM、SGLang 等推理框架在 GPU 上跑 V3/R1 蒸馏版或量化版。并发高、数据不能出内网、有运维人手时再考虑。
月成本 = GPU 实例小时价 × 24 × 30 × 卡数 + 存储/网络/运维
再和 API 的 输入 tokens × 单价 + 输出 tokens × 单价 对比。自托管不是零成本,闲时 GPU 也在烧钱。
一个马上能做的检查:导出上月 API 用量,按缓存命中输入、未命中输入、输出三项拆开。如果缓存命中低于 30%,先改提示词结构和会话复用,再谈换模型或自建。
二、MCP 为何成为工具调用事实标准
MCP(Model Context Protocol)由 Anthropic 在 2024 年 11 月开源,当前规范版本可查 2025-06-18。它定义客户端和服务器怎么交换工具、资源、提示模板。传输层支持本地 stdio 和远程 Streamable HTTP。
Function Calling 解决模型怎么表达调用意图;MCP 解决工具怎么被不同客户端发现和复用。一个订单查询 MCP Server 写完后,Claude Desktop、Cursor、OpenAI Agents SDK 等客户端可以按同一套协议接。具体支持列表以各客户端文档为准。
| MCP 规范版本 | 关键变化 | 对开发者的影响 |
|---|---|---|
| 2024-11-05 | 初版 | 本地 stdio、SSE 工具调用 |
| 2025-03-26 | Streamable HTTP、OAuth 2.1 授权 | 远程 MCP 能接企业 SSO |
| 2025-06-18 | 安全、认证、生命周期修订 | 企业接入要检查权限和审计 |
限制也要写清楚:MCP 不负责模型推理,不保证工具安全。写操作必须二次确认。不同版本的 SDK 和 Server 可能不兼容。
调试入口:装官方 MCP Inspector,npx @modelcontextprotocol/inspector,先跑 tools/list,再测一个只读工具。写工具不要直接连生产权限。
三、云厂商与开发者的新站位
阿里云百炼、火山方舟、腾讯云大模型知识引擎、百度智能云千帆、华为云 ModelArts Studio 等平台,已经把 DeepSeek 模型托管和 MCP 相关入口放进控制台。功能细节以各平台当前文档为准。
| 角色 | 2025 前后常见做法 | 2026 要补的活 |
|---|---|---|
| 云厂商 | 卖 token、卖 GPU 实例 | 远程 MCP 托管、OAuth、调用日志、SLA |
| 应用开发者 | 每个模型写 function calling | 复用 MCP Server,做评测、权限、降级 |
| 企业 IT | 私有化模型和知识库 | 工具目录、数据边界、审计、写操作审批 |
- 把内部 API 包成 MCP Server,用 JSON Schema 定义输入输出
- 加 API Key 或 OAuth 2.1,读工具和写工具分开授权
- 在 Agent 里设置工具超时、重试、人工确认
- 记录每次工具调用,脱敏后进日志
四、创业公司机会与风险
机会集中在工具层,不在通用聊天机器人。
- 垂直 MCP Server:跨境电商订单、物流、退款,国内 CRM、工单、财务。卖连接器维护和权限设计,不卖模型。
- MCP 网关与审计:企业要统一鉴权、限流、日志、按部门配额。
- 评测与可观测性:工具调用成功率、延迟、错误类型、token 花费。
- 私有化推理加小模型工具调用:金融、医疗、政务不能让数据出内网。
- 开发者工具:MCP Server 模板、Schema 生成、本地调试。
- 云厂商把基础 MCP 托管做成免费或低价,独立网关难收费。
- 提示注入诱导写操作、越权读数据。一次事故会拖慢企业采购。
- 协议和 SDK 版本变化,维护成本高。
- 客户预算从模型 API 转到工具调用后,单价被压。
五、未来 12 个月判断(2026-09 到 2027-09)
- 远程 MCP 托管会成为云厂商默认入口。本地 stdio 继续用于开发和隐私场景。
- 计费单位增加:工具调用次数、连接器席位、审计日志存储。只看 tokens 账单解释不了 Agent 成本。
- 开源模型继续压输入价格,输出价格下降慢。缓存命中率、批处理、量化决定毛利。
- 企业采购会问三件事:OAuth 2.1 资源服务器、工具权限粒度、审计日志保留多久。
- 安全创业窗口在 12 个月内。MCP 提示注入和工具越权还没有统一答案。
- 云厂商 MCP 服务是否写进 SLA
- 是否按工具调用收费
- 是否支持 OAuth 2.1 和 SSO
- 开源模型 API 是否继续降价,还是转向缓存和批处理折扣
价格与规范版本会变,以官方文档为准;本文不构成投资建议。