从DeepSeek到MCP:2026中国大模型生态的五个拐点

行业趋势DeepSeekMCP大模型生态Agent协议MaaS合规出海20262026-09-30

一个 6 人团队,2026 年 1 月想把工单系统接上模型。三周前他们用 DeepSeek 的 API 跑通了问答,现在要加三个动作:改工单状态、查库存、发通知。问题从“用哪个模型”变成了“用哪个协议把这些动作挂上去”。这一年里,模型价格表、云厂商的 MaaS 货架、Agent 协议、备案要求几乎同时动过。

拐点一:开源权重压住 API 价格,自部署的账要算四项

时间点可核验:2024 年 12 月 DeepSeek-V3 以 MIT 许可开源,官方技术报告写训练消耗 278.8 万 H800 GPU 小时;2025 年 1 月 DeepSeek-R1 开源,同样是 MIT;阿里 Qwen 系列多个尺寸走 Apache 2.0,2025 年 4 月发布 Qwen3;2025 年 7 月月之暗面开源 Kimi K2,总参数 1T 的 MoE。

权重公开后,闭源 API 的定价空间被压住。DeepSeek 官方价目表把输入拆成缓存命中和未命中两档,输出单列一档,改过几轮,这里不写死数字,用的时候看当期页面。

单价只是其中一项,自部署还要算这四项:

要算的项怎么估常算错的地方
显存权重 ≈ 参数量 × 每参数字节(FP16 约 2、INT8 约 1、INT4 约 0.5),再留 KV Cache只算权重,并发一起来就 OOM
吞吐拿真实 prompt 长度压测,看首 token 延迟和每秒输出用短 prompt 测,结果偏乐观
跟版人力上游权重每次更新,都要重新量化、回归、上线按“部署一次”算,实际每个月都要动
数据与条款数据是否出域、审计要求、开源许可的覆盖范围把开源许可当合规许可,两件事
判断标准可以粗一点:日均 token 量不大、任务不卡延迟、要频繁换模型试错的团队,调 API 更划算;数据不能出域,或者自己算下来单位 token 成本已经高过机房折旧加电费,才考虑自部署。中间那一档是买云上的托管开源模型,2026 年大多数团队待在这个位置。

拐点二:MaaS 货架上,模型正在变成可替换件

2025 年上半年,腾讯云、阿里云百炼、火山引擎、百度智能云先后在自己的控制台里加了 MCP 服务入口或者 MCP 市场。这一步把 MaaS 的卖点从“我有多少 token 额度”挪到了“我这边挂了多少现成工具”。对使用者来说,模型 ID 越来越像可替换件。

迁移成本的变化很具体。换模型时,权重和推理框架不用你操心,真正花时间的是三样:提示词里的措辞和格式约束、工具描述(Agent 靠它决定调哪个)、你自己的评测集。前两样会随模型换而失效,第三样决定你能不能判断“换完到底变好还是变差”。

工程上做一件事就够:在业务代码和厂商 SDK 之间加一层薄适配层,只暴露 chat(messages, tools)、embed(texts) 这类你自己的函数签名,厂商 SDK 的对象不要透传到业务层。这层写起来不到一百行,换模型时能省掉全项目搜索替换。

拐点三:MCP 定了工具层接口,只读工具先跑通

MCP(Model Context Protocol)由 Anthropic 在 2024 年 11 月开源。之后两次改动值得记日期:2025 年 3 月 26 日,传输层改成 Streamable HTTP,替掉了原来的 HTTP+SSE 双端点方案;2025 年 6 月 18 日版本加了 elicitation(服务端可以回头向用户要补充信息)、结构化工具输出,并把 MCP server 归到 OAuth 资源服务器这一类角色。OpenAI 在 2025 年 3 月表示 Agents SDK 支持 MCP,Google DeepMind 也在 2025 年 4 月表态支持。

一次调用的链路是这样:

sequenceDiagram participant U as 用户 participant H as 宿主应用 participant C as MCP客户端 participant S as MCP服务端 participant A as 内部系统 U->>H: 把工单1024改成已处理 H->>C: 带上工具列表请求模型 C->>S: tools/call change_status S->>A: PATCH /tickets/1024 A-->>S: 200 S-->>C: 结构化结果 C-->>H: 结果与下一步

动手顺序:

  • 挑一个只读接口先包,别一上来就写改数据的工具
  • 用官方 SDK(TypeScript 或 Python)起 stdio server,本地跑通一次
  • 工具描述写清三件事:什么场景用、参数取值范围、失败返回什么
  • 再换成 Streamable HTTP,加鉴权,然后才是多实例
  • 客户端配工具白名单,服务端对每个调用再验一次权限
先做只读的原因很实际:Agent 调错工具的代价是真实数据被改,回滚比调试贵。

顺带分清两个协议。MCP 管的是 Agent 怎么用工具和数据,A2A 管的是 Agent 之间怎么互相派活。A2A 由 Google 在 2025 年 4 月发布,2025 年 6 月捐给 Linux Foundation;IBM 和 BeeAI 推的 ACP 后来也进了 Linux Foundation 体系。做多 Agent 的项目两个都会碰到,但工具层是必经之路,先解决 MCP。

拐点四:Agent 的 token 账单,让定价方式变了

问答类产品按 token 计费,和成本基本对得上。Agent 不行:一次任务要跑多轮工具调用,每轮都把工具 schema 和对话历史重新塞进上下文,消耗按工具数量和上下文管理方式放大。按调用次数定价,遇到长任务就亏。

能看到的做法有三种,选哪种取决于你的任务能不能切成固定单位:

  • 按席位:适合内部工具,用户数稳定,成本靠总量摊。
  • 按任务:适合交付边界清楚的场景,比如一份合同比对、一批商品标题改写。报价前先测出单任务 token 均值。
  • 按结果:只在结果可验证时用,比如生成的 SKU 属性通过校验才计费。验证脚本本身也是成本。
定价前先测三个数:单任务平均工具调用轮数、每轮的上下文长度、失败重试率。这三个数决定单任务成本,比模型单价重要。

拐点五:备案、内容标识、数据跨境,三条线分开走

合规容易混成一团,拆成三条线就清楚:

线依据与时间要做什么
面向公众提供服务《生成式人工智能服务管理暂行办法》2023 年 8 月 15 日施行按属地流程做生成式 AI 服务备案,语料和模型来源要能说清
内容标识《人工智能生成合成内容标识办法》2025 年 3 月 14 日发布,2025 年 9 月 1 日施行生成的图片、音视频、文本按要求做显式标识,元数据里写隐式标识
出海欧盟 AI Act 2024 年 8 月 1 日生效,通用模型义务 2025 年 8 月起适用,高风险系统大部分义务 2026 年 8 月起适用按落地国判断角色是提供方还是部署方,准备技术文档和风险管理材料
深度合成类服务还要看《互联网信息服务深度合成管理规定》(2023 年 1 月 10 日施行)。这几份文件管的事不一样,别用一份的结论去回答另一份的问题。

做海外业务的团队多问一句:模型权重从哪来、用户数据存哪、日志留多久。三个问题回答不上来,后面补的代价很高。

今天能动手的一件事

打开你团队最常用的那个内部 HTTP 接口文档,挑一个只读的 GET 接口,用官方 SDK 包成一个 MCP 工具,在本地客户端调用一次,把这次会话的 token 数记下来。这个数字是你定价时的起点,也能让你知道那层模型适配层该留多厚。


关于参考视频:视频链接和 UP 主会随时间失效或改名,这里不给具体 URL,避免出现死链和错误署名。想看视频的,在 B 站、腾讯视频、优酷或抖音搜索「MCP 模型上下文协议 实战」「DeepSeek 私有化部署」,优先选同时满足两个条件的:视频里报了 spec 版本号或制作日期(涉及 MCP 的,看是否包含 2025-06-18 之后的信息),并且用官方 SDK 实际敲代码。平台通常把旧教程排在前面,MCP 在 2025 年换过传输方式,日期太早的教程照着做会卡在鉴权那一步。

免责声明:本文提到的时间点、版本号和文件名以官方发布渠道为准;模型价格、备案流程与合规要求更新频繁,落地前请以模型厂商当期价目表、网信部门公开信息和当地监管要求为准。本文不构成法律意见,也不构成投资建议。

PREMIUM

需要完整版教程?

包含详细步骤、视频演示、提示词模板和可下载资料包。微信支付即时获取。

购买完整版 ¥29.90