一个 6 人团队,2026 年 1 月想把工单系统接上模型。三周前他们用 DeepSeek 的 API 跑通了问答,现在要加三个动作:改工单状态、查库存、发通知。问题从“用哪个模型”变成了“用哪个协议把这些动作挂上去”。这一年里,模型价格表、云厂商的 MaaS 货架、Agent 协议、备案要求几乎同时动过。
拐点一:开源权重压住 API 价格,自部署的账要算四项
时间点可核验:2024 年 12 月 DeepSeek-V3 以 MIT 许可开源,官方技术报告写训练消耗 278.8 万 H800 GPU 小时;2025 年 1 月 DeepSeek-R1 开源,同样是 MIT;阿里 Qwen 系列多个尺寸走 Apache 2.0,2025 年 4 月发布 Qwen3;2025 年 7 月月之暗面开源 Kimi K2,总参数 1T 的 MoE。
权重公开后,闭源 API 的定价空间被压住。DeepSeek 官方价目表把输入拆成缓存命中和未命中两档,输出单列一档,改过几轮,这里不写死数字,用的时候看当期页面。
单价只是其中一项,自部署还要算这四项:
| 要算的项 | 怎么估 | 常算错的地方 |
|---|---|---|
| 显存 | 权重 ≈ 参数量 × 每参数字节(FP16 约 2、INT8 约 1、INT4 约 0.5),再留 KV Cache | 只算权重,并发一起来就 OOM |
| 吞吐 | 拿真实 prompt 长度压测,看首 token 延迟和每秒输出 | 用短 prompt 测,结果偏乐观 |
| 跟版人力 | 上游权重每次更新,都要重新量化、回归、上线 | 按“部署一次”算,实际每个月都要动 |
| 数据与条款 | 数据是否出域、审计要求、开源许可的覆盖范围 | 把开源许可当合规许可,两件事 |
拐点二:MaaS 货架上,模型正在变成可替换件
2025 年上半年,腾讯云、阿里云百炼、火山引擎、百度智能云先后在自己的控制台里加了 MCP 服务入口或者 MCP 市场。这一步把 MaaS 的卖点从“我有多少 token 额度”挪到了“我这边挂了多少现成工具”。对使用者来说,模型 ID 越来越像可替换件。
迁移成本的变化很具体。换模型时,权重和推理框架不用你操心,真正花时间的是三样:提示词里的措辞和格式约束、工具描述(Agent 靠它决定调哪个)、你自己的评测集。前两样会随模型换而失效,第三样决定你能不能判断“换完到底变好还是变差”。
工程上做一件事就够:在业务代码和厂商 SDK 之间加一层薄适配层,只暴露 chat(messages, tools)、embed(texts) 这类你自己的函数签名,厂商 SDK 的对象不要透传到业务层。这层写起来不到一百行,换模型时能省掉全项目搜索替换。
拐点三:MCP 定了工具层接口,只读工具先跑通
MCP(Model Context Protocol)由 Anthropic 在 2024 年 11 月开源。之后两次改动值得记日期:2025 年 3 月 26 日,传输层改成 Streamable HTTP,替掉了原来的 HTTP+SSE 双端点方案;2025 年 6 月 18 日版本加了 elicitation(服务端可以回头向用户要补充信息)、结构化工具输出,并把 MCP server 归到 OAuth 资源服务器这一类角色。OpenAI 在 2025 年 3 月表示 Agents SDK 支持 MCP,Google DeepMind 也在 2025 年 4 月表态支持。
一次调用的链路是这样:
动手顺序:
- 挑一个只读接口先包,别一上来就写改数据的工具
- 用官方 SDK(TypeScript 或 Python)起 stdio server,本地跑通一次
- 工具描述写清三件事:什么场景用、参数取值范围、失败返回什么
- 再换成 Streamable HTTP,加鉴权,然后才是多实例
- 客户端配工具白名单,服务端对每个调用再验一次权限
顺带分清两个协议。MCP 管的是 Agent 怎么用工具和数据,A2A 管的是 Agent 之间怎么互相派活。A2A 由 Google 在 2025 年 4 月发布,2025 年 6 月捐给 Linux Foundation;IBM 和 BeeAI 推的 ACP 后来也进了 Linux Foundation 体系。做多 Agent 的项目两个都会碰到,但工具层是必经之路,先解决 MCP。
拐点四:Agent 的 token 账单,让定价方式变了
问答类产品按 token 计费,和成本基本对得上。Agent 不行:一次任务要跑多轮工具调用,每轮都把工具 schema 和对话历史重新塞进上下文,消耗按工具数量和上下文管理方式放大。按调用次数定价,遇到长任务就亏。
能看到的做法有三种,选哪种取决于你的任务能不能切成固定单位:
- 按席位:适合内部工具,用户数稳定,成本靠总量摊。
- 按任务:适合交付边界清楚的场景,比如一份合同比对、一批商品标题改写。报价前先测出单任务 token 均值。
- 按结果:只在结果可验证时用,比如生成的 SKU 属性通过校验才计费。验证脚本本身也是成本。
拐点五:备案、内容标识、数据跨境,三条线分开走
合规容易混成一团,拆成三条线就清楚:
| 线 | 依据与时间 | 要做什么 |
|---|---|---|
| 面向公众提供服务 | 《生成式人工智能服务管理暂行办法》2023 年 8 月 15 日施行 | 按属地流程做生成式 AI 服务备案,语料和模型来源要能说清 |
| 内容标识 | 《人工智能生成合成内容标识办法》2025 年 3 月 14 日发布,2025 年 9 月 1 日施行 | 生成的图片、音视频、文本按要求做显式标识,元数据里写隐式标识 |
| 出海 | 欧盟 AI Act 2024 年 8 月 1 日生效,通用模型义务 2025 年 8 月起适用,高风险系统大部分义务 2026 年 8 月起适用 | 按落地国判断角色是提供方还是部署方,准备技术文档和风险管理材料 |
做海外业务的团队多问一句:模型权重从哪来、用户数据存哪、日志留多久。三个问题回答不上来,后面补的代价很高。
今天能动手的一件事
打开你团队最常用的那个内部 HTTP 接口文档,挑一个只读的 GET 接口,用官方 SDK 包成一个 MCP 工具,在本地客户端调用一次,把这次会话的 token 数记下来。这个数字是你定价时的起点,也能让你知道那层模型适配层该留多厚。
关于参考视频:视频链接和 UP 主会随时间失效或改名,这里不给具体 URL,避免出现死链和错误署名。想看视频的,在 B 站、腾讯视频、优酷或抖音搜索「MCP 模型上下文协议 实战」「DeepSeek 私有化部署」,优先选同时满足两个条件的:视频里报了 spec 版本号或制作日期(涉及 MCP 的,看是否包含 2025-06-18 之后的信息),并且用官方 SDK 实际敲代码。平台通常把旧教程排在前面,MCP 在 2025 年换过传输方式,日期太早的教程照着做会卡在鉴权那一步。
免责声明:本文提到的时间点、版本号和文件名以官方发布渠道为准;模型价格、备案流程与合规要求更新频繁,落地前请以模型厂商当期价目表、网信部门公开信息和当地监管要求为准。本文不构成法律意见,也不构成投资建议。