2026 AI 产品经理能力图谱:从 Prompt 到 Agent 工作流
2024 年做 AI 产品,能写一段像样的 prompt 就能拿到面试机会。2026 年招聘方问的是另一套:你负责的功能自动完成了多少任务,失败时人几秒能接管,一单成本多少钱。
这篇分五块讲:用户要什么、界面怎么设计、模型贵不贵、怎么判断它变好了、怎么收钱。
先看一张能力层级表
| 层级 | 核心能力 | 交付物 | 常见坑 |
|---|---|---|---|
| L1 Prompt | 指令结构、Few-shot、输出格式约束 | 提示词模板 + 版本记录 | 只测顺利路径,边界靠堆“不要……” |
| L2 检索 | 分块策略、召回评测、引用溯源 | 知识库 + 召回率报告 | 把召回问题当成模型问题修 |
| L3 工作流 | 工具定义、参数校验、失败重试 | 可编排流程 + 完整日志 | 步骤一多就不敢上线 |
| L4 Agent | 任务规划、状态管理、人机切换 | 自动完成率 + 接管路径 | 没有回滚,出错只能道歉 |
1. 用户需求变化:从“能聊”到“能交差”
一个做售后客服 SaaS 的产品团队,2024 年给系统加了对话框,模型能答退换货政策。2026 年续费谈判时,客户采购直接要三组数:过去三个月自动结掉多少工单、误操作几起、人工兜底花了多少小时。
采购方的问题清单已经换了:
| 2024 年客户问的 | 2026 年客户问的 |
|---|---|
| 接的哪个模型 | 自动处理率多少 |
| 回答准不准 | 答错的单怎么回滚 |
| 支持多轮对话吗 | 平均一单花多少钱 |
| 能上传文档吗 | 数据存哪、能不能私有化 |
| 演示一下 | 先跑两周试点,拿数据说话 |
还有一个容易忽略的变化:客户开始区分“辅助人”和“替人干活”。前者按席位卖,后者按任务量卖,两种商业模式对应的产品设计完全不同。
2. AI 原生交互设计:把不确定性放进界面里
聊天框是最省事的界面,也是最容易撞天花板的界面。用户真正卡住的地方,是他不知道模型接下来要做什么、做错了怎么收场。
按风险高低分四类交互模式,选错模式比选错模型代价更大:
| 模式 | 谁拍板 | 适用场景 | 设计重点 |
|---|---|---|---|
| 建议式 | 人 | 文案草稿、代码补全 | 局部采纳、一键改写 |
| 确认式 | 人确认后执行 | 发邮件、退款、改库存 | 执行前把动作列清楚 |
| 执行式 | 系统执行、人可回滚 | 批量打标、数据清洗 | 撤销入口要显眼 |
| 后台式 | 系统执行、异常告警 | 对账、监控、巡检 | 出错兜底路径提前写死 |
- 进度可见。 多步任务别只转圈。把“正在查订单 → 已找到 3 条 → 正在提交退款”做成步骤流,用户等待的容忍度会明显变长。
- 中断与恢复。 会话状态落库。用户切到别的页面回来,任务接着跑,而不是从头再说一遍需求。
- 不确定性外显。 抽取置信度低的字段高亮,点一下就能改。把置信度藏在后台,等于把风险留到线上。
- 草稿优先。 生成的工单、邮件、文案先给草稿让人改。改一个字比重新生成一遍省时间。
- 延迟预算。 首 token 在 200ms 内,用户感觉是瞬时;超过 1 秒要有骨架屏或流式输出。Agent 单步跑 3–8 秒是常态,所以过程必须拆开显示。
- 动作预告。 别把工具塞进下拉菜单。执行前列出“本次会调用:查询订单、发起退款”,并标出哪些动作不可逆。
3. 模型能力边界与成本:先算错率,再算钱
多步任务的成功率会被乘起来
假设一个 Agent 每一步有 95% 的可靠度,走 10 步的端到端成功率是 0.95^10 ≈ 60%。这个数字比模型跑分更能解释“试用满意、续费犹豫”。所以超过 5 步的流程,要么在中间塞人工确认点,要么把能并行的步骤压掉。
一笔真实的成本账
Agent 的 token 消耗和聊天差一个量级。聊天一轮几千 token,Agent 一个任务要反复把历史、工具返回结果塞回上下文,输入量随轮次线性上涨。
一次客服 Agent 任务,输入 8000 token、输出 800 token。按 OpenAI GPT-4o 2025 年公开定价(输入 2.5 美元/百万 token,输出 10 美元/百万 token)估算:
- 输入:8000 ÷ 1,000,000 × 2.5 = 0.02 美元
- 输出:800 ÷ 1,000,000 × 10 = 0.008 美元
- 单次合计约 0.028 美元,按 7.1 汇率折人民币约 0.2 元
压成本有三个动作最见效:
- 开上下文缓存。 固定不变的系统提示、工具定义、知识片段走缓存,重复输入的钱能砍掉一大块。
- 工具返回先裁剪。 订单接口返回 200 个字段,只留 8 个给模型,输入直接少一半。
- 分层用模型。 分类、抽取、字段校验交给便宜的小模型或量化模型,只有需要规划时才调旗舰模型。
哪些事别交给模型
| 任务类型 | 建议承载方式 | 理由 |
|---|---|---|
| 金额结算、精确算术 | 代码 | 模型算钱不可审计 |
| 权限判定 | 后端规则 | 需要确定性结果 |
| 实时库存、价格 | 数据库查询 | 训练数据永远过期 |
| 长链路状态追踪 | 状态机 | 模型记不住中间态 |
| 意图分类、字段抽取 | 小模型 / 量化模型 | 成本低、够用 |
| 多步规划、复杂推理 | 旗舰模型 | 控制调用次数并加超时 |
| 对外话术生成 | 中档模型 + 模板约束 | 需要过滤品牌禁用词 |
4. 评测体系:没有评测集就没有迭代
改一版 prompt 感觉变好了,上线后投诉变多——这种事在 2026 年还在发生,原因是缺回归测试。
先建 100 条评测集,样本从真实会话里抽:高频任务 60 条、已知 bad case 30 条、边界和对抗输入 10 条。每条记录四件事:输入、期望输出或判定标准、所属场景、难度标签。
| 层级 | 频率 | 样本量 | 执行者 |
|---|---|---|---|
| 离线回归 | 每次改 prompt / 换模型 | 全量 100 条以上 | 自动跑,看指标 |
| 人工抽检 | 每周一次 | 50 条 | 产品 + 业务 |
| 线上 A/B | 有较大改动时 | 按流量切分 | 数据 + 业务 |
- 位置偏好:把 A 放在前面时更容易选 A。跑两遍交换顺序,只取结论一致的样本。
- 长度偏好:更长的回答得分更高。评分标准里写明“简洁不扣分,冗余扣分”。
- 自我偏好:同一家模型判自家输出会偏高。换另一家模型当裁判,或人工校准 20% 的样本。
工具层面,Langfuse、LangSmith、Arize Phoenix、Braintrust 都能做 trace 记录和评测。选型标准很实际:会话数据能不能自托管。金融、医疗类客户不接受数据出内网,不能私有化部署的基本可以先排除。
5. 商业化与增长指标
定价的三种切法
- 按席位:合同简单,适合内部工具,弱点是客户觉得“没用够也照样付钱”。
- 按用量:和成本对齐,客户怕账单不可控,必须给预算上限和用量预警。
- 按结果:客户最愿意签,前提是“解决”的定义能写进合同,并且你能提供可核验的审计日志。
该盯哪几个数
| 指标 | 定义 | 参考判断 |
|---|---|---|
| 任务完成率 | 无需人工介入完成的任务 ÷ 总任务 | 视场景而定,先从 30% 起步 |
| 一次通过率 | 首次输出即被采纳的比例 | 比完成率更敏感,掉得快说明质量问题 |
| 人工接管率 | 转人工的任务占比 | 降到 10% 以下才好谈续费 |
| 单任务推理成本 | 总 token 成本 ÷ 成功任务数 | 要低于客单价的 20% |
| P95 延迟 | 95% 请求的响应时间 | 交互式场景控在 3 秒内 |
| 周活跃任务数 | 每周真实执行的任务量 | 比 DAU 更贴近价值 |
毛利里最贵的是人工,不是算力
毛利 = 单价 − 推理成本 − 人工接管成本。把人工接管率从 30% 压到 10%,通常比把 token 成本砍一半更能改善毛利,因为人工时间比算力贵得多。做功能优先级排序时,先找接管率高的环节,再找 token 消耗高的环节。
这周可以做的一件事
从最近一周的真实会话里随机抽 50 条,逐条标注“完成 / 部分完成 / 失败”,算出你当前的任务完成率和单任务成本。这两个数拿不出来,模型选型、交互改版、定价谈判都只能靠猜。
延伸观看
这里不放具体视频链接——平台上的搬运号和过期教程太多,链接半年后大概率失效。可以在 B 站、腾讯视频、抖音、优酷搜索这些关键词,自己筛:
- “Agent 工作流 实战”(优先看带完整 trace 日志、展示失败重试的)
- “LLM 评测集 搭建”(看有没有讲裁判模型偏差的)
- “prompt caching 成本优化”(也可以直接看各家官方开发者大会回放)
免责声明:文中方法与工具为实践总结,与所涉厂商无利益关系;模型定价、版本能力、平台规则请以各厂商 2026 年当期官方文档为准。