从聊天到执行:AI原生应用的PMF、定价与留存设计
一个常见场景:用户第一周用聊天机器人写周报、改 SQL,第二周打开次数降到 1 次。模型回答得不错,但任务没有走到可验收结果,用户就不会回来。聊天框只解决表达;执行型任务需要状态、权限、回滚、计费。AI 原生应用的 PMF,先看任务完成率,再看日活。
1. 用户任务场景分层:先判断你卖的是答案、草稿还是执行
把用户任务按“交付物”和“失败成本”分层。层级越高,定价越靠近结果,产品要补的权限和日志越多。
| 层级 | 用户动作 | AI 交付物 | 失败成本 | 常见计费 | 例子 |
|---|---|---|---|---|---|
| L0 问答检索 | 问竞品定价、找资料 | 摘要、链接、来源 | 低,用户会核验 | 订阅、广告、API | Perplexity、Kimi 搜索 |
| L1 草稿生成 | 写邮件、周报、SQL | 可编辑初稿 | 低,人工改写 | 订阅+次数 | ChatGPT、Claude、Notion AI |
| L2 半自动工作流 | 归类工单、提取发票、会议纪要 | 结构化结果,人工抽检 | 中,抽检成本 | 席位+用量包 | Microsoft 365 Copilot、飞书智能伙伴 |
| L3 代理执行 | 退款、改广告出价、发跟进邮件、提交代码 | 已执行操作,带日志 | 高,需回滚 | 基础费+结果费 | 客服代理、销售外呼、代码代理 |
| L4 组织级流程 | 跨 CRM、财务、工单跑流程 | 流程实例与审计报告 | 很高,合规介入 | 企业合同+SLA | 企业采购、理赔流水线 |
- L0/L1 看同类问题是否被重复提出,用户是否愿意把结果复制到工作流。
- L2 看每周节省工时、抽检通过率。
- L3 看自动完成率、回滚率、权限越界次数。
- L4 看审计通过率、续约和席位扩展。
graph TD
A[聊天问答 L0] --> B[草稿 L1]
B --> C[半自动 L2]
C --> D[代理执行 L3]
D --> E[组织流程 L4]
C --> F[仍需人工抽检]
D --> G[需要日志、权限、回滚]
2. 结果付费与订阅制:把可计量结果写进合同
订阅制收的是“预期使用”,结果付费收的是“已发生价值”。早期成本先发生,纯结果付费会把现金流压得很紧。常见做法是订阅做底座,用量包覆盖变动成本,结果费只放在能计量、能归因的 L3 任务上。
| 模式 | 收钱时点 | 适合层级 | 用户感受 | 主要风险 | 设计要点 |
|---|---|---|---|---|---|
| 订阅/席位 | 月初 | L0-L2 | 固定预算,敢试 | 用不满会流失 | 给明确额度,超额可加购 |
| 按用量 | 用时扣 | L1-L3 | 用多少付多少 | 账单不可预测 | 实时余额、单次成本上限 |
| 按结果 | 结果确认后 | L3-L4 | 见效才付 | 归因争议、作弊 | 三方确认:用户、产品、系统日志 |
| 混合 | 底座+用量+结果 | L2-L4 | 低门槛,高上限 | 合同复杂 | 保底+超额,设退款边界 |
毛利要算清:推理成本、工具调用、人工复核、支付通道、退款。L3 产品必须记录每次工具调用成本,否则结果费越高,亏得越快。
3. 激活、留存与信任:别只看 DAU
注册和第一次对话都不算激活。激活是用户拿到一个可验收结果。给 AI 原生应用建一张指标表:
| 指标 | 公式 | 用途 |
|---|---|---|
| TTFW | 注册到第一个可验收结果的时间 | 判断上手阻力 |
| 激活率 | 24h 内完成一次被复制/下载/提交/批准的任务 / 新用户 | 判断首次价值 |
| 任务完成率 | 无需重写达到提交标准的任务 / 总任务 | 判断 PMF |
| 接管率 | 人工介入任务 / 自动执行任务 | 判断信任额度 |
| 回滚率 | 被撤销操作 / 自动执行操作 | 判断执行风险 |
| 信任额度 | 允许自动执行的金额、数据范围、审批层级 | 判断商业化上限 |
| NRR | 老客收入留存 | 判断企业价值 |
- 权限最小化,敏感操作二次确认
- 每次执行有日志,能定位输入、模型、工具、输出
- 支持撤销或补偿
- 人工接管按钮在界面可见
- 单任务成本上限和熔断阈值
- 错误解释不带免责话术,直接给失败原因和下一步
4. 三个案例:AI搜索、AI办公、AI陪伴
AI 搜索:Perplexity
任务层级多在 L0/L1。PMF 来自带引用的答案,用户点来源核验后愿意重复使用。2024 年公开价里,Perplexity Pro 为 20 美元/月,年付 200 美元/年;2026 年价格和额度以官网结算页为准。免费版承担获客,Pro 订阅承担留存,API 和企业版承担收入。 激活指标:首次提问后点击至少一个来源。留存指标:把 Perplexity 设为默认搜索引擎的比例、每周搜索次数。信任指标:引用覆盖率、来源可打开率。限制:付费墙、实时性、版权和抓取政策。AI 办公:Microsoft 365 Copilot
任务层级在 L2/L3。平台覆盖 Word、Excel、PowerPoint、Outlook、Teams。2024 年微软公开价为 30 美元/用户/月,企业采购通常还需要 Microsoft 365 基础许可;2026 年续费前到微软官网核对。PMF 发生在会议纪要、邮件总结、Excel 分析。激活看会议结束后纪要是否被转发。留存看周活跃会议数、Copilot 使用率、席位扩展。信任看权限继承、租户数据边界、审计日志。定价按席位卖,内部可以用节省工时核算 ROI。AI 陪伴:Replika、Character.AI
任务层级表面是 L0/L1,留存逻辑不同。PMF 看连续对话天数、记忆召回准确率、角色一致性。定价常见免费+订阅+虚拟道具;具体价格以应用商店为准。激活看首日对话后 3 日回访。留存看 7 日连续对话和主动开启话题次数。信任边界包括年龄限制、危机干预、隐私政策。限制:这类产品不能替代医疗或心理治疗,安全提示要放在交互路径里。5. 产品经理能力模型:从写 PRD 到管评估集和成本
AI 产品经理的产出物变了。需求文档仍然要写,但更关键的是任务定义、评估集、成本表和失败恢复流程。
| 旧能力 | 新能力 | 可验收产出 |
|---|---|---|
| 用户访谈 | 任务日志分析 | 50 条真实任务,标注成功/失败/接管 |
| 写 PRD | 写任务成功标准 | 每条任务的可提交标准、禁止项 |
| 画原型 | 设计失败恢复 | 回滚、接管、补偿流程 |
| A/B 测试 | 建评估集 | 离线集、在线指标、回归用例 |
| 项目排期 | 管成本/延迟/准确率 | 单位任务成本表、模型路由策略 |
| 增长拉新 | 设计信任额度 | 自动执行金额、数据范围、审批层级分级 |
- 选一个 L2 场景,收集 50 条真实任务
- 写成功标准,标出人工接管点
- 算每条推理成本、工具调用成本、复核成本
- 设计订阅+用量+结果付费报价
- 跑 2 周,记录 TTFW、任务完成率、接管率、回滚率
免责声明:本文提到的产品价格、平台和限制来自公开信息,2026 年可能调整;采购或付费前请以官方页面和应用商店结算页为准。本文不引用视频,原因是价格与功能更新快,视频出处容易失效。