指标体系

Agent 产品的指标体系要从“有没有使用”转向“有没有完成工作”。用户打开应用、发起任务、消耗 token,并不等于产品创造了价值。真正需要度量的是:Agent 做了多少任务,成功了多少,质量如何,最后是否产生了可解释的业务结果。

为什么传统使用指标不够

MAU、DAU、session 时长、消息数仍然有用,但它们只能说明用户在接触产品,不能说明 Agent 是否交付了工作。

一个用户每天发起 5 次任务但全部失败,表面上很活跃,实际上可能正在消耗成本、制造挫败和增加流失风险。另一个用户每周只用 1 次,但每次都完成关键流程,商业价值反而更高。

因此,Agent 指标的基本单位应该是任务,而不是消息、会话或打开次数。

三层指标

三层指标框架 任务量支撑质量,质量支撑价值 — 任一层数据缺失,决策都会失真 价值层 Value 每成功任务成本 · 净价值 · 毛利贡献 ROI 闭环 质量层 Quality 成功率 · 首次成功率 · HITL · 返工率 健康度 工作量层 Volume 任务发起 · 任务完成 · 任务类型分布 基础

工作量

工作量说明 Agent 被要求做多少事。

指标含义
任务发起数用户向 Agent 提交了多少可执行请求
任务完成数Agent 完成了多少任务
每用户任务数衡量需求渗透和使用深度
任务类型分布哪些工作流最常被委托给 Agent

工作量是基础,但不能单独作为成功信号。任务发起数上涨可能是需求增加,也可能是用户反复重试。

质量

质量说明 Agent 做得是否可靠。

指标含义
成功率发起任务中,最终达成目标的比例
首次成功率不靠重试、不靠人工兜底就成功的比例
HITL 介入率需要人工确认、审核或接管的比例
恢复率失败后通过重试、fallback 或人工接管救回的比例
返工率用户或人工需要修改 Agent 输出的比例

质量指标必须和任务类型绑定。邮件分类、代码修改、客户退款、数据分析的“成功”标准不同,不能用一个全局成功率解释所有问题。

价值

价值说明 Agent 是否值得运行。

指标含义
每个成功任务成本成本除以成功任务数,而不是除以全部发起任务
节省人时Agent 替代或缩短的人工时间
每任务净价值人工基线价值 − Agent 成本 − 审核成本 − 失败修正
客户可见 ROI客户能理解和复核的收益口径
毛利贡献收入扣除推理、工具、运行时和人工成本后的贡献

价值层依赖 Agent 经济学:成本不只是 token,还包括工具、运行时、重试和人工审核。

指标之间的关系

这三层不能互相替代:

  • 只看工作量,会鼓励团队推高任务数,哪怕任务失败。
  • 只看质量,可能让团队过度保守,减少可自动化范围。
  • 只看价值,容易忽略早期产品的学习信号和用户行为变化。

更实用的看板通常长这样:

任务量 → 成功率 → 每成功任务成本 → 单任务净价值 → 留存 / 扩张

也就是说,先确认需求存在,再确认能稳定完成,再确认每个成功结果的成本可控,最后才看能否带来长期收入。

章节导读

章节主要问题
北极星指标不同商业模式下,应该选哪个指标作为团队主目标?
单位经济每个用户、任务或合同是否真的赚钱?重度用户会不会吃掉毛利?

与其他章节的边界

  • economics 负责成本模型和 ROI 公式。
  • metrics 负责把成本、质量和业务结果变成可运营的指标。
  • operations 负责把这些指标落到监控、告警和运行面板。
这页有帮助吗?