技术指标不等于产品指标
准确率、召回率、延迟是工程团队的体检指标,不是产品价值指标。用户不会因为准确率提升 2% 而回来,只会因为问题解决得更快更顺而回来。
产品指标应该回答三个问题:有没有人用?用没用到结果?结果有没有价值?
三层指标框架
第一层是使用指标:活跃用户、人均提问数、留存率。第二层是完成指标:任务完成率、平均完成时间、重试率。第三层是价值指标:转化率、成本节省、满意度。
第三层最难测,也最值得测。哪怕一开始只能抽样访谈,也要坚持记录。
- 使用指标:DAU/WAU、提问数、留存
- 完成指标:完成率、耗时、重试、放弃步骤
- 价值指标:转化、成本、NPS、可量化收益
给 AI 单独建评测集
除了线上指标,还要维护一个真实场景评测集:每周让模型跑同一批问题,跟踪回答质量趋势。模型升级、提示词修改、知识库变化,都会在这里显形。
评测集要来自真实用户输入,而不是团队自己编的样例。
指标之间要互相校验
一次解决率上升,转人工率下降,可能是体验变好,也可能是 AI 在给错误答案。所以要同时看质量抽检样本。
指标的意义不在数字本身,而在于帮你发现下一步该做什么。
别让指标互相打架
一次解决率上升、转人工率下降,看起来都好,但如果同时投诉率上升,说明 AI 可能在给错误答案。单一指标漂亮,往往是另一个问题的信号。
建议为产品设一个北极星指标,其他指标都围绕它解释变化,避免团队被互相矛盾的指标带偏。
从指标到决策会议
指标只有进入决策会议才有意义。每周用一页纸回顾:北极星指标变化、三个关键分解指标、一个需要讨论的异常。
会议不是把数字念一遍,而是回答「数字变了,我们改什么」。
当团队习惯了用指标讨论,产品迭代就不再依赖谁的嗓门大,而是依赖证据。
指标看板的四块内容
一张产品指标看板放四块就够:使用情况(活跃、留存、人均次数)、质量情况(完成率、重试率、满意度)、价值情况(转化、成本、收益)、异常情况(最近一次异常与处理状态)。
四块内容对应四个决策:要不要继续投入、质量问题是否影响体验、价值是否兑现、有没有需要立即处理的事。
看板不是越全越好,信息密度过高反而让团队抓不住重点。