这组笔记蒸馏自 NN/g《UX Metrics and ROI》报告 + 横跨 5 版的真实案例库,只回答一个 PM 最常被老板逼问的问题:"你说体验变好了——值多少钱?"
它的答案分三层,正好是本文三大块:
- 指标体系清单:UX 能量化的就那几类(完成任务费不费劲、用户满不满意、回不回来、转不转化)。每类有什么现成指标、怎么算、何时用、坑在哪——先有一套"菜单"才谈得上选。
- UX → ROI 折算方法论:把"任务用时少了 14 秒"翻译成"一年省 150 万",本质是单位换算。给你改进分数公式 + 三步法 + 四种业态各自的折钱配方 + 一个把软指标接到营收的相关性模型。
- 期望管理 + 汇报话术:UX 改版平均能提升多少(75%)、为什么现在越来越难提(从 247% 缩到 75%)、给老板汇报怎么说才可信不挨打。
一句心法:ROI 不是财务预测,是方向性指标——"你搞清楚省了多少钱、花了多少钱,老板自然懂。" 别为了精确把自己绕死,讲一个有共鸣的钱的故事,比小数点重要。
与 NNGroup 分析与指标 Analytics & Metrics(选对指标/转化漏斗/统计显著与置信区间/UX ROI 四步/抽样与混杂/三角验证/虚荣指标/基准测试) 的分工:那篇是 NN/g 的"分析度量视角"(虚荣指标、转化率脾气、置信区间、统计显著、抽样、三角验证、ROI 四步原理);本篇是"成套指标清单 + 改进分数数学 + 多业态折钱配方 + 基准幅度实证 + 汇报话术"。两篇都讲到的(ROI 步骤、HEART、置信区间)这里只交叉引用、不重写。
一、为什么 PM 要逼自己量化 UX(说服力的来源)
Why:定性研究(访谈、故事、用户原话)一直是 UX 主流,因为它能解释"问题是什么、怎么改"。但它有个致命短板——说不清"规模":这个问题影响多少人?有多严重?该不该优先?这些只有数字能答。
定量数据对 PM 的真正价值,不在"更科学",而在能打动拿钱的人:
| 定量数据帮你做的事 | 为什么对 PM 关键 |
|---|---|
| 确定问题规模(多少用户受影响) | 决定要不要排进这个迭代、优先级多高 |
| 给 A/B 测试等设计实验提供依据 | 把"我觉得 B 更好"变成"B 让加购涨 12%" |
| 打动利益相关者、展示 UX 价值 | 老板多是商科/财务出身,爱看数字;数字可视化最易在组织内传阅、向上汇报 |
| 把 UX 成果挂到企业 KPI(收入/成本) | 争取更多 UX 资源、扩团队最有效的方式 |
真实台词(HelloFresh 研究负责人):"我们根据定性测试发现的问题做了一个非常小的调整,带来了 12% 转化率提升——对我们这种规模的公司,这已经惊人了。有了好结果,公司就更愿意投钱;项目越多,投入越大。"
反例/陷阱:别为了"硬数据"而硬塞定量。Marketade 的 UX Writer 复盘过一个项目:定量部分纯是客户坚持要,最后真正带来洞察、客户最认可的反而是定性访谈——"定量没带来太多洞察,但数字能做成图表,客户特别吃这一套。" 所以定量的价值有时是说服而非发现,别把两者搞混。
定量怎么用——分两个时机(借形成性/总结性这对词):
- 形成性评估(Formative):项目还在构思/原型阶段,"边做边看方向对不对"。主力是定性,但定量可辅助——A/B 测试就是典型的形成性定量(两版同时上线,比转化率/点击率)。
- 总结性评估(Summative):一个设计周期收尾,评估"这次改动到底有没有用"。主力是定量,收集 UX 指标衡量成败,可对比新旧版或对比竞品。总结性里用定量衡量体验质量,就叫 UX 基准测试(Benchmarking)——见第四节。
二、核心指标体系清单:测什么 / 怎么算 / 何时用 / 局限
Why:你没法管理你测不了的东西。但 UX 能量化的维度其实有限——就那几类。先把"菜单"摊开,选型时才不会漏、不会拿错指标量错东西。
2.1 UX 指标到底是什么
UX 指标 = 一个反映用户体验某侧面的数值。 用咖啡打比方:"奶泡像叶子、杯子很复古"是定性(描述感觉);"12 盎司、120 华氏度、7.35 美元"是定量(量化事物)。UX 定量研究主要盯下面这几类体验细节:
| 体验维度 | 对应的常见指标 | 一句话 |
|---|---|---|
| 完成任务要多少力气/时间 | 任务用时 Time on task | 衡量流程效率 |
| 任务在用户眼里有多难 | 易用性评分 Ease-of-use | 主观难度 |
| 多少人能成功完成 | 成功率 Success rate | 最常见的可用性指标 |
| 用户多满意 | 满意度评分 / CSAT / NPS / SUS | 评分或问卷收 |
| 多频繁回来 | 回访率 / 复访 | 反映粘性 |
| 总共多少用户 | 用户总数 | 衡量受欢迎度(注意:孤立总数易成虚荣指标,见 NNGroup 分析与指标 Analytics & Metrics(选对指标/转化漏斗/统计显著与置信区间/UX ROI 四步/抽样与混杂/三角验证/虚荣指标/基准测试)) |
| 多少比例进入关键流程下一步 | 转化率 / 漏斗各步完成率 | 漏斗分析核心 |
2.2 按"指标类别"成套理解(选型脚手架)
报告把所有 UX 指标归成 6 大类——这张表是搭指标看板(Dashboard)、写研究报告、做改版追踪时最实用的分类骨架:
| 指标类别 | 测的是体验哪一面 | 示例指标 |
|---|---|---|
| 采用 / 留存 Adoption/Retention | 拉新 + 留老(含流量访问) | 线索提交数、申请表提交、订阅注册、续订、新访客、回访用户、自然搜索来的用户 |
| 有效性 Effectiveness | 用户能不能成功完成任务 | 成功率、完成率 |
| 效率 Efficiency | 完成任务快不快、顺不顺 | 任务用时、平均会话时长、树状测试得分、完成时间、错误数 |
| 参与 / 使用 Engagement/Usage | 用得多频繁、多深、多广 | 人均会话次数、跳出率、页面价值、功能使用率、活跃用户数 |
| 收入 Revenue | 实际赚到多少钱 | 每月营收、每会话营收、平均订单价值(AOV) |
| 满意 / 感知 Satisfaction/Perception | 用户主观怎么想 | 易用性评分、CSAT、NPS、应用商店评分、主观成功感 |
何时用:目标是拉新增收 → 看采用/留存 + 收入;目标是降客诉 → 看有效性/效率;想知道"用户爽不爽" → 只能看满意/感知(且只能靠问卷,分析工具和操作测试都测不出态度)。
2.3 标准化问卷指标:SUS / NPS / CSAT —— 最容易拿去汇报的三个
这三个是"现成量表",PM 可以直接抄来用,跨产品/跨时间可比:
| 指标 | 全称 / 是什么 | 怎么算 | 何时用 / 局限 |
|---|---|---|---|
| SUS | System Usability Scale 系统可用性量表 | 10 道标准题,换算成 0–100 分(注意:不是百分比,是行业通用标尺,~68 分算平均) | 想要一个跨产品可比的可用性总分时用;局限=只给总分,不告诉你具体哪坏 |
| NPS | Net Promoter Score 净推荐值 | 问"愿不愿推荐(0–10)",推荐者%(9-10) − 批评者%(0-6),得 −100~+100 | 衡量忠诚度、最易向高管传达;局限=单一数字,波动大,不解释原因 |
| CSAT | Customer Satisfaction 满意度 | 问卷打分(如 1–5),取平均值 | 测对某个具体产品/交互的满意;局限=主观、受情绪与时点影响 |
易用性评分(Ease-of-use)/ 满意度评分:让用户在 1–5 或 1–7 量表(Likert)上选,再求平均。常接在任务后面问(完成任务立刻评分),把"做得成"和"觉得难不难"一起收。
2.4 四大数据来源:各自答什么问题
Why:同一个指标,从不同来源拿到,可信度和含义都不同。先认清"这个数从哪来",才知道它能不能信、能不能下结论。
| 来源 | 答什么问题 | 典型指标 | 局限 |
|---|---|---|---|
| 问卷 Surveys | 用户怎么想(主观) | 满意度、易用性、NPS、SUS | 自我报告,可能与真实行为不符 |
| 定量可用性测试 | 用户能不能做成、效率多高(给定任务) | 任务用时、成功率、任务后易用性评分 | 样本小(~40 人)、贵、难推广 |
| 分析工具 Analytics(GA / Adobe / Pendo) | 用户实际做了什么(真实环境) | 转化次数/率、回访用户、流失率、跳出率、每用户收入 | 缺上下文(知其然不知其所以然);不可控(竞品大促也会动你的转化) |
| 客服 + 市场数据(非研究渠道) | 旁证产品好不好用 | 客服工单数、故障报错量、CLV、应用商店评分 | 间接,需排除其它原因 |
树状测试(Tree Testing) 是评估信息架构(IA,即菜单/目录结构)的专门方法:只给用户看菜单层级、不让进页面,给个任务("我要注册成雇主,点哪?")看他能不能点对。三个指标:总体成功率(最终找到对的)、直接成功率(第一次就对)、间接成功率(先错后对)。
何时用客服/应用商店数据:它们免费且天然存在,改版后看"客服工单有没有变少、应用商店评分有没有变好"——这是把 UX 接到成本/增长的最省事入口(评分高还会带来更多下载)。
2.5 有数据 ≠ 只看数据:定量定性必须来回循环
Why:分析数据永远说不出"为什么"。同样"翻很多页、停留很久",可能是沉浸享受,也可能是迷路抓狂(详见 NNGroup 分析与指标 Analytics & Metrics(选对指标/转化漏斗/统计显著与置信区间/UX ROI 四步/抽样与混杂/三角验证/虚荣指标/基准测试) 的希腊旅游站例子)。
标准节奏:先看数据找线索 → 再访谈找原因 → 继续测 → 循环。 可以正着来也可以反着来:
- 定性先行:PetSmart 慈善站,先靠定性测试发现订阅流程有问题 → 再用 Google Analytics 量化"73% 用户中途放弃" → 证明影响范围"有多严重"。
- 定量先行:先用分析发现"任务失败率高" → 再访谈问用户到底卡在哪。
三、UX → ROI:把体验折算成钱(本文核心方法论)
3.1 第一步数学:改进分数公式(正向 vs 负向指标)
Why:汇报"成功率从 25% 到 100%"不如说"提升了 300%"有冲击力。但不同指标涨跌方向相反,公式不能一概而论,算反了会闹笑话。
先给指标分两类:
- 正向指标(越大越好):销售额、访问量、满意度、成功率、转化率——希望它涨。
- 负向指标(越小越好):错误数、客服工单、任务完成时间(通常)——希望它降。
- 注意场景:娱乐场景里"停留时间"反而是正向(手游希望用户玩越久)。
改进分数公式(务必记反向):
| 指标类型 | 改进分数公式 |
|---|---|
| 正向指标 | (改后值 ÷ 改前值) − 1 |
| 负向指标 | (改前值 ÷ 改后值) − 1 |
算给你看:
- 转化率 2% → 5%(正向):5 ÷ 2 = 2.5,即 提升 150%。
- 任务用时 3 分钟 → 2 分钟(负向):3 ÷ 2 = 1.5,即 效率提升 50%(同样 1 小时,旧版做 20 个 3 分钟任务,新版做 30 个 2 分钟任务,多干 50%)。
- HelloFresh 成功率 25% → 100%(正向):100 ÷ 25 = 4,即 提升 300%;任务用时 28 秒 → 14 秒(负向):提升 100%。
3.2 三步折算法:把 UX 指标变成 KPI 变成钱
核心比喻(全文最重要一句):算 ROI 本质是单位换算——跟"两加仑等于几升"是同一件事,只不过你换的是"任务用时 → 节省成本"。
Step 1 选 KPI:先问"公司到底关心什么?" 利润?成本?流失率?满意度?按组织目标 + 按汇报对象选(给高管/客户/投资人看,关注点不同)。
真实教训(Marketade 研究员 Emily):同一个"工程师监控占比 70%"的发现,在第一家油企能跟"产量目标"挂钩、很有用;到第二家公司却没人理,他们只在意"数据质量"——她换了个角度说"UX 改进让产量误差减少 10%,避免数百万美元损失"。结论:"人们关注的数据,和他们的角色密切相关。" ROI 的艺术是"讲一个有共鸣的故事"。
常见 KPI 菜单:利润 / 成本 / 客户生命周期价值 CLV / 员工流失率 / 员工生产力 / 捐赠人数。
何时可以跳过:UX 成熟度高的组织里,KPI 和 UX 指标本就一致(大家已经都重视"任务完成时间"),这时算 ROI 可能没必要——价值已公认,别为算而算。
Step 2 把 UX 指标换算成 KPI:找转换比例。 例:客服流程节省 30 秒,时薪 100 元 → 每次省 0.83 元。常要找别的部门要数据(分析团队/HR/财务),拿数据时务必说清你要它干嘛。
Step 3 负责任地报告(5 条铁律,见 3.5)。
3.3 招牌案例:健康保险站,一年省 150 万(全数字保留)
注册流程的 UX 指标可以从四个来源拿:成功率(可用性测试)/ 完成率(网站分析)/ 易用性评分(问卷)/ 客服工单数(客户支持数据)。实际算 ROI 时,只挑一个核心指标最省事——这里挑客服工单,因为最容易换成钱。
工单减少量 = 改版前工单数 − 改版后工单数 = 23,000 − 1,100 ≈ 21,900 张
成本节省 = 工单减少量 × 每张工单成本 = 21,900 × $6
月省 ≈ $131,400 → 年省 ≈ $1,576,800(约合一年省 150 多万美元)
PM 落地:这个案例的方法论可直接套——任何"改版后客诉/工单下降"的项目,都可以
(降低的工单数 × 单张工单成本)折成省下的钱,这是最容易被财务认可的 ROI 口径。
3.4 四种业态各自的折钱配方
Why:不同生意"值钱的地方"不一样,ROI 怎么折取决于业态。先认准你这门生意属于哪类。
| 业态 | 价值锚在哪 | 折钱配方 |
|---|---|---|
| 电商 / 有明确目标行为的站 | 转化(购买、申请、注册、订阅) | 转化提升 × 客单价。用的人越多越值钱(亚马逊销量翻倍=收入翻倍)。设计改难了销量掉,老板就让你改回去 |
| 内容站(新闻类) | 流量(PV/UV → 广告) | 改版后 PV/UV 提升量 × 广告单价 |
| 企业内网 / 工具 | 员工工时 = 工资 | 节省人天 × 平均薪资。效率提升 = 人力支出下降 = ROI |
| 公益 / 政府 | 非货币(访问量、服务覆盖、捐赠人数) | ROI 不一定是钱,可以是"帮了多少人" |
三个迷你案例(全数字保留):
- 金融订阅站 The Deal(电商型):改版后免费试用申请三个月 76 → 187;假设 18% 转付费、每客户 $1,000:
(187−76) × 18% = 20 个新付费用户 → 20 × $1,000 = 月增收约 $20,000(且试用客户持续累积,未来更多)。 - HR 工具(内网型):优化一个高频耗时任务,每月省 32 个人天;HR 年薪 $50,000 ÷ 261 工作日 ≈ $191/天 →
$191 × 32 = 月省 $6,112。诚实备注:固定工资员工省下的不是现金,而是"这些时间能投到别的任务上",长期才创造价值——报告里要这么讲才可信。这个高频任务整体把 HR 耗时 减少了 60%。 - 内网规模放大效应:同样的内网可用性优化,1,000 人公司 ROI ≈ 成本 8 倍;1 万人 ≈ 20 倍;10 万人 ≈ 50 倍——因为每个用户都享受到改进,人数放大收益。
3.5 报告 5 条铁律(给老板汇报的话术)
| 铁律 | 一句话 | 为什么 |
|---|---|---|
| ① 估算非财报 | "算 ROI 不用一毛不差,估个差不多就行" | ROI 是方向性指标,帮你判断哪个项目更值,不是财务预测 |
| ② 对比研发成本 | 把省下/赚到的钱 和这次改进的研发投入做对比 | 这才是 ROI 的核心,光说省钱不说花多少没意义 |
| ③ 讲故事不堆表 | "把数字串成逻辑清晰的故事线" | 回答"我们为啥做、怎么做、结果好不好",别甩一堆没人看的表格 |
| ④ 透明假设 | 说清数字来源和假设依据 | 听众若觉得你"只是为自己争预算",就当你在拉私活 |
| ⑤ 拉到 2-5 年 | "一次好设计几年都能省钱,别只看眼前" | UX 改进有累积性(今年省 30 万,明年还能再省),拉长更有说服力 |
反例:为了"严谨"把每个 UI 组件、每个变量都算进 ROI——耗时数周,老板早走神。过度分析 = 没分析(参见 NNGroup 分析与指标 Analytics & Metrics(选对指标/转化漏斗/统计显著与置信区间/UX ROI 四步/抽样与混杂/三角验证/虚荣指标/基准测试) 的"设计系统只算一个视频插件就说服老板"的 Don't Overthink)。
3.6 进阶:用相关性把"软指标"接到营收 KPI
Why:满意度、易用性这些"软"指标,高管常觉得"跟钱没关系"。怎么证明它们最终影响营收?——用统计相关性搭一条逻辑链。
Athenahealth 连锁模型(医疗 SaaS 实证):两年内对一款产品收了 超 5 万份完整问卷,问"易用性"和"可靠性"。统计验证出一条显著正向链条(p < 0.000001):
易用性 + 可靠性 → 产品满意度 → 推荐意愿(NPS) → 付费推荐 + 用户留存
(用户感知) (满意度) (忠诚度) (营收 KPI)
怎么用这条链:产品出问题时倒推——留存掉了?是不是满意度出问题?是不是易用性/可靠性不够好?这给了 PM 一条"提升易用性 → 最终影响 KPI"的可证明路径,有数据闭环撑腰。
通用版叫 UX-Revenue Chain(UX 到营收连锁模型),可套到任何产品: ① 体验投入(可用性 + 客服 + 产品质量)→ ② 整体满意度 → ③ 忠诚度(推荐意愿/复用/降流失)→ ④ 营收(增购/续费/推荐/降获客成本)。前段是"体验类 KPI",后段是"商业类 KPI"——这张图本身就能当 KPI 体系的设计依据。
四、UX 基准测试:量化改版值不值的"标尺"
Why:没有基线就像减肥不先量体重——改完根本不知道有没有效。基准测试 = 用量化数据衡量产品相对某标准(自己历史 / 竞品 / 行业)的表现,并追踪改进。它是 ROI 计算的数据源头(ROI 第 1 步的指标就从这来)。
4.1 七步流程:前三步启动,后四步循环
| 步 | 做什么 |
|---|---|
| 1 | 选测什么——锁定产品 + 用户群,找"对用户最关键的任务" |
| 2 | 选怎么测——问卷 / 分析 / 定量可用性测试(三选一或搭配) |
| 3 | 收第一次数据——当基线(Baseline / 打底分) |
| 4 | 重新设计产品 |
| 5 | 再测一次 |
| 6 | 解读结果 |
| 7 | 算 ROI(可选) |
步骤 4–7 是可重复的循环,长期跟踪。两个易踩的坑:
- 改完别急着测:用户排斥改变,大改动要给适应期——每天用的产品等 2–3 周,低频产品等 1 个月+。
- 样本量门槛:报告里有案例因为只用 5 人被拒;至少 20–40 人才有说服力(统计显著与置信区间细节见 NNGroup 分析与指标 Analytics & Metrics(选对指标/转化漏斗/统计显著与置信区间/UX ROI 四步/抽样与混杂/三角验证/虚荣指标/基准测试))。
4.2 用 Google HEART 框架选指标(选型脚手架)
选"测什么"时最常用的脚手架。把 UX 拆成 5 个维度,每维配现成指标——避免客户/老板只盯"页面浏览数"这类浅层数据。
| HEART 维度 | 含义 | 示例指标 |
|---|---|---|
| Happiness 满意度 | 用户态度 | 满意度评分、易用性评分、NPS |
| Engagement 参与度 | 活跃程度 | 平均任务时间、功能使用率、转化率 |
| Adoption 采用率 | 首次使用 | 新注册、访问次数、销量 |
| Retention 留存率 | 长期使用 | 回访用户、流失率、续订率 |
| Task success 任务成败与效率 | 成功率 + 效率 | 错误数、成功率、任务用时 |
何时用:客户给"成功标准"说不清(只会说"想做好")时,用 HEART 帮他把模糊目标逐维翻译成可衡量的指标。
4.3 找对照点:没历史数据也能基准
第一次测就是"打底分"。即使你刚启动、没历史,也能找对照:
- 竞品对比:对竞品 App 也跑一轮定量测试(HelloFresh vs BlueApron)。
- 行业标准:行业"找菜谱"易用性均分 4.5(满分 5),拿自己比。
- 利益相关者目标:老板要求"找菜谱 ≤ 20 秒",实测 14 秒 = 达标。
4.4 实证范例:HelloFresh 改版数据(全保留)
| 指标 | 改版前 | 改版后 | 改进分数 |
|---|---|---|---|
| SUS(满分 100) | 75 | 90 | +20% |
| 任务用时(秒) | 28 | 14 | +100%(快一半) |
| 主观成功率 | 63% | 100% | +59% |
| 成功率 | 25% | 100% | +300% |
| 易用性评分(/7) | 6.1 | 6.9 | +13% |
| 信心评分(/7) | 5.9 | 6.9 | +17% |
4.5 "结果不显著"也别喊失败(Shopify 反例)
Shopify 账单页改版,数据全都不显著、甚至轻微变差(完成时间 +8% 变慢、易用性 −3%、成功率 0 变化):
| 指标 | 改版前 | 改版后 |
|---|---|---|
| 完成时间 | 59 秒 | 64 秒(+8% 变慢) |
| 易用性(/7) | 6 | 5.8(−3%) |
| 成功率 | 90% | 90%(无变化) |
但定性观察发现用户对信息分区理解更清晰、探索路径更短、误点更少。研究员总结:"有些设计改动不会马上反映在指标上,但你必须用量化方法把它拆出来,知道是'真没变'还是'变好了只是方式不同'。" 且这个"不爆款"项目逼着团队建了一套 UX 基准测试工具包,推广给全 Shopify 设计团队——没有显著提升的改版,反而搭起了长期改进的基石。
五、期望管理:UX 改版到底能提升多少 + 为什么越来越难
Why(对 PM):老板问"改版能带来多大提升?",你需要一个有据可依的预期区间,既不夸海口也不妄自菲薄。NN/g 跨 14 年的案例库给了答案。
5.1 平均提升 75%,但区间很宽
- 所有案例平均改进幅度 = 75%,95% 置信区间 8% ~ 104%(置信区间=真实均值很可能落入的范围,见 NNGroup 分析与指标 Analytics & Metrics(选对指标/转化漏斗/统计显著与置信区间/UX ROI 四步/抽样与混杂/三角验证/虚荣指标/基准测试))。
- 别指望每次都中:一半项目改进幅度在 13% ~ 157% 之间,有高有低。500%、5000% 的提升存在但极其罕见(统计离群)。
为什么有的改版翻倍、有的纹丝不动? 五个因素:
- 原体验有多烂——问题越多,改进空间越大;本就优秀的产品,提升空间小。
- 团队多厉害——经验/技能/策略决定深度;但顶尖团队也不可能每次完美。
- 改了多少、改得多关键——大项目通常影响大,但项目规模与改进效果没有统计显著关联(小而精也能爆)。
- 方法/指标够不够敏感——A/B 测试几千个数据点能测出极小变化;40 人可用性测试要更大差异才显著(Shopify 的小改动可能被不敏感的指标漏掉了)。
- 要改的行为本身多难改——习惯越难改,设计影响越小。
重要提醒:有些改版会让指标变差——报告里有公司改完表单提交量反降 65%。哪怕做了调研、最强的团队也可能翻车。只要你在持续测数据,就能及时发现并改回去——越早发现,伤害越小。
5.2 按指标类别拆:哪类最好改、哪类最难改
| 指标类别 | 平均提升 | 95% 置信区间 | PM 解读 |
|---|---|---|---|
| 有效性 Effectiveness | 131% | −9% ~ 271% | 设计对"帮用户做成任务"影响最大,但波动也大(有负下限,可能改坏) |
| 效率 Efficiency | 104% | 31% ~ 177% | 改"快不快"也很有效 |
| 采用/留存 | 93% | 45% ~ 140% | 较稳 |
| 参与/使用 | 87% | −3% ~ 177% | 波动大,可能改坏 |
| 满意/感知 | 19% | 6% ~ 33% | 提升幅度最小(感知最难改),但最稳定可控 |
汇报用法:要承诺改善"任务成败/效率",可以底气足("行业平均能提 100%+");要承诺改善"满意度/NPS",要把预期压低("感知类一般只提 ~19%,但很稳")——这能帮 PM 设定现实的 OKR,避免给老板画不切实际的饼。
5.3 "改进收窄"规律:从 247% 缩到 75%(别误读成"UX 没用了")
14 年纵向对比:平均改进得分从 2006–2008 年的 247% 降到现在的 75%,降幅 69%,统计显著(p = 0.017)。按类别看降幅:
| 指标类别 | 2006–2008 | 2020 | 趋势 |
|---|---|---|---|
| 有效性 | 324% | 131% | 显著下降 |
| 参与/使用 | 269% | 87% | 显著下降 |
| 采用/留存 | 221% | 93% | 显著下降 |
| 效率 | 109% | 104% | 基本持平 |
| 满意/感知 | 33% | 19% | 略降 |
正确解读(Jakob Nielsen):"进步分数变低,不代表我们做得差,恰恰说明过去这些年把很多问题都解决得很好了。早期设计一言难尽(乱七八糟的启动画面、没用的搜索、满屏图),找 UX 问题轻而易举。"
对 PM 的启示(关键):用户期望随平均体验质量同步上升——把一个 2006 年"还不错"的网站放今天,用户立刻关页面。所以:即便单次改进只有几个百分点,也值得投入,尤其因为竞争对手也在不断优化——你不进则退。这是说服老板"持续投 UX"的最强论据:不是为了爆款式提升,而是为了不被期望和对手甩下。
速查:PM 拿去汇报的一页纸
| 你想做的事 | 用这个 |
|---|---|
| 选指标(怕漏) | 6 大类别表(2.2)或 Google HEART 五维(4.2) |
| 一个跨产品可比的总分 | SUS(0–100) |
| 一个最易向高管传达的忠诚度数 | NPS(推荐者%−批评者%) |
| 把"任务用时↓"折成钱 | 改进分数公式(3.1)+ 三步法(3.2),负向指标=改前÷改后−1 |
| 客诉下降折成省钱 | 降低工单数 × 单张工单成本(3.3 健康保险案例) |
| 内网/工具的 ROI | 节省人天 × 平均薪资(3.4 HR 案例) |
| 把"软指标"接到营收 | UX-Revenue 连锁模型(3.6) |
| 给老板一个现实的提升预期 | 平均 75%(区间 8–104%);按类别看 5.2 |
| 没历史数据也要基准 | 竞品 / 行业标准 / 老板设定目标(4.3) |
| 汇报不挨打 | 5 条铁律(3.5):估算非财报·对比成本·讲故事·透明·拉 2-5 年 |
源自 Will 设计笔记《UX Metrics and ROI》(基于 NN/g 同名报告 + 5 版案例库)。互补阅读:NNGroup 分析与指标 Analytics & Metrics(选对指标/转化漏斗/统计显著与置信区间/UX ROI 四步/抽样与混杂/三角验证/虚荣指标/基准测试)(NN/g 分析度量视角:虚荣指标/转化率/统计显著/抽样/三角验证/ROI 四步原理)、NNGroup 定量研究 Quantitative Research(A/B 测试·样本量·置信区间·UX 指标·转化分析·基准测试·学习曲线)。原 PDF(64MB)与配图保留在 sources(已 gitignore),图表均已转为文字+表格描述。