← 知识整理
产品设计与用户体验 / 知识整理 · 中文

UX 指标与 ROI(HEART/SUS/NPS… 指标体系 + UX 价值折算成钱的方法 + 汇报话术)

Will 设计笔记《UX Metrics and ROI》精华(基于 NN/g 同名研究报告 + 5 版案例库)。聚焦三件 PM 最需要的事:① 指标体系清单——一个 UX 指标(任务完成率/任务用时/成功率/转化率/留存/CLV/跳出率…)长什么样、怎么算、何时用、局限在哪;标准化问卷 SUS(系统可用性量表,满分 100)与 NPS(净推荐值=推荐者%−批评者%)/CSAT 怎么读;Google HEART 框架五维(Happiness 满意/Engagement 参与/Adoption 采用/Retention 留存/Task success 任务成败)当指标选型脚手架;四大数据来源(问卷/定量可用性测试/分析工具/客服与市场数据)各自答什么问题。② UX→ROI 折算方法论——改进分数公式(正向指标=改后÷改前−1·负向指标=改前÷改后−1)、三步法(选 KPI→把 UX 指标按单位换算成 KPI→负责任报告)、四类业态各自怎么折钱(电商按销量/内容站按 PV 广告/内网按人天工资/有明确目标行为的站按转化×客单),含健康保险站省 150 万/年、HR 工具月省 6112 美元/省 60% 工时、金融订阅试用 76→187 月增收 2 万、内网 1000/1 万/10 万人公司 ROI 达成本 8/20/50 倍等全部保留数字;再给 Athenahealth 的'易用性→满意度→推荐意愿→留存与付费推荐'相关性连锁模型,教 PM 用统计相关把软指标接到营收 KPI。③ 期望管理与汇报话术——UX 改版平均提升 75%(95% 置信区间 8%~104%),且 2006→2020 从 247% 缩水到 75%(p=0.017)的'改进收窄'规律,按指标类别拆(有效性 131%/效率 104%/采用留存 93%/参与 87%/满意度 19%),给老板汇报的 5 条铁律(估算非财报/对比研发成本/讲故事不堆表/透明假设/拉到 2-5 年)与反例。与 nngroup-analytics-metrics 互补分工:那篇讲 NN/g 的'分析度量视角'(虚荣指标/置信区间/统计显著/抽样/三角验证/ROI 四步原理),本篇是'指标体系成套清单 + 改进分数数学 + 多业态 ROI 折算配方 + 基准幅度实证数据 + 汇报话术',重叠处(ROI 四步/HEART/置信区间)只交叉引用不重写。读者=产品经理。

资料来源:其他产品、设计与学习资料 · 本站发布:2026-09-26 · 笔记更新:2026-06-03

UX指标用户研究ROI

这组笔记蒸馏自 NN/g《UX Metrics and ROI》报告 + 横跨 5 版的真实案例库,只回答一个 PM 最常被老板逼问的问题:"你说体验变好了——值多少钱?"

它的答案分三层,正好是本文三大块:

  1. 指标体系清单:UX 能量化的就那几类(完成任务费不费劲、用户满不满意、回不回来、转不转化)。每类有什么现成指标、怎么算、何时用、坑在哪——先有一套"菜单"才谈得上选。
  2. UX → ROI 折算方法论:把"任务用时少了 14 秒"翻译成"一年省 150 万",本质是单位换算。给你改进分数公式 + 三步法 + 四种业态各自的折钱配方 + 一个把软指标接到营收的相关性模型。
  3. 期望管理 + 汇报话术:UX 改版平均能提升多少(75%)、为什么现在越来越难提(从 247% 缩到 75%)、给老板汇报怎么说才可信不挨打。

一句心法:ROI 不是财务预测,是方向性指标——"你搞清楚省了多少钱、花了多少钱,老板自然懂。" 别为了精确把自己绕死,讲一个有共鸣的钱的故事,比小数点重要。

与 NNGroup 分析与指标 Analytics & Metrics(选对指标/转化漏斗/统计显著与置信区间/UX ROI 四步/抽样与混杂/三角验证/虚荣指标/基准测试) 的分工:那篇是 NN/g 的"分析度量视角"(虚荣指标、转化率脾气、置信区间、统计显著、抽样、三角验证、ROI 四步原理);本篇是"成套指标清单 + 改进分数数学 + 多业态折钱配方 + 基准幅度实证 + 汇报话术"。两篇都讲到的(ROI 步骤、HEART、置信区间)这里只交叉引用、不重写。


一、为什么 PM 要逼自己量化 UX(说服力的来源)

Why:定性研究(访谈、故事、用户原话)一直是 UX 主流,因为它能解释"问题是什么、怎么改"。但它有个致命短板——说不清"规模":这个问题影响多少人?有多严重?该不该优先?这些只有数字能答。

定量数据对 PM 的真正价值,不在"更科学",而在能打动拿钱的人:

定量数据帮你做的事 为什么对 PM 关键
确定问题规模(多少用户受影响) 决定要不要排进这个迭代、优先级多高
给 A/B 测试等设计实验提供依据 把"我觉得 B 更好"变成"B 让加购涨 12%"
打动利益相关者、展示 UX 价值 老板多是商科/财务出身,爱看数字;数字可视化最易在组织内传阅、向上汇报
把 UX 成果挂到企业 KPI(收入/成本) 争取更多 UX 资源、扩团队最有效的方式

真实台词(HelloFresh 研究负责人):"我们根据定性测试发现的问题做了一个非常小的调整,带来了 12% 转化率提升——对我们这种规模的公司,这已经惊人了。有了好结果,公司就更愿意投钱;项目越多,投入越大。"

反例/陷阱:别为了"硬数据"而硬塞定量。Marketade 的 UX Writer 复盘过一个项目:定量部分纯是客户坚持要,最后真正带来洞察、客户最认可的反而是定性访谈——"定量没带来太多洞察,但数字能做成图表,客户特别吃这一套。" 所以定量的价值有时是说服而非发现,别把两者搞混。

定量怎么用——分两个时机(借形成性/总结性这对词):

  • 形成性评估(Formative):项目还在构思/原型阶段,"边做边看方向对不对"。主力是定性,但定量可辅助——A/B 测试就是典型的形成性定量(两版同时上线,比转化率/点击率)。
  • 总结性评估(Summative):一个设计周期收尾,评估"这次改动到底有没有用"。主力是定量,收集 UX 指标衡量成败,可对比新旧版或对比竞品。总结性里用定量衡量体验质量,就叫 UX 基准测试(Benchmarking)——见第四节。

二、核心指标体系清单:测什么 / 怎么算 / 何时用 / 局限

Why:你没法管理你测不了的东西。但 UX 能量化的维度其实有限——就那几类。先把"菜单"摊开,选型时才不会漏、不会拿错指标量错东西。

2.1 UX 指标到底是什么

UX 指标 = 一个反映用户体验某侧面的数值。 用咖啡打比方:"奶泡像叶子、杯子很复古"是定性(描述感觉);"12 盎司、120 华氏度、7.35 美元"是定量(量化事物)。UX 定量研究主要盯下面这几类体验细节:

体验维度 对应的常见指标 一句话
完成任务要多少力气/时间 任务用时 Time on task 衡量流程效率
任务在用户眼里有多难 易用性评分 Ease-of-use 主观难度
多少人能成功完成 成功率 Success rate 最常见的可用性指标
用户多满意 满意度评分 / CSAT / NPS / SUS 评分或问卷收
多频繁回来 回访率 / 复访 反映粘性
总共多少用户 用户总数 衡量受欢迎度(注意:孤立总数易成虚荣指标,见 NNGroup 分析与指标 Analytics & Metrics(选对指标/转化漏斗/统计显著与置信区间/UX ROI 四步/抽样与混杂/三角验证/虚荣指标/基准测试))
多少比例进入关键流程下一步 转化率 / 漏斗各步完成率 漏斗分析核心

2.2 按"指标类别"成套理解(选型脚手架)

报告把所有 UX 指标归成 6 大类——这张表是搭指标看板(Dashboard)、写研究报告、做改版追踪时最实用的分类骨架:

指标类别 测的是体验哪一面 示例指标
采用 / 留存 Adoption/Retention 拉新 + 留老(含流量访问) 线索提交数、申请表提交、订阅注册、续订、新访客、回访用户、自然搜索来的用户
有效性 Effectiveness 用户能不能成功完成任务 成功率、完成率
效率 Efficiency 完成任务快不快、顺不顺 任务用时、平均会话时长、树状测试得分、完成时间、错误数
参与 / 使用 Engagement/Usage 用得多频繁、多深、多广 人均会话次数、跳出率、页面价值、功能使用率、活跃用户数
收入 Revenue 实际赚到多少钱 每月营收、每会话营收、平均订单价值(AOV)
满意 / 感知 Satisfaction/Perception 用户主观怎么想 易用性评分、CSAT、NPS、应用商店评分、主观成功感

何时用:目标是拉新增收 → 看采用/留存 + 收入;目标是降客诉 → 看有效性/效率;想知道"用户爽不爽" → 只能看满意/感知(且只能靠问卷,分析工具和操作测试都测不出态度)。

2.3 标准化问卷指标:SUS / NPS / CSAT —— 最容易拿去汇报的三个

这三个是"现成量表",PM 可以直接抄来用,跨产品/跨时间可比:

指标 全称 / 是什么 怎么算 何时用 / 局限
SUS System Usability Scale 系统可用性量表 10 道标准题,换算成 0–100 分(注意:不是百分比,是行业通用标尺,~68 分算平均) 想要一个跨产品可比的可用性总分时用;局限=只给总分,不告诉你具体哪坏
NPS Net Promoter Score 净推荐值 问"愿不愿推荐(0–10)",推荐者%(9-10) − 批评者%(0-6),得 −100~+100 衡量忠诚度、最易向高管传达;局限=单一数字,波动大,不解释原因
CSAT Customer Satisfaction 满意度 问卷打分(如 1–5),取平均值 测对某个具体产品/交互的满意;局限=主观、受情绪与时点影响

易用性评分(Ease-of-use)/ 满意度评分:让用户在 1–5 或 1–7 量表(Likert)上选,再求平均。常接在任务后面问(完成任务立刻评分),把"做得成"和"觉得难不难"一起收。

2.4 四大数据来源:各自答什么问题

Why:同一个指标,从不同来源拿到,可信度和含义都不同。先认清"这个数从哪来",才知道它能不能信、能不能下结论。

来源 答什么问题 典型指标 局限
问卷 Surveys 用户怎么想(主观) 满意度、易用性、NPS、SUS 自我报告,可能与真实行为不符
定量可用性测试 用户能不能做成、效率多高(给定任务) 任务用时、成功率、任务后易用性评分 样本小(~40 人)、贵、难推广
分析工具 Analytics(GA / Adobe / Pendo) 用户实际做了什么(真实环境) 转化次数/率、回访用户、流失率、跳出率、每用户收入 缺上下文(知其然不知其所以然);不可控(竞品大促也会动你的转化)
客服 + 市场数据(非研究渠道) 旁证产品好不好用 客服工单数、故障报错量、CLV、应用商店评分 间接,需排除其它原因

树状测试(Tree Testing) 是评估信息架构(IA,即菜单/目录结构)的专门方法:只给用户看菜单层级、不让进页面,给个任务("我要注册成雇主,点哪?")看他能不能点对。三个指标:总体成功率(最终找到对的)、直接成功率(第一次就对)、间接成功率(先错后对)。

何时用客服/应用商店数据:它们免费且天然存在,改版后看"客服工单有没有变少、应用商店评分有没有变好"——这是把 UX 接到成本/增长的最省事入口(评分高还会带来更多下载)。

2.5 有数据 ≠ 只看数据:定量定性必须来回循环

Why:分析数据永远说不出"为什么"。同样"翻很多页、停留很久",可能是沉浸享受,也可能是迷路抓狂(详见 NNGroup 分析与指标 Analytics & Metrics(选对指标/转化漏斗/统计显著与置信区间/UX ROI 四步/抽样与混杂/三角验证/虚荣指标/基准测试) 的希腊旅游站例子)。

标准节奏:先看数据找线索 → 再访谈找原因 → 继续测 → 循环。 可以正着来也可以反着来:

  • 定性先行:PetSmart 慈善站,先靠定性测试发现订阅流程有问题 → 再用 Google Analytics 量化"73% 用户中途放弃" → 证明影响范围"有多严重"。
  • 定量先行:先用分析发现"任务失败率高" → 再访谈问用户到底卡在哪。

三、UX → ROI:把体验折算成钱(本文核心方法论)

3.1 第一步数学:改进分数公式(正向 vs 负向指标)

Why:汇报"成功率从 25% 到 100%"不如说"提升了 300%"有冲击力。但不同指标涨跌方向相反,公式不能一概而论,算反了会闹笑话。

先给指标分两类:

  • 正向指标(越大越好):销售额、访问量、满意度、成功率、转化率——希望它涨。
  • 负向指标(越小越好):错误数、客服工单、任务完成时间(通常)——希望它降。
    • 注意场景:娱乐场景里"停留时间"反而是正向(手游希望用户玩越久)。

改进分数公式(务必记反向):

指标类型 改进分数公式
正向指标 (改后值 ÷ 改前值) − 1
负向指标 (改前值 ÷ 改后值) − 1

算给你看:

  • 转化率 2% → 5%(正向):5 ÷ 2 = 2.5,即 提升 150%。
  • 任务用时 3 分钟 → 2 分钟(负向):3 ÷ 2 = 1.5,即 效率提升 50%(同样 1 小时,旧版做 20 个 3 分钟任务,新版做 30 个 2 分钟任务,多干 50%)。
  • HelloFresh 成功率 25% → 100%(正向):100 ÷ 25 = 4,即 提升 300%;任务用时 28 秒 → 14 秒(负向):提升 100%。

3.2 三步折算法:把 UX 指标变成 KPI 变成钱

核心比喻(全文最重要一句):算 ROI 本质是单位换算——跟"两加仑等于几升"是同一件事,只不过你换的是"任务用时 → 节省成本"。

Step 1 选 KPI:先问"公司到底关心什么?" 利润?成本?流失率?满意度?按组织目标 + 按汇报对象选(给高管/客户/投资人看,关注点不同)。

真实教训(Marketade 研究员 Emily):同一个"工程师监控占比 70%"的发现,在第一家油企能跟"产量目标"挂钩、很有用;到第二家公司却没人理,他们只在意"数据质量"——她换了个角度说"UX 改进让产量误差减少 10%,避免数百万美元损失"。结论:"人们关注的数据,和他们的角色密切相关。" ROI 的艺术是"讲一个有共鸣的故事"。

常见 KPI 菜单:利润 / 成本 / 客户生命周期价值 CLV / 员工流失率 / 员工生产力 / 捐赠人数。

何时可以跳过:UX 成熟度高的组织里,KPI 和 UX 指标本就一致(大家已经都重视"任务完成时间"),这时算 ROI 可能没必要——价值已公认,别为算而算。

Step 2 把 UX 指标换算成 KPI:找转换比例。 例:客服流程节省 30 秒,时薪 100 元 → 每次省 0.83 元。常要找别的部门要数据(分析团队/HR/财务),拿数据时务必说清你要它干嘛。

Step 3 负责任地报告(5 条铁律,见 3.5)。

3.3 招牌案例:健康保险站,一年省 150 万(全数字保留)

注册流程的 UX 指标可以从四个来源拿:成功率(可用性测试)/ 完成率(网站分析)/ 易用性评分(问卷)/ 客服工单数(客户支持数据)。实际算 ROI 时,只挑一个核心指标最省事——这里挑客服工单,因为最容易换成钱。

工单减少量 = 改版前工单数 − 改版后工单数 = 23,000 − 1,100 ≈ 21,900 张
成本节省  = 工单减少量 × 每张工单成本 = 21,900 × $6
月省 ≈ $131,400  →  年省 ≈ $1,576,800(约合一年省 150 多万美元)

PM 落地:这个案例的方法论可直接套——任何"改版后客诉/工单下降"的项目,都可以 (降低的工单数 × 单张工单成本) 折成省下的钱,这是最容易被财务认可的 ROI 口径。

3.4 四种业态各自的折钱配方

Why:不同生意"值钱的地方"不一样,ROI 怎么折取决于业态。先认准你这门生意属于哪类。

业态 价值锚在哪 折钱配方
电商 / 有明确目标行为的站 转化(购买、申请、注册、订阅) 转化提升 × 客单价。用的人越多越值钱(亚马逊销量翻倍=收入翻倍)。设计改难了销量掉,老板就让你改回去
内容站(新闻类) 流量(PV/UV → 广告) 改版后 PV/UV 提升量 × 广告单价
企业内网 / 工具 员工工时 = 工资 节省人天 × 平均薪资。效率提升 = 人力支出下降 = ROI
公益 / 政府 非货币(访问量、服务覆盖、捐赠人数) ROI 不一定是钱,可以是"帮了多少人"

三个迷你案例(全数字保留):

  • 金融订阅站 The Deal(电商型):改版后免费试用申请三个月 76 → 187;假设 18% 转付费、每客户 $1,000:(187−76) × 18% = 20 个新付费用户 → 20 × $1,000 = 月增收约 $20,000(且试用客户持续累积,未来更多)。
  • HR 工具(内网型):优化一个高频耗时任务,每月省 32 个人天;HR 年薪 $50,000 ÷ 261 工作日 ≈ $191/天 → $191 × 32 = 月省 $6,112。诚实备注:固定工资员工省下的不是现金,而是"这些时间能投到别的任务上",长期才创造价值——报告里要这么讲才可信。这个高频任务整体把 HR 耗时 减少了 60%。
  • 内网规模放大效应:同样的内网可用性优化,1,000 人公司 ROI ≈ 成本 8 倍;1 万人 ≈ 20 倍;10 万人 ≈ 50 倍——因为每个用户都享受到改进,人数放大收益。

3.5 报告 5 条铁律(给老板汇报的话术)

铁律 一句话 为什么
① 估算非财报 "算 ROI 不用一毛不差,估个差不多就行" ROI 是方向性指标,帮你判断哪个项目更值,不是财务预测
② 对比研发成本 把省下/赚到的钱 和这次改进的研发投入做对比 这才是 ROI 的核心,光说省钱不说花多少没意义
③ 讲故事不堆表 "把数字串成逻辑清晰的故事线" 回答"我们为啥做、怎么做、结果好不好",别甩一堆没人看的表格
④ 透明假设 说清数字来源和假设依据 听众若觉得你"只是为自己争预算",就当你在拉私活
⑤ 拉到 2-5 年 "一次好设计几年都能省钱,别只看眼前" UX 改进有累积性(今年省 30 万,明年还能再省),拉长更有说服力

反例:为了"严谨"把每个 UI 组件、每个变量都算进 ROI——耗时数周,老板早走神。过度分析 = 没分析(参见 NNGroup 分析与指标 Analytics & Metrics(选对指标/转化漏斗/统计显著与置信区间/UX ROI 四步/抽样与混杂/三角验证/虚荣指标/基准测试) 的"设计系统只算一个视频插件就说服老板"的 Don't Overthink)。

3.6 进阶:用相关性把"软指标"接到营收 KPI

Why:满意度、易用性这些"软"指标,高管常觉得"跟钱没关系"。怎么证明它们最终影响营收?——用统计相关性搭一条逻辑链。

Athenahealth 连锁模型(医疗 SaaS 实证):两年内对一款产品收了 超 5 万份完整问卷,问"易用性"和"可靠性"。统计验证出一条显著正向链条(p < 0.000001):

易用性 + 可靠性  →  产品满意度  →  推荐意愿(NPS)  →  付费推荐 + 用户留存
(用户感知)      (满意度)      (忠诚度)          (营收 KPI)

怎么用这条链:产品出问题时倒推——留存掉了?是不是满意度出问题?是不是易用性/可靠性不够好?这给了 PM 一条"提升易用性 → 最终影响 KPI"的可证明路径,有数据闭环撑腰。

通用版叫 UX-Revenue Chain(UX 到营收连锁模型),可套到任何产品: ① 体验投入(可用性 + 客服 + 产品质量)→ ② 整体满意度 → ③ 忠诚度(推荐意愿/复用/降流失)→ ④ 营收(增购/续费/推荐/降获客成本)。前段是"体验类 KPI",后段是"商业类 KPI"——这张图本身就能当 KPI 体系的设计依据。


四、UX 基准测试:量化改版值不值的"标尺"

Why:没有基线就像减肥不先量体重——改完根本不知道有没有效。基准测试 = 用量化数据衡量产品相对某标准(自己历史 / 竞品 / 行业)的表现,并追踪改进。它是 ROI 计算的数据源头(ROI 第 1 步的指标就从这来)。

4.1 七步流程:前三步启动,后四步循环

步 做什么
1 选测什么——锁定产品 + 用户群,找"对用户最关键的任务"
2 选怎么测——问卷 / 分析 / 定量可用性测试(三选一或搭配)
3 收第一次数据——当基线(Baseline / 打底分)
4 重新设计产品
5 再测一次
6 解读结果
7 算 ROI(可选)

步骤 4–7 是可重复的循环,长期跟踪。两个易踩的坑:

4.2 用 Google HEART 框架选指标(选型脚手架)

选"测什么"时最常用的脚手架。把 UX 拆成 5 个维度,每维配现成指标——避免客户/老板只盯"页面浏览数"这类浅层数据。

HEART 维度 含义 示例指标
Happiness 满意度 用户态度 满意度评分、易用性评分、NPS
Engagement 参与度 活跃程度 平均任务时间、功能使用率、转化率
Adoption 采用率 首次使用 新注册、访问次数、销量
Retention 留存率 长期使用 回访用户、流失率、续订率
Task success 任务成败与效率 成功率 + 效率 错误数、成功率、任务用时

何时用:客户给"成功标准"说不清(只会说"想做好")时,用 HEART 帮他把模糊目标逐维翻译成可衡量的指标。

4.3 找对照点:没历史数据也能基准

第一次测就是"打底分"。即使你刚启动、没历史,也能找对照:

  • 竞品对比:对竞品 App 也跑一轮定量测试(HelloFresh vs BlueApron)。
  • 行业标准:行业"找菜谱"易用性均分 4.5(满分 5),拿自己比。
  • 利益相关者目标:老板要求"找菜谱 ≤ 20 秒",实测 14 秒 = 达标。

4.4 实证范例:HelloFresh 改版数据(全保留)

指标 改版前 改版后 改进分数
SUS(满分 100) 75 90 +20%
任务用时(秒) 28 14 +100%(快一半)
主观成功率 63% 100% +59%
成功率 25% 100% +300%
易用性评分(/7) 6.1 6.9 +13%
信心评分(/7) 5.9 6.9 +17%

4.5 "结果不显著"也别喊失败(Shopify 反例)

Shopify 账单页改版,数据全都不显著、甚至轻微变差(完成时间 +8% 变慢、易用性 −3%、成功率 0 变化):

指标 改版前 改版后
完成时间 59 秒 64 秒(+8% 变慢)
易用性(/7) 6 5.8(−3%)
成功率 90% 90%(无变化)

但定性观察发现用户对信息分区理解更清晰、探索路径更短、误点更少。研究员总结:"有些设计改动不会马上反映在指标上,但你必须用量化方法把它拆出来,知道是'真没变'还是'变好了只是方式不同'。" 且这个"不爆款"项目逼着团队建了一套 UX 基准测试工具包,推广给全 Shopify 设计团队——没有显著提升的改版,反而搭起了长期改进的基石。


五、期望管理:UX 改版到底能提升多少 + 为什么越来越难

Why(对 PM):老板问"改版能带来多大提升?",你需要一个有据可依的预期区间,既不夸海口也不妄自菲薄。NN/g 跨 14 年的案例库给了答案。

5.1 平均提升 75%,但区间很宽

为什么有的改版翻倍、有的纹丝不动? 五个因素:

  1. 原体验有多烂——问题越多,改进空间越大;本就优秀的产品,提升空间小。
  2. 团队多厉害——经验/技能/策略决定深度;但顶尖团队也不可能每次完美。
  3. 改了多少、改得多关键——大项目通常影响大,但项目规模与改进效果没有统计显著关联(小而精也能爆)。
  4. 方法/指标够不够敏感——A/B 测试几千个数据点能测出极小变化;40 人可用性测试要更大差异才显著(Shopify 的小改动可能被不敏感的指标漏掉了)。
  5. 要改的行为本身多难改——习惯越难改,设计影响越小。

重要提醒:有些改版会让指标变差——报告里有公司改完表单提交量反降 65%。哪怕做了调研、最强的团队也可能翻车。只要你在持续测数据,就能及时发现并改回去——越早发现,伤害越小。

5.2 按指标类别拆:哪类最好改、哪类最难改

指标类别 平均提升 95% 置信区间 PM 解读
有效性 Effectiveness 131% −9% ~ 271% 设计对"帮用户做成任务"影响最大,但波动也大(有负下限,可能改坏)
效率 Efficiency 104% 31% ~ 177% 改"快不快"也很有效
采用/留存 93% 45% ~ 140% 较稳
参与/使用 87% −3% ~ 177% 波动大,可能改坏
满意/感知 19% 6% ~ 33% 提升幅度最小(感知最难改),但最稳定可控

汇报用法:要承诺改善"任务成败/效率",可以底气足("行业平均能提 100%+");要承诺改善"满意度/NPS",要把预期压低("感知类一般只提 ~19%,但很稳")——这能帮 PM 设定现实的 OKR,避免给老板画不切实际的饼。

5.3 "改进收窄"规律:从 247% 缩到 75%(别误读成"UX 没用了")

14 年纵向对比:平均改进得分从 2006–2008 年的 247% 降到现在的 75%,降幅 69%,统计显著(p = 0.017)。按类别看降幅:

指标类别 2006–2008 2020 趋势
有效性 324% 131% 显著下降
参与/使用 269% 87% 显著下降
采用/留存 221% 93% 显著下降
效率 109% 104% 基本持平
满意/感知 33% 19% 略降

正确解读(Jakob Nielsen):"进步分数变低,不代表我们做得差,恰恰说明过去这些年把很多问题都解决得很好了。早期设计一言难尽(乱七八糟的启动画面、没用的搜索、满屏图),找 UX 问题轻而易举。"

对 PM 的启示(关键):用户期望随平均体验质量同步上升——把一个 2006 年"还不错"的网站放今天,用户立刻关页面。所以:即便单次改进只有几个百分点,也值得投入,尤其因为竞争对手也在不断优化——你不进则退。这是说服老板"持续投 UX"的最强论据:不是为了爆款式提升,而是为了不被期望和对手甩下。


速查:PM 拿去汇报的一页纸

你想做的事 用这个
选指标(怕漏) 6 大类别表(2.2)或 Google HEART 五维(4.2)
一个跨产品可比的总分 SUS(0–100)
一个最易向高管传达的忠诚度数 NPS(推荐者%−批评者%)
把"任务用时↓"折成钱 改进分数公式(3.1)+ 三步法(3.2),负向指标=改前÷改后−1
客诉下降折成省钱 降低工单数 × 单张工单成本(3.3 健康保险案例)
内网/工具的 ROI 节省人天 × 平均薪资(3.4 HR 案例)
把"软指标"接到营收 UX-Revenue 连锁模型(3.6)
给老板一个现实的提升预期 平均 75%(区间 8–104%);按类别看 5.2
没历史数据也要基准 竞品 / 行业标准 / 老板设定目标(4.3)
汇报不挨打 5 条铁律(3.5):估算非财报·对比成本·讲故事·透明·拉 2-5 年

源自 Will 设计笔记《UX Metrics and ROI》(基于 NN/g 同名报告 + 5 版案例库)。互补阅读:NNGroup 分析与指标 Analytics & Metrics(选对指标/转化漏斗/统计显著与置信区间/UX ROI 四步/抽样与混杂/三角验证/虚荣指标/基准测试)(NN/g 分析度量视角:虚荣指标/转化率/统计显著/抽样/三角验证/ROI 四步原理)、NNGroup 定量研究 Quantitative Research(A/B 测试·样本量·置信区间·UX 指标·转化分析·基准测试·学习曲线)。原 PDF(64MB)与配图保留在 sources(已 gitignore),图表均已转为文字+表格描述。

来源与关联资料