← Knowledge Notes
Product Design & UX / Knowledge note · Chinese

NNGroup 定量研究 Quantitative Research(A/B 测试·样本量·置信区间·UX 指标·转化分析·基准测试·学习曲线)

Nielsen Norman Group 定量研究知识库 24 篇精华(28 文件去重合并)。定量研究=把用户体验压成可比的数字(成功率/任务时间/转化率/满意度),用来追进展、做权衡、向老板证明 ROI——但数字脆弱、需专业执行,否则误导设计。核心方法:A/B Testing(随机分组测整体方向·只能一次一变量·需高流量·测不出原因要配定性)/ Multivariate Testing MVT(测多变量组合交互·优化细节·组合数=变体数相乘暴涨)/ 关键统计:统计显著性 statistical significance ≠ 实践意义 practical significance(p 值=差值÷随机噪声·大样本制造'显著但无关')/ 置信区间 confidence interval + 误差范围 margin of error + 置信水平 confidence level(95%/15% 是 UX 默认平衡点·区间宽度=误差范围 2 倍)/ 样本量:定量需 40 人(二元指标 95% 置信+15% 误差·公式 Z=1.96 p=0.5)而非定性的 5 人(发现 85% 问题·31% 问题概率假设)/ 假阳性 Type I + 假阴性 Type II / 测量误差 measurement error / 定量风险(数字迷信·随意关联·协变量·发表偏差)。指标与量表:成功率 success rate(最简二元·成功层级用有序变量不可数值化平均)/ 学习性 learnability + 幂律学习 power law of learning(学习曲线·重设计重置曲线致生产力下降)/ NPS 净推荐值(9-10 推荐者/0-6 批评者/公式·客户忠诚≠可用性·6 大局限)/ Likert 量表 vs 语义差异量表 + SUS / 虚荣指标 vanity metrics 加上下文 / 宏观转化 vs 微观转化 / HEART 框架。分析与基准:Analytics 三用途(问题指示·调查·三角验证)/ UX 目标→衡量计划(先问为什么·定目标再选指标)/ 7 步 UX 基准测试 + 数据质量 6 维度(真实/一致/重复/自发/适当/干扰)/ 卡片分类 + 树状测试(可查找性 85% 提升案例)。

Source collection:NNGroup 用户体验 · Published here:2026-09-26 · Note updated:2026-06-03

定量研究A/B 测试UX 指标

定量研究(Quantitative Research)= 把用户体验压缩成可比较的数字(成功率、任务时间、转化率、满意度评分),用来回答三个问题:这一版比上一版好了吗?该选 A 还是 B?UX 投入值多少钱(ROI)?

它的好处是清晰、可追踪、能说服数据型老板;它的陷阱是数字看起来客观,其实很脆弱——样本太小不可靠、样本太大会"显著但无关"、变量太多会"碰巧相关"、执行不严会系统性误导。NNGroup 的一贯立场:定量是定性的补充而非替代——先用定性(5 人)找问题、生成假设,再用定量(40 人 / 大流量)验证方向、量化影响。

下面分 八块:A/B 与 MVT(测什么方向)→ 统计三件套(显著性/置信区间/样本量)→ 两类错误与测量误差 → 指标与量表(成功率/学习性/NPS/Likert/虚荣指标)→ 转化与分析(宏微观/Analytics)→ 基准测试 → 数据质量 → IA 研究(卡片分类/树测)。

一、A/B 测试与多变量测试:先验证方向,再优化细节

四篇 A/B 文章高度重叠(A/B Testing 101 两个版本 + Putting A/B Testing in Its Place + Define Stronger A/B Variations),已合并;MVT 单独成段。一句话路由:重大改版用 A/B 定方向,赢家用 MVT 抠细节。

方法 测什么 怎么测 何时用 核心局限
A/B Testing 两个(或多个)整体版本谁在单一业务指标上更优(转化率/点击率) 真实流量随机分组到 A(控制组,现状)/ B(实验组,改 1 个元素),同时段跑,排除季节/市场等外部变量 重大改版、彻底重设计的整体方向验证 ①一次只能测 1 变量 ②要高流量(小站跑很久)③只告诉你"变了",不告诉你"为什么变"——要配定性
多变量测试 MVT 多个 UI 变量的不同变体组合,以及变量间的交互 同时测所有组合(如 图/视频 × 立即购买/加入购物车),揭示每个变量的具体贡献 已有赢家设计后的逐步优化(按钮文案、图片样式等细节) 组合数 = 各变量变体数相乘,暴涨吃流量;所有组合必须语义/视觉都合理

MVT 三个术语别混:变量 Variable(UI 元素,如"图片")→ 变体 Variant(具体版本,如"图 / 视频")→ 变更组合 Variation(每个变量各取一个变体的最终成品,如"视频 × 加入购物车")。

组合数爆炸的数学:2 个变量 × 各 2 变体 = 2×2=4 个组合;给一个变量加到 3 变体 = 2×3=6。组合越多 → 达到统计显著所需流量和时间越多。

心法:A/B 答"哪个整体更好",MVT 答"是哪个元素、以及元素间怎么配合更好"。例子:A/B 只能说"视频版赢了图片版",但分不清是视频吸引人还是按钮文案改得好;MVT 能拆出"视频 × 加入购物车最优,而按钮文案影响其实很小"。

反例(Garbage in, garbage out):A/B 是强工具,但若变体本身是垃圾,结论也是垃圾。三种翻车:①变体没体现概念价值(加了选项说明,但写得像广告 → 被无视);②变体没解决真问题(简化了表单,但用户真正卡在"找不到贷款利率");③变体纯靠拍脑袋猜。解法 = 先做 UX 研究再定变体——爱因斯坦说"实验能证明理论,但无法引导理论诞生(中文)"。

A/B 设置 4 步:①提假设(基于研究,如"购买→立即购买能提转化")②定改动(只改 1 个元素,小而精准)③选结果指标 + 护栏指标(测点击率,同时盯购买率/客单价,防止某指标涨别处崩)④定测试时长(由样本量算,需三个参数:基线值、可检测最小效应、显著性阈值通常 95%/p=0.05)。配 A/A 测试(测两个相同设计)验证工具没装错。常见错误:目标模糊、过早停测、无强假设、只盯单一指标。

二、A/B 的真实定位:优点很实,但短视、看不见原因

Putting A/B Testing in Its Place 把 A/B 放回"补充工具"的位置——这是 NNGroup 对 A/B 最重要的态度纠偏。

A/B 的 4 大优点 A/B 的 4 大盲区
①真实用户真实行为(可信)②高流量能测出 1% 级别微小差异 ③解决设计权衡(如测出"去掉显眼的优惠码输入框,销售涨 20–50%")④成本低、技术轻 ①只能评估单一明确 KPI(B2B 还要品牌/公关目标就测不了)②只能测已完整实现的设计(纸原型能更早砍掉烂想法)③只看短期指标(促销短期提销量,长期页面混乱降忠诚度)④缺行为洞察——不知道大按钮为何赢、不知道有没有更优解、发现不了意料外的信任/信息问题

结论:A/B 不该是改转化率的首选,也不该是项目唯一研究法。正确流程 = 定性(用户测试+纸原型)快速生成假设和概念 → 定性迭代后用 A/B 验证最终设计是否真优于现状。

三、统计显著性 ≠ 实践意义(产品经理最该懂的一条)

Statistical Significance Isn't the Same as Practical Significance 单列——因为这是数字最会骗人的地方。

概念 回答什么 一句话
统计显著性 Statistical Significance 结果可靠吗(是不是随机产生的) p < 0.05 = 这结果随机出现的概率 < 5%
实践意义 Practical Significance 结果值不值得行动 差异大到能影响用户感知/产品指标/业务吗

p 值的直觉公式(很多 PM 不知道):p ≈ 差值 ÷ 随机噪声(标准误差),再换算成"这么大的差有多罕见"的概率。 完整算例:A/B 各 1000 人,A 成功 850(85.0%)、B 成功 852(85.2%)→ 差值 0.002 → 标准误差 SE=√(p(1-p)/nₐ + p(1-p)/n_b) ≈ 0.0159(p=平均成功率 0.851)→ Z = 0.002/0.0159 ≈ 2.17 → 查表 p ≈ 0.03。统计上显著,但差异只有 0.2%——用户根本感觉不到,不值得花开发成本。

样本量怎么扭曲"显著":

  • 大样本(几万/几百万)→ 哪怕差异极小(表单错误率降 0.03%,p<0.001)也"显著",但显著但不重要。
  • 小样本(UX 常见 10–15 人)→ 哪怕差异巨大也难达显著。例:测两个 dashboard,A 失败 10/12、B 失败 1/12,统计上可能不显著,但 UX 上 A 明显有问题——这时实践意义压倒统计显著。

实践意义是情境依赖的:同样"每次转化 +$2",小产品不重要;但单笔 $1000、年百万次转化的大系统 → $2 × 1,000,000 = $200 万,巨大商业价值。

心法:UX 结论别只看 p 值,要三看——统计显著(可靠吗)+ 实践意义(值得做吗)+ 定性证据(用户卡在哪、为什么)。

四、置信区间 / 误差范围 / 置信水平:怎么诚实表达"我没测全部用户"

Confidence Intervals... + Measurement Error in UX Research 合并——核心都是"样本估总体,必然有误差,要量化并传达"。

概念 定义 例子
置信区间 Confidence Interval 总体真实指标可能落在的范围 79% 加拿大成人愿打疫苗,误差 ±2.1% → 真实值在 77%–81%
误差范围 Margin of Error 区间到观测值的单侧距离 区间下限=观测值−误差,上限=观测值+误差;区间宽度 = 误差范围 × 2
置信水平 Confidence Level 该区间包含真值的概率 95% = 重复研究 100 次,95 次的区间含真值,5 次不含

区间越窄信息越多:成功率 40%、区间 0%–80% → 没法解读;区间收窄到 35%–45% → 才能指导设计。

影响区间宽度的 3 因素:①样本越大 → 越窄;②样本变异性越高 → 越宽;③置信水平越高 → 越宽。

置信水平按任务重要性调:关键任务(飞机降落仪表盘)要高置信水平;非关键任务(机上娱乐重置)可低些。权衡 = 高置信水平更准但区间更宽、要更大样本、更贵。

测量误差 Measurement Error:再努力也消不掉,来源 = 参与人数少 / 个体差异 / 测试环境 / 外部干扰。解法不是消灭它,而是 增样本量降低它 + 用置信区间诚实传达它——告诉老板"结果是近似值,但真实值大概在这个区间"。

五、样本量:定量 40 人,定性 5 人,为什么不一样

Why Use 40 Participants + How Many Participants... + Why 5 Are Okay in Qualitative but Not Quantitative 三篇合并——这是定量研究最高频的实操问题。

为什么是 40(二元指标):目标 = 95% 置信水平 + 15% 误差范围(UX 准确性与成本的平衡点)。统计公式 n = Z²·p(1−p) / E²,其中 Z=1.96(95%)、p=0.5(最保守估计)、E=0.15 → 算出 39,取整防中途退出 = 40。

  • 不能更少:10 人 → 误差约 30%,结果太宽无法指导(成功率观测 70%,区间可能 40%–90%)。
  • 不能更多(收益递减):误差从 15% 降到 10% 要 100+ 人,成本陡增。

省人方案对照表(二元指标):

置信水平 误差范围 需要人数
95% 15% 39
95% 20% 21
90% 15% 28
90% 20% 15

连续指标(任务时间/满意度):人数取决于总体标准差,推荐假设 标准差 = 均值的 52%(均值 1 分钟 → SD≈0.52;均值 10 分钟 → SD≈5.2)。

置信水平 误差范围(占均值%) 需要人数
95% 15% 47
95% 20% 26
90% 15% 33
90% 20% 19

优化策略:预算紧从 20–25 人起,算出误差范围后再决定要不要加。

为什么定性 5 人就够,定量 5 人不够:

研究类型 目标 样本量 结果用途
定性 Qualitative 发现界面问题、推动迭代 5 人通常够(问题概率越低需越多) 只给问题清单,不推总体行为
定量 Quantitative 测指标、预测整体用户行为 通常 30–40 人 数据要过置信区间和显著性

5 人规则的数学(Nielsen & Landauer):假设每个用户遇到问题的概率 31%,则 5 人能发现 85% 的可用性问题。质疑点:31% 是 90 年代数据,现代界面更可用 → 问题概率降低则需更多人(概率 20% → 9 人才发现 85%;概率 10% → 18 人)。定量则因为要算均值/成功率/置信区间,5 人的区间宽到无意义(70% 成功率可能给出 40%–90%)。

六、两类错误:假阳性与假阴性

Common Errors in Quantitative Research 单段——和样本量直接呼应。

错误 学名 含义 主因 解法
假阳性 Type I 错误 数据显示有差异,实际没有(误以为发现了变化) 异常值、混杂变量(以为是新设计带来满意度,其实是无关因素) 招募有代表性用户 + 控制混杂变量
假阴性 Type II 错误 数据没显示差异,实际有(漏掉了真实变化) 统计功效不足——样本太小 增样本量(定量可用性测试建议 至少 40 人)

心法:两类错误都让你误判设计——精心设计研究 + 控变量 + 够样本,才能信自己的结论。

七、指标与量表:成功率 / 学习性 / NPS / 量表 / 虚荣指标

1. 成功率:最简单的可用性指标

Success Rate 单段。成功率 = 完成任务的参与者百分比,二元、简单直观,但说不出为何失败、也不测效率。重要性:任务完不成,其它指标都没意义。

成功层级(部分成功怎么报)——例"为母亲订 12 支黄玫瑰":

成功层级 人数(共 100) 报告(含 95% 置信区间)
完全成功 20 20%(CI 13%–29%)
次要问题成功(下单但漏了贺卡) 35 35%(CI 26%–45%)
主要问题成功(下单但地址错) 30 30%(CI 22%–40%)
失败 15 15%(CI 9%–23%)

关键反例(常见错误):把层级赋数值(完全=1/次要=0.66/主要=0.33/失败=0)算加权平均得 53% 成功率——错! 成功层级是有序变量 ordinal,标签间距离不均匀,不能当连续变量做数学运算。正确做法:用文字标签 + 各层级单独报置信区间,别算平均。

2. 学习性与幂律学习

How to Measure Learnability + Power Law of Learning 合并。

学习性 Learnability = 可用性五要素之一(其余:效率、可记忆性、错误率、满意度),关注首次上手难易 + 需多少次重复才高效。三个层面对应不同用户:

层面 定义 适合用户
首次使用学习性 第一次用的易用性 只用一次的(如注册)
学习曲线陡峭度 重复中进步的速度 偶尔使用的
最终平台期效率 完全熟练后的最高生产力 高频核心用户

幂律学习 Power Law of Learning:"完成任务时间随重复次数增加而减少,遵循学习曲线(中文)"。公式 Y = A·X^(−B)(Y=任务时间,X=重复次数,A/B 常数)。曲线特征:首次最慢 → 逐次变快 → 到某次(如第 4 次)趋于饱和平台,再练提升甚微。

权衡反例:向导流程(wizard)对新手友好,但熟练用户任务时间稳定卡在 16 分钟下不去——可学习但不高效。

重设计为何招骂(最重要的设计启示):老用户在旧界面已到平台期(高效),换新界面 = 把学习曲线重置回第 1 次重复 → 生产力真实下降(不只是"不喜欢")。应对:①渐进部署小改动 ②说明改动价值 ③允许新旧版切换。

做学习性研究 4 步:①选指标(常用任务时间,也可错误数/成功率)②定试验次数与间隔(建议 5–10 次到饱和,间隔匹配真实使用频率:日常任务连续几天/月度任务隔 4 周)③同一批人多次做同任务,画平均时间折线 ④分析(用单因素重复测量方差分析验趋势是否真实;看斜率陡=学得快、平台期效率=熟练上限)。适用复杂高频系统;低频一次性任务(年度报税)用标准可用性测试即可。

3. NPS 净推荐值:管理层爱,但不是可用性指标

NPS: Understanding Its Insights + NPS: What a Customer-Relations Metric Can Tell You 两篇基本重复,已合并。

定义与计算:问"你有多大可能向朋友推荐?"(0–10 分)→ 分三类:推荐者 Promoters 9–10 / 中立者 Passives 7–8 / 批评者 Detractors 0–6。公式 NPS = 推荐者% − 批评者%,范围 −100% 到 +100%。起源:Frederick F. Reichheld,2003《哈佛商业评论》,因"推荐"问题与重复购买/口碑关联最紧。

国际差异:数学上均值该是 5,但 9–10 才算推荐者、6 以下算批评者,显得苛刻;印度/墨西哥分高(>60%),日韩偏低甚至负分;美国重质量、英国重易用、荷兰重创新。建议保持标准算法但解读时考虑地区差异。

6 大局限(为何不能单用):①只是主观评分,测不出体验全貌(用户用得磕磕绊绊却给高分)②小样本无统计意义 ③分箱丢信息(2 分→5 分是大进步但仍算批评者)④客户忠诚 ≠ 可用性(受定价/品牌影响)⑤测不出具体设计满意度(改某页可能不动整体 NPS)⑥可被操纵(只在客户满意时发问卷、用优惠券换好评)。

为何仍用:管理层认可(与利润挂钩)、收集简单(单问题、回应率高)、与 SUS 等 UX 指标相关性强。结论:NPS 不是合格的 UX 指标,但与其他 UX 指标结合可追踪整体感知的长期趋势。

4. Likert 量表 vs 语义差异量表

Rating Scales in UX Research 单段。两种主观评分工具,差异微妙。

特点 Likert 量表 语义差异量表 Semantic Differential
发明 Rensis Likert,1930s Osgood 等,1957
信息获取 对一句陈述表示同意/不同意("我觉得系统易用") 在一对对立形容词间选位置("容易—困难")
选项数 通常 5–7 个 通常 7 点光谱
标签 每个选项都有标签 仅两极有标签,中间不标
局限 迎合偏差(倾向同意)+ 社会期望偏差(选体面答案) 认知负担更高(要抽象对比),用户不懂对立词则失准

SUS(系统可用性量表) 是 Likert 式的典型:10 句关于系统使用的陈述、每项 5 点(强烈同意→强烈不同意)。选择心法:测态度/同意度 → Likert(直接好懂);测感知(易用性/美观) → 语义差异(光谱更灵活)。提示:不确定就两个都测一下;尽量用已验证的标准量表(SUS)而非自造;语义差异要确保对立词是真反义且用户能懂。

5. 虚荣指标:加上下文才有意义

Vanity Metrics: Add Context to Add Meaning 单段。虚荣指标 Vanity Metrics = 只会越来越大、好看但无指导意义的数(总用户数、总下载量、总页面浏览量)。问题:脱离上下文,反映不出 UX 变化。

四种加上下文的办法:①加时间框架(短期快但有随机波动 / 长期稳但响应慢 → 周/月新增更可用)②按用户或访问算比率(某行为的用户占比、人均频次;一次访问多次发生的行为按访问算,如页面浏览/访问)③用户群组分析 Cohort Analysis(比同期注册用户后续行为比例,突变=调查信号)④指标间比率(页面独立访问/总访问;粘性比率 DAU/MAU,10% = 每 10 个月活每天 1 个登录)。

案例:只看总下载量(红线)看不出 UX 变化;看"新活跃用户/下载量比率"(蓝线)就能看出第 4 周更新让新用户活跃比例显著提高。追踪原则:稳定的比率/比例才是好指标(任何变化反映真实系统变化而非随机波动);若指标变化无法驱动可操作结果,它就是虚荣指标,别追。

八、转化与分析:宏微观转化 + Analytics 三用途

1. 宏观转化 vs 微观转化

Macro vs Micro Conversions 单段。

类型 定义 例子
宏观转化 Macro 直接挂钩企业目标的行为,通常就是 KPI 完成购买 / 提交线索表单 / 完成活动注册 / 创建账户;政府网站完成报税也算
微观转化 Micro 与 KPI 间接相关但更频繁,分两类 见下

微观转化两类:①流程里程碑 Process Milestones(通向宏观转化的关键步骤,如机票流程:填航班信息→选航班→填乘客→加服务→支付,前几步都是微观,追踪能找掉队点)②次级行动 Secondary Actions(不直接转化但预测未来转化,如订阅邮件/下载 App)。

非盈利目标:必要行为(内部系统申请休假)不适合用转化率,改用易用性/错误率/客服数据;可选行为(报名非强制活动)适合用转化率。

2. Analytics 在 UX 实践中的三种用途

Three Uses for Analytics + Translating UX Goals into Analytics Measurement Plans 合并。

用途 干什么 报告/工具
①问题指示 监控关键目标,快速诊断潜在问题/线索 页面报告按 URI 筛、来源做次级维度
②问题调查 验证关于宏观转化问题的假设,找根因 流量问题→来源筛页面报告;技术问题→事件报告;内容/视觉→页内分析+热图(CrazyEgg);导航→导航摘要
③三角验证 用定量补充验证定性发现 用户找不到信息→搜索词报告;没点预期链接→导航摘要+页内分析;不愿填表单→事件报告

衡量计划结构:目标/宏观转化(每月 50 个咨询线索)→ 期望动作/微观转化(访问服务页、读内容、下载白皮书)→ 网络指标(独立页面浏览量、页面平均停留时间、事件)。

先问"为什么"(从目标倒推指标,别从易测指标出发):常见错误把"降低跳出率"当目标——跳出率不是目标,真目标是"让内容更吸引人 + 让对的用户找到所需"。正确流程:①明确高层目标 → ②确定行为信号(读到底、与组件互动、从搜索进对页)→ ③选衡量方法(滚动热图、事件追踪、来源/关键词分析、回访率)。视频别只数播放次数,要问到播放比例(播放/页面独立访问)和看 vs 没看的转化率差。

心法:设计成功不在更多点击/PV,而在 UX 优化(省时间、简化流程)。新增批量编辑功能 → 该测任务时间↓、完成率↑、错误↓、参与度↑,而非只数功能使用次数。Analytics 用不好会变成"耗资源没洞察的数据黑洞"。

九、UX 基准测试 7 步(把 UX 和业务目标连起来)

7 Steps to Benchmark Your Product's UX + Benchmarking UX: Tracking Metrics 合并。基准测试 Benchmarking = 用量化指标评估 UX 并与有意义的标准对比,是总结性评估(设计周期末做),通常需定量可用性测试/分析/问卷,跨多版本反复测以追进展。

4 种对比基准:与早期版本(58 秒→43 秒)/ 与竞品(我们表单完成 86% vs 竞品 62%)/ 与行业标准(创建账户易用性 5.3/7 vs 行业 6.5/7;酒店网站 NPS 平均 13%)/ 与目标值(8 周留存 8% vs 目标 15%)。

7 步:①选测什么(定产品类型/目标用户/关键任务;指标参 Google HEART 框架:幸福 Happiness / 参与 Engagement / 采纳 Adoption / 留存 Retention / 任务成功 Task success)②决定怎么测(定量测试+问卷 / 分析 / 问卷,看时间/成本/技能/工具)③收首次数据建基线(先做试点测试,避开大促/经济波动)④重新设计(应用 10 大可用性原则)⑤再测(分析数据可连续测;任务类数据给用户适应期:日用产品 2–3 周、周用产品 4–5 周)⑥解释发现(统计验证 + 情境化)⑦算 ROI(可选,把 UX 指标接到 KPI)。

关键案例(任务时间几乎没变但重设计成功):智能音箱设置——平均任务时间 6.28→6.32 分钟(几乎没动),但成功率 70%→95%、SEQ 易用性 5.4→6.2,说明重设计成功。心法:别只盯一个指标,要看一组;任务时间长短的好坏取决于具体任务。

十、数据质量:别被单个数据点骗 + 定量研究的内在风险

6 Dimensions for Assessing Usability Data + Risks of Quantitative Studies 合并——一个讲"怎么判断数据点可信",一个讲"为什么过度迷信数字会害人"。

评估数据点的 6 个维度(为什么 AI 难做可用性分析:它缺上下文判断):

维度 查什么
真实性 Authenticity 反馈是否发自内心?是否在讨好主持人/被迫评价?
一致性 Consistency 言行是否前后一致?(说"简单"却出错重试 → 信行为不信话)
重复性 Repetition 同一反馈/错误出现频率?多人犯同样错 = 真问题
自发性 Spontaneity 自发还是被引导?(避免过早透露目的、问题里暗示功能)
适当性 Appropriateness 用户是否有代表性?任务是否贴近真实场景?
干扰因素 Confounds 任务顺序效应?指示是否含糊影响完成?

反例:5 人里 4 人说喜欢某功能 → 看似测试良好,但若 ①其实只 1 人真用过且遇困难 ②好评是主持人主动问才出现 ③后续讨论没人再提 ④用户没比较其它选项 —— 这个"4/5 喜欢"就不可信。言行常不一致,要多数据点 + 多方法交叉。

定量研究的"数字迷信"6 陷阱(Risks of Quantitative Studies):

  • 随机结果:p<0.05 = 随机性 < 5%,但每 20 次分析仍可能 1 次纯随机。
  • 随意关联(数据狩猎):变量越多偶然相关越多——7 变量产生 21 个潜在关联;53 变量 → 1378 种可能关联,其中约 69 个会"显著"却无真实联系。必须研究前定假设,而非事后"狩猎"显著性。
  • 忽视协变量:表面相关可能由第三方变量驱动(智力与出生顺序,实由父母经济/教育决定;长链接文本与成功率相关,真因是是否遵循用户中心设计)。
  • 分析过简:过度控制实验/用大学生样本 → 结论搬不到真实场景。
  • 测量扭曲:任务设计/引导不当带偏结果(测广告时让用户评价网页设计 → 逼用户多看广告)。
  • 发表偏差:刊物偏好"新颖"发现而非稳定复现。

结论(NNGroup 的一贯立场):定量需高水平专业 + 严格执行,成本高、易误导;定性更快、更深、更省(5 人发现大部分问题,方法有瑕疵也能给可靠洞察)。判断异常结果三问:靠随意关联吗?受设计/偏差影响吗?只因新奇被吹吗?可靠研究的特征 = 可重复 + 多研究结论一致(如 Nielsen"折扣式可用性工程/5 人测试"最初被质疑,被多次复现后成为公认实践)。资源有限优先定性,定量留给复杂问题或需精准数据时。

十一、IA 研究方法:卡片分类 + 树状测试(定量化的可查找性)

Card Sorting + Quantifying UX Improvements: A Case Study 合并——卡片分类建结构,树状测试量化验证。

卡片分类 Card Sorting:参与者把标注好的卡片(页面/链接/图像)按自己理解分组,揭示用户对信息架构 IA 的心智模型(运动服例:把卫衣+背心归"上衣",手套+帽子归"配饰")。

分类类型 定义 适用
开放 Open 用户自建分组和标签 探索自然分类、发现新 IA 模式
封闭 Closed 用户把卡归入预设类别 验证现有 IA(更建议改用树状测试)
混合 Hybrid 部分预设 + 允许自建 部分类明确但仍要探索其它

实施:卡片 30–50 张(超 50 致疲劳和"大杂烩"类);标签简洁、别用品牌名当线索(避免"丰田卡罗拉"让用户只认品牌);先试点测试。招募:定性 ≥15 人(看分组逻辑),定量 ≥30–50 人(要统计意义)。工具如 OptimalSort 自动出相似性矩阵/聚类图/树图。局限:缺上下文(只看单个内容项,忽略导航线索)、只单层级、超 50 张疲劳、心智差异大解读难。

树状测试 Tree Testing(可查找性的定量化) + 案例 Marketade × Baileigh Industrial(B2B 金属/木工机械,单笔订单常 >$15,000):

  • 起因:销售访谈发现客户因网站 IA 差找不到信息频繁打电话,挤占高价值销售。
  • 定性:可用性测试发现顶级类别太多、子类名不直观。
  • 量化:用 Treejack 树状测试,64 名参与者、8 个顶级类别查找任务,初始导航平均 4/10(某任务只 34% 走对路径)。
  • 改 IA:卡片分类重设计——简化顶级类别、重命名模糊子类、给工具加上下文说明。
  • 结果:新导航平均 7.4/10,相比 4/10 提升 85%;8 个任务中 6 个得分 ≥7。上线后收入和线索大涨。
  • 启示:Baileigh 提升 85% 高于 Marketade 近期平均 75%——复杂设计问题往往藏着巨大改进空间。量化 UX 指标是评估和向客户展示成果的有效工具,且必须定性(找问题)+ 定量(量化验证)结合。

源自 NNGroup Topics / Quantitative Research - 定量研究(28 文件 / 去重合并为 24 篇主题)。定性方法、5 人规则的另一面见 NNGroup 定性研究与研究方法工具箱(方法全景/访谈/共情图/样本量/任务设计/主持/专家评估/工作坊/伦理);把数字用户压成可共情个体见 NNGroup 用户画像 Personas(本质/三类型/范围层级/创建/对比 JTBD-原型-分群/应用/维护/5 大失败);与 Will 的 Google UX 证书课笔记 Google UX 证书 / UX 研究与共情-定义 互为补充(HEART 框架在那边亦有展开)。图片/原档保留在 sources。

来源与关联资料