这个文件夹是一本方法选型手册——23 个 UX 研究方法,每个都按同一张九段模板(概述/适用/案例/步骤/价值/风险/对比/最佳实践/作品集)讲透。但对 PM 来说,真正稀缺的不是"每个方法怎么做",而是"我手头这个问题,到底该用哪个"。所以本篇不复述每个方法的操作细节,而是重做成三件事:① 用 NNGroup 四象限把 23 法一次定位;② 给 按问题 / 按阶段 / 按预算 三套选择表;③ 把方法拆成五大族,每族讲"何时用·怎么选·反例",并画出方法搭配链(很少单用一个方法,真正的功力是组合)。
和已有的 NNGroup 定性研究与研究方法工具箱(方法全景/访谈/共情图/样本量/任务设计/主持/专家评估/工作坊/伦理) 重叠约 35%——访谈、焦点小组、可用性测试、专家评估那几块在那边讲得更细,这里只给指针。本篇的增量是另外 13 个方法(定量四法 / 实验两法 / IA 两法 / Kano / 服务蓝图 / 旅程图 / 田野 / 视觉测试),以及"选型"这个视角本身。
一句话心法:定性回答"为什么/哪里出问题",定量回答"多大/多严重",专家法回答"先省钱扫一遍",但没有一个方法能单独给出完整真相——选型的本质是搭配。
一、先定位:NNGroup 四象限把 23 法摊开
任何方法都能用两根轴定位(NNGroup 经典框架):
| 轴 | 两端 | 区别 |
|---|---|---|
| 数据性质 | 态度型 Attitudinal(用户说) ↔ 行为型 Behavioral(用户做) | 说和做常常相反——想知道真实行为别只靠问 |
| 数据形态 | 定性 Qualitative(发现问题、给方向) ↔ 定量 Quantitative(测指标、给数字) | 定性答"为什么/哪里",定量答"多严重/多少人" |
23 法在四象限里的落点:
| 象限 | 方法 | 它能告诉你 |
|---|---|---|
| 态度 + 定性 | 用户访谈 / 焦点小组 / 反应卡情绪词 / 视觉设计测试(偏好题) | 动机、心智模型、第一印象、品牌感知 |
| 行为 + 定性 | 可用性测试 / 田野研究 / 日记研究 / 任务分析 / 卡片分类 / 树测试 / 眼动 | 用户实际怎么做、卡在哪、怎么组织信息 |
| 态度 + 定量 | 调查问卷(大样本) / Kano / 视觉测试(评分题) | 满意度趋势、需求优先级分布、品牌词命中率 |
| 行为 + 定量 | Analytics / 转化漏斗 / 用户路径(Sankey) / A/B / 多变量 MVT | 在哪一步流失多少、哪个版本转化高 |
| 跨象限框架 | 根因分析 RCA / 旅程地图 / 服务蓝图 | 不是单一方法,是"装别的方法"的容器/可视化骨架 |
两组正交标签:形成性 Formative(早期、为改进找问题)vs 总结性 Summative(评整体、对比竞品/旧版);远程 Remote vs 现场 In-person。访谈/卡片分类/树测试/调查都能远程跑,田野/眼动几乎必须现场。
二、三套选型决策表(本篇核心)
按"你想回答什么问题"选
| 你的问题 | 首选方法 | 为什么 / 反例 |
|---|---|---|
| 用户是谁、动机/心智模型是什么 | 用户访谈(NNGroup 定性研究与研究方法工具箱(方法全景/访谈/共情图/样本量/任务设计/主持/专家评估/工作坊/伦理)) | 探索期挖"为什么";反例:别拿它测界面好不好用 |
| 用户在真实环境里到底怎么做 | 田野研究 Field Study / 日记研究 Diary | 看到实验室看不到的环境干扰与权宜之计;反例:成本高、不适合频繁验证 |
| 完成一个目标要走多少步、哪步认知负荷高 | 任务分析 Task Analysis(HTA 层级图) | 把"想要什么"拆成"怎么一步步做";反例:别只看现状流程,会把低效搬进新系统 |
| 内容/导航该怎么分类(从无到有) | 卡片分类 Card Sorting | 揭示用户心智里的归类;反例:不含页面上下文,只给一级分类,必须配树测试验证 |
| 现有/候选导航好不好找(验证) | 树测试 Tree Testing | 纯文字菜单测可找性,有成功率/直接命中率;反例:剥掉了视觉/搜索,不等于真实体验 |
| 界面好不好用、卡在哪 | 可用性测试(NNGroup 定性研究与研究方法工具箱(方法全景/访谈/共情图/样本量/任务设计/主持/专家评估/工作坊/伦理)) | 行为+定性的黄金标准;先看做不看说 |
| 新手第一次能不能学会 | 认知走查 Cognitive Walkthrough(NNGroup 定性研究与研究方法工具箱(方法全景/访谈/共情图/样本量/任务设计/主持/专家评估/工作坊/伦理)) | 专评可学性、不用真用户 |
| 预算紧、想先扫一遍明显坑 | 启发式评估 Heuristic Evaluation(NNGroup 可用性测试与十大可用性启发式(10 条启发式完整表 · 复杂应用应用 · 用户愉悦层级 · 测试方法 5 人法则/招募/远程/任务场景/分步任务/态度vs行为/4步分析/小样本误差/竞争性评估)) | 3-5 专家对照十大原则;反例:替代不了真用户 |
| 大样本态度/满意度/NPS | 调查问卷 Survey(NNGroup 定性研究与研究方法工具箱(方法全景/访谈/共情图/样本量/任务设计/主持/专家评估/工作坊/伦理)) | 快、便宜、定量;反例:只反映态度不反映行为,偏差多 |
| 一堆功能,哪些必做/哪些锦上添花 | Kano 模型 | 正反双问把特性分五类;反例:给的是满意度结构不是 to-do 清单 |
| 用户在哪一步流失、流失多少 | 转化漏斗 Funnel | 楼梯图直观定位瓶颈;反例:只告诉"哪里掉"不告诉"为什么" |
| 用户真实走的路径(非理想路径) | 用户路径分析 Sankey | 捕捉绕路/回退/多分支;反例:同一路径可能完全不同体验,要定性补 |
| 指标突然异常,系统性查根因 | 根因分析 RCA | 5 Whys/鱼骨图把症状追到根因;反例:别先有结论再找证据(确认偏误) |
| 两个方案选哪个 / 微调有没有用 | A/B 测试 | 真实流量、结论可靠;反例:只说"哪个好"不说"为什么",难发现意外问题 |
| 同一页多个元素的最优组合 | 多变量测试 MVT | 一次测所有组合、看交互效应;反例:吃流量,组合多了跑不动 |
| 视觉风格/品牌感对不对 | 视觉设计测试 / 反应卡情绪词 | 5 秒测试+受控词表把"感觉"量化;反例:对行为影响判断弱 |
| 用户读不读得进长文、忽略了什么 | 眼动追踪 Eyetracking | 生理级注意力证据;反例:"看了"≠"懂了",设备贵样本要求高 |
| 跨触点/跨部门体验割裂在哪 | 旅程地图 → 服务蓝图 | 先用户视角再组织视角;把 UI 问题追到组织/流程根因 |
| 大流量产品持续监控、问题有多大 | Analytics for UX | 规模真实持续;反例:看行为不看动机,必须配定性 |
按"项目处在哪个阶段"选
| 阶段 | 主力方法 | 心法 |
|---|---|---|
| 探索 / 问题定义 | 访谈 · 焦点小组 · 田野 · 日记 · 卡片分类 · 任务分析 | 这阶段求发散和理解,几乎全是定性;别急着上 A/B |
| 概念 / 信息架构 | 卡片分类 → 树测试 · Kano(功能优先级) · 旅程地图(理想未来) | 在没有视觉稿时就把"骨架"打磨好,降低返工 |
| 设计验证(上线前) | 可用性测试 · 认知走查 · 启发式评估 · 树测试复测 · 视觉测试 | 上线前排雷:先专家法扫明显坑,再真用户验深坑 |
| 上线后 / 增长优化 | Analytics · 漏斗 · 路径 · A/B · MVT · RCA · 日记(长期) | 这阶段求量化和验证,以行为定量为主 |
| 复盘 / 持续监控 | RCA · Analytics 看板 · 定期轻量 Kano/日记 | 把核心漏斗钉在看板,例行复盘,不要只在异常时才查 |
按预算 / 能力门槛选(从便宜到贵)
| 门槛 | 方法 | 备注 |
|---|---|---|
| 几乎零成本、内部就能做 | 启发式评估 · 认知走查 · 任务分析 | 专家法不用招募真用户 |
| 低成本、需招少量用户 | 访谈(5-6 人起) · 可用性测试(5 人) · 卡片分类(定性 15 人) · 树测试 | 定性看饱和点,详见NNGroup 定性研究与研究方法工具箱(方法全景/访谈/共情图/样本量/任务设计/主持/专家评估/工作坊/伦理) |
| 中成本、需工具/平台 | 调查问卷 · 焦点小组 · 视觉测试 · 远程树测试/卡片分类 | 在线工具(OptimalSort/Treejack/UserZoom) |
| 高成本、要流量或设备 | A/B · MVT · 眼动 · 田野 · 长周期日记 | A/B 要够流量+时间;眼动要专用设备;田野要差旅+长周期 |
| 高人力、跨部门协作 | 服务蓝图 · 旅程地图(共创) · RCA | 不贵在钱贵在"组织时间",要管理层支持 |
三、五大族详解(何时用 / 怎么选 / 反例)
族 1:定性探索——挖"为什么"和"真实场景"
| 方法 | 核心定位 | 何时选它而不是邻居 |
|---|---|---|
| 用户访谈 | 一对一深挖动机/心智 | 要个体深度故事;详见NNGroup 定性研究与研究方法工具箱(方法全景/访谈/共情图/样本量/任务设计/主持/专家评估/工作坊/伦理) |
| 焦点小组 Focus Group | 多人讨论激发观点/态度 | 要群体相互激发、看不同角色冲突;绝不用它判界面好不好用 |
| 田野研究 Field Study | 真实环境现场观察 | 环境/空间/协作是关键变量(医院、门店、工厂、客服中心) |
| 日记研究 Diary Study | 纵向、用户自记 | 要看"长期、跨天、情绪渐变"(学习曲线、留存动机) |
| 任务分析 Task Analysis | 拆解"怎么一步步做" | 流程复杂、要找认知负荷高/冗余步骤,产 HTA 层级图 |
Why 这族: 行为数据(Analytics/漏斗)只告诉你"用户在第 3 步掉了 40%",但永远不告诉你"为什么掉"。定性探索就是补这块。
焦点小组的经典反例(必记): NNGroup 反复强调——研究者演示文本浏览的"窗口模型 vs 滚动模型",用户在小组里口头都说更喜欢滚动,但真实使用时窗口模型表现更好。所以现代 GUI 用窗口逻辑。教训:口头偏好 ≠ 实际表现,焦点小组测态度不测可用性。
日记研究的硬数字: 周期按行为频率定(语音助手每日多次→1 周;外卖每周几次→2-3 周;选手机约 2 周内完成),不是越长越好(长了流失高)。三种记录触发:事件型(每次行为就记)/ 时间段型(每天固定时间)/ 信号型(研究者推送提醒)。招 5-12 / 12-30 人,要超招防流失;奖励设上限防"编日记"。结束后务必补一轮回访访谈,用用户自己的日记当素材追问。
田野的独特价值: 看到"人-设备-环境"完整图景和"用户说不出口的权宜之计"。常见产出:旅程地图 + 服务蓝图 + 现场证据卡。
族 2:定量行为——测"多大、多严重、走哪条路"
| 方法 | 看什么 | 与邻居的分工 |
|---|---|---|
| Analytics for UX | 宏观:规模/趋势/持续监控 | 最广,做"问题指示";五维定位法见下 |
| 转化漏斗 Funnel | 线性路径上每一步的转化/流失 | 答"哪一步掉人",适合预定义"理想路径" |
| 用户路径 Sankey | 非线性真实路径、绕路、回退 | 比漏斗灵活,能捕捉多分支;适合 SaaS/内容导航 |
| 眼动 Eyetracking | 注视点/扫描路径(生理级注意力) | 唯一能区分"看没看"而非"做没做" |
Why 这族: 流量大的产品没法靠访谈触达全貌,行为数据是"望远镜"。但四个方法都有同一句话:只看行为看不到动机,必须配定性。
Analytics 的五维定位法(实用): 指标异常时,按这五类快速分诊原因——① 流量 Traffic(某渠道骤降)② 技术 Technical(事件没触发/前端报错)③ 内容 Content(文案不清)④ 导航 Navigation(关键链接没人点)⑤ 视觉 Visual(按钮太弱)。配 measurement plan(目标→微转化→指标→数据源)。
漏斗 vs 路径(别混): 漏斗是"你预先定好的楼梯",路径是"用户实际走的网"。漏斗层级控制在 4-7 步;路径的原始 Sankey 图噪音巨大,必须过滤+高亮才能读。路径分析有个反直觉技巧:从终点(如"删除账号")往前看 3-5 步,比从首页往后看更能发现问题。
眼动四种扫描模式(内容设计直接用): F-pattern(长段落无层级→大量信息被忽略)/ Spotted(跳着找关键词和列表)/ Layer-cake(沿粗体副标题跳读)/ Commitment(高兴趣或要考试→逐字读)。设计建议:加副标题层级、用列表、关键词加粗、段落 1-3 行、留"停靠点"。注意阿拉伯语等 RTL 语言的 F-pattern 是镜像。
族 3:实验对照——"哪个版本更好"
| 方法 | 测什么 | 选择规则 |
|---|---|---|
| A/B 测试 | 少数整体版本对比 | 改动少、目标单一、流量够 |
| 多变量 MVT | 同页多元素的所有组合 | 想知道"哪个组合最优"+"每个元素的独立/交互贡献" |
A/B vs MVT 的路径依赖陷阱(核心知识点): 假设要优化详情页的"图/视频"和"按钮文案"两个变量。
- 连续 A/B:先测图 vs 视频(视频赢)→ 再在视频上测文案。问题:如果真正最优是"图 × Buy Now",这条路径永远测不到(第二轮被锁死在"视频"前提里)。
- MVT 一次测全部 4 个组合,避免这种局部最优,还能拆出主效应("视频整体比图高 15%")和交互效应("视频 × Add to Cart 远超其他")。
- 代价:组合数随变量相乘暴涨,吃流量。早期实践从 2 变量 × 2 变体起步。
实战分工: 大改版用 A/B 定方向 → 胜出版本上用 MVT 做元素级精修。A/B 经典数字:弱化优惠券输入框 → 销售额提升 20-50%;大按钮 → +1%(但不知为什么)。两者都只说"哪个好"不说"为什么",且只看短期会牺牲长期(搜索引擎堆广告短期点击涨、长期用户跑光)。真正 100% 级增长来自信任/信息质量/核心流程的重大改进,那要先做定性发现。
族 4:专家评估——不用真用户,先省钱扫一遍
| 方法 | 视角 | 评什么 | 范围 |
|---|---|---|---|
| 启发式评估 | 分析专家 | 整体可用性(对照十大原则) | 全面 |
| 认知走查 | 模拟新手 | 可学性(逐步问 4 问) | 特定任务 |
详细操作(3-5 人独立评、严重性 5 级、十大启发式、4 个走查问题)在 NNGroup 可用性测试与十大可用性启发式(10 条启发式完整表 · 复杂应用应用 · 用户愉悦层级 · 测试方法 5 人法则/招募/远程/任务场景/分步任务/态度vs行为/4步分析/小样本误差/竞争性评估) 和 NNGroup 定性研究与研究方法工具箱(方法全景/访谈/共情图/样本量/任务设计/主持/专家评估/工作坊/伦理) 已讲透,这里只给选型要点:
- 都替代不了真用户,只能补充、为真用户测试指方向。
- 预算/早期 → 先启发式扫明显坑,把宝贵的真用户时间留给深层问题。
- 评新手能否上手某条关键流程(注册/支付/开户)→ 认知走查。
- 启发式不是法律:可有意违反(小屏汉堡菜单违反"识别优于记忆"但空间所限合理),但要标注"待用户研究验证"。
- 不确定的问题宁可标"测一下"也别拍板——专家个人好恶不算客观依据。
族 5:信息架构 IA——"内容怎么组织、用户找不找得到"
| 方法 | 干什么 | 顺序 |
|---|---|---|
| 卡片分类 Card Sorting | 发现"结构该长什么样"(用户自下而上分组) | 先 |
| 树测试 Tree Testing | 验证"这个结构好不好找"(纯文字菜单找内容) | 后 |
Why 配对用: 卡片分类揭示心智模型(用户按语义相似度分组,不按品牌/形式),但它不含页面上下文、只给一级分类;树测试在剥掉视觉/搜索的"纯菜单"里量化可找性。标准链路:卡片分类生成候选结构 → 树测试评估优劣 → 可用性测试验证真实界面整体体验。
硬数字(选型时要的):
- 卡片分类样本量:定性 ≥15 人,定量 30-50 人。卡片数 30-50 张(太多会疲劳产生"杂项"堆)。NNGroup Fidelity 研究:15 人 r=0.90 是多数项目最优性价比(5 人 r=0.75 不够、30 人 r=0.95、60 人 r=0.98 性价比极低)。三种模式:开放(自由建组,最常用)/ 封闭(放进既有组,验证用)/ 混合。产出:相似度矩阵 / 标准化网格 / 树状图 Dendrogram。
- 树测试核心指标:任务成功率 + "直接命中率"(一次选对 vs 多次试探)。NNGroup 实例:某任务 74% 最终找对,但只有 50% 直接找到(另一半要退回重选)——所以光看成功率会骗人。任务描述要简短场景化、不能直接用菜单标签原词(否则人为抬高成功率)。多版本对比用不同参与者看不同树(避免学习效应)。
- IA 通病:用户回避"其他/杂项/综合"这类模糊大类;部门内部黑话外部用户完全看不懂;适当多路径入口能降迷路成本。
族 6:评估与综合框架——"装别的方法的容器"
这几个不是单一原子方法,而是把别的方法装进去的框架/可视化骨架:
| 框架 | 它整合什么 | 关键点 |
|---|---|---|
| 可用性测试 | 行为+定性的核心评估 | 任务编写见NNGroup 定性研究与研究方法工具箱(方法全景/访谈/共情图/样本量/任务设计/主持/专家评估/工作坊/伦理);本篇当"验证 IA/漏斗假设"的下游 |
| 根因分析 RCA | 漏斗+路径+会话回放+访谈+A/B 串成因果链 | 流程:可行动化问题陈述 → 多源数据 → cohort/漏斗/路径定位 → 5 Whys/鱼骨图提假设 → 验证 → 锁根因 |
| Kano 模型 | 访谈(梳特性)+ 结构化问卷(正反双问) | 五类:基本型 Must-be / 期望型 One-dim / 兴奋型 Attractive / 无差异 / 反向。兴奋型会随时间下沉为基本型(触屏、免费 Wi-Fi) |
| 旅程地图 | 访谈/日记/客服/漏斗数据 → 一个角色一个场景的故事 | 5 要素:角色+场景期望+阶段(4-7 个)+行为/思维/情绪+机会。底部必须有"机会+负责人+指标"否则驱动不了行动 |
| 服务蓝图 | 旅程地图往下扩(加后台/系统/证据泳道) | 用"可见性分界线"区分前台/后台;把"看似 UI 问题实为组织/流程问题"暴露出来 |
| 视觉设计测试 | 5 秒测试+首次点击+偏好+开放/封闭词表+评分+眼动+A/B 的组合 | 测"感觉";词表必含正向+负向+干扰词,负面词需 ≥40% 占比才不失真 |
Kano 的可操作公式: 对每个特性问正向("有这功能你感觉如何")+反向("没有你感觉如何"),五级答案套矩阵分类。可选算两个系数:Better =(兴奋+期望)/(兴奋+期望+基本+无差异) 越高越能提升满意度;Worse = −(基本+期望)/(同分母) 越接近 −1 缺了越招骂。优先级:基本型+高 Worse 必做(底线)→ 高 Better 兴奋/期望做差异化 → 无差异/反向砍掉。每个细分群体至少 30-50 人。
RCA 的 5 Whys 示例: 从"新用户第 7 天留存下降"出发,逐层追到"引导流程过长 / 价值点延迟 / 关键功能难懂"。鱼骨图按"产品体验 / 价格策略 / 市场竞品 / 用户类型 / 技术稳定性"五维分组假设。Cyberbiz 实战:功能 adoption 低的根因不在技术而在可用性与学习成本(入口位置/命名难懂、路径多跳转)。
反应卡情绪词法(Microsoft Reaction Card): 从微软 118 词表筛 20-25 个视觉相关词,让用户选 5 个最能描述界面的。删功能类词(slow/technical)、留视觉类词(fresh/calm/professional)。在线问卷要随机排序防顺序偏差。输出词频柱状图 + 双群体 Venn 图(年轻 vs 年长差异)。
四、方法搭配链(很少单用一个)
选型的最高境界不是挑一个方法,而是设计一条"发现 → 验证 → 迭代"的链。NNGroup 反复演示的几条经典链:
| 场景 | 链路 |
|---|---|
| 信息架构改版 | 卡片分类(发现结构)→ 树测试(验证可找性)→ 可用性测试(真实界面整体体验) |
| 长期体验理解 | 访谈(当前心智)→ 日记研究(2 周纵向)→ 回访访谈(用日记追问"为什么坚持/中断") |
| 转化率诊断 | 漏斗(定位哪步掉)→ 路径分析(看绕路)→ 会话回放+热力图(看具体交互)→ 访谈/问卷(问感受)→ A/B(验证改动) |
| 指标异常排查 | RCA 框架统筹:Analytics 指示 → cohort/漏斗/路径定位 → 5 Whys 提假设 → 可用性测试/会话回放/小 A/B 验证 → 锁根因出方案 |
| 服务体验升级 | 田野/访谈(发现痛点)→ 旅程地图(用户视角故事)→ 服务蓝图(加后台流程)→ 未来蓝图对比 → 行动清单 |
| 功能优先级 | 访谈(梳候选特性)→ Kano 问卷(分五类+Better/Worse)→ 结合成本/技术/法规 → 路线图 |
| 视觉方向决策 | 5 秒测试(第一印象)→ 反应卡/封闭词表(品牌词命中)→ 偏好测试(2-3 版选一)→ A/B(上线后验证点击) |
通用心法(贯穿所有方法):
- 态度数据要用行为数据校准——用户说"不在意运费",结算时却反复比运费(访谈+可用性测试组合实证)。
- 定量找到"哪里",定性解释"为什么"——漏斗看到掉人,必配至少一种定性(会话回放/访谈/现场)。
- 频繁的小研究 > 一次庞大复杂的研究(边际回报递减)。
- 所有行为数据都依赖埋点质量——命名不一致/漏埋点 → "看起来很专业的错误结论"。
源自 NNGroup Topics / UX Research Methods(23 篇)。访谈/焦点小组/可用性测试/专家评估/工作坊/伦理/样本量深讲见 NNGroup 定性研究与研究方法工具箱(方法全景/访谈/共情图/样本量/任务设计/主持/专家评估/工作坊/伦理)(重叠约 35%,本篇侧重选型与另 13 个方法);定量方法见 NNGroup 定量研究 Quantitative Research(A/B 测试·样本量·置信区间·UX 指标·转化分析·基准测试·学习曲线);十大启发式与可用性见 NNGroup 可用性测试与十大可用性启发式(10 条启发式完整表 · 复杂应用应用 · 用户愉悦层级 · 测试方法 5 人法则/招募/远程/任务场景/分步任务/态度vs行为/4步分析/小样本误差/竞争性评估);与 Google UX 证书 / UX 研究与共情-定义 互补。图片/PDF(启发式 workbook 等)保留在 sources。