← Knowledge Notes
Product Design & UX / Knowledge note · Chinese

NNGroup UX 研究方法选型(23 法速查/四象限定位/按问题-阶段-预算选/定性探索·定量验证·专家评估·IA·行为分析五大族)

Nielsen Norman Group '研究方法'专题 23 篇,定位为一本'选型手册'而非教科书——回答'我现在这个问题该用哪个方法'。先用 NNGroup 四象限(态度说 vs 行为做 × 定性为什么 vs 定量多严重)给每个方法定位,再给 按问题类型 / 按项目阶段 / 按预算 三套决策表。23 法分五族:① 定性探索(用户访谈·焦点小组·田野研究 Field Study·日记研究 Diary·任务分析 Task Analysis)② 定量行为(Analytics·转化漏斗 Funnel·用户路径 Sankey·眼动 Eyetracking)③ 实验对照(A/B·多变量 MVT)④ 专家评估免真用户(启发式评估·认知走查)⑤ 信息架构 IA(卡片分类 Card Sorting·树测试 Tree Testing)⑥ 评估与综合(可用性测试·根因分析 RCA·Kano·服务蓝图·旅程地图·视觉设计测试·反应卡情绪词)。每族给'何时用/怎么选/反例'。重点讲与定性 wiki 不重叠的:方法两两搭配链(卡片分类→树测试→可用性、访谈→日记→回访、漏斗→路径→会话回放→RCA)、定量四法分工、A/B vs MVT 的路径依赖陷阱、Kano 五分类与 Better/Worse 系数、卡片分类样本量 15 人 r=0.90。与 nngroup-qualitative-research 重叠约 35%(访谈/焦点小组/可用性/专家评估深讲在那边),本篇只给指针并补该篇没有的 13 个方法。

Source collection:NNGroup 用户体验 · Published here:2026-09-26 · Note updated:2026-06-03

UX 研究方法方法选型项目规划

这个文件夹是一本方法选型手册——23 个 UX 研究方法,每个都按同一张九段模板(概述/适用/案例/步骤/价值/风险/对比/最佳实践/作品集)讲透。但对 PM 来说,真正稀缺的不是"每个方法怎么做",而是"我手头这个问题,到底该用哪个"。所以本篇不复述每个方法的操作细节,而是重做成三件事:① 用 NNGroup 四象限把 23 法一次定位;② 给 按问题 / 按阶段 / 按预算 三套选择表;③ 把方法拆成五大族,每族讲"何时用·怎么选·反例",并画出方法搭配链(很少单用一个方法,真正的功力是组合)。

和已有的 NNGroup 定性研究与研究方法工具箱(方法全景/访谈/共情图/样本量/任务设计/主持/专家评估/工作坊/伦理) 重叠约 35%——访谈、焦点小组、可用性测试、专家评估那几块在那边讲得更细,这里只给指针。本篇的增量是另外 13 个方法(定量四法 / 实验两法 / IA 两法 / Kano / 服务蓝图 / 旅程图 / 田野 / 视觉测试),以及"选型"这个视角本身。

一句话心法:定性回答"为什么/哪里出问题",定量回答"多大/多严重",专家法回答"先省钱扫一遍",但没有一个方法能单独给出完整真相——选型的本质是搭配。

一、先定位:NNGroup 四象限把 23 法摊开

任何方法都能用两根轴定位(NNGroup 经典框架):

轴 两端 区别
数据性质 态度型 Attitudinal(用户说) ↔ 行为型 Behavioral(用户做) 说和做常常相反——想知道真实行为别只靠问
数据形态 定性 Qualitative(发现问题、给方向) ↔ 定量 Quantitative(测指标、给数字) 定性答"为什么/哪里",定量答"多严重/多少人"

23 法在四象限里的落点:

象限 方法 它能告诉你
态度 + 定性 用户访谈 / 焦点小组 / 反应卡情绪词 / 视觉设计测试(偏好题) 动机、心智模型、第一印象、品牌感知
行为 + 定性 可用性测试 / 田野研究 / 日记研究 / 任务分析 / 卡片分类 / 树测试 / 眼动 用户实际怎么做、卡在哪、怎么组织信息
态度 + 定量 调查问卷(大样本) / Kano / 视觉测试(评分题) 满意度趋势、需求优先级分布、品牌词命中率
行为 + 定量 Analytics / 转化漏斗 / 用户路径(Sankey) / A/B / 多变量 MVT 在哪一步流失多少、哪个版本转化高
跨象限框架 根因分析 RCA / 旅程地图 / 服务蓝图 不是单一方法,是"装别的方法"的容器/可视化骨架

两组正交标签:形成性 Formative(早期、为改进找问题)vs 总结性 Summative(评整体、对比竞品/旧版);远程 Remote vs 现场 In-person。访谈/卡片分类/树测试/调查都能远程跑,田野/眼动几乎必须现场。

二、三套选型决策表(本篇核心)

按"你想回答什么问题"选

你的问题 首选方法 为什么 / 反例
用户是谁、动机/心智模型是什么 用户访谈(NNGroup 定性研究与研究方法工具箱(方法全景/访谈/共情图/样本量/任务设计/主持/专家评估/工作坊/伦理)) 探索期挖"为什么";反例:别拿它测界面好不好用
用户在真实环境里到底怎么做 田野研究 Field Study / 日记研究 Diary 看到实验室看不到的环境干扰与权宜之计;反例:成本高、不适合频繁验证
完成一个目标要走多少步、哪步认知负荷高 任务分析 Task Analysis(HTA 层级图) 把"想要什么"拆成"怎么一步步做";反例:别只看现状流程,会把低效搬进新系统
内容/导航该怎么分类(从无到有) 卡片分类 Card Sorting 揭示用户心智里的归类;反例:不含页面上下文,只给一级分类,必须配树测试验证
现有/候选导航好不好找(验证) 树测试 Tree Testing 纯文字菜单测可找性,有成功率/直接命中率;反例:剥掉了视觉/搜索,不等于真实体验
界面好不好用、卡在哪 可用性测试(NNGroup 定性研究与研究方法工具箱(方法全景/访谈/共情图/样本量/任务设计/主持/专家评估/工作坊/伦理)) 行为+定性的黄金标准;先看做不看说
新手第一次能不能学会 认知走查 Cognitive Walkthrough(NNGroup 定性研究与研究方法工具箱(方法全景/访谈/共情图/样本量/任务设计/主持/专家评估/工作坊/伦理)) 专评可学性、不用真用户
预算紧、想先扫一遍明显坑 启发式评估 Heuristic Evaluation(NNGroup 可用性测试与十大可用性启发式(10 条启发式完整表 · 复杂应用应用 · 用户愉悦层级 · 测试方法 5 人法则/招募/远程/任务场景/分步任务/态度vs行为/4步分析/小样本误差/竞争性评估)) 3-5 专家对照十大原则;反例:替代不了真用户
大样本态度/满意度/NPS 调查问卷 Survey(NNGroup 定性研究与研究方法工具箱(方法全景/访谈/共情图/样本量/任务设计/主持/专家评估/工作坊/伦理)) 快、便宜、定量;反例:只反映态度不反映行为,偏差多
一堆功能,哪些必做/哪些锦上添花 Kano 模型 正反双问把特性分五类;反例:给的是满意度结构不是 to-do 清单
用户在哪一步流失、流失多少 转化漏斗 Funnel 楼梯图直观定位瓶颈;反例:只告诉"哪里掉"不告诉"为什么"
用户真实走的路径(非理想路径) 用户路径分析 Sankey 捕捉绕路/回退/多分支;反例:同一路径可能完全不同体验,要定性补
指标突然异常,系统性查根因 根因分析 RCA 5 Whys/鱼骨图把症状追到根因;反例:别先有结论再找证据(确认偏误)
两个方案选哪个 / 微调有没有用 A/B 测试 真实流量、结论可靠;反例:只说"哪个好"不说"为什么",难发现意外问题
同一页多个元素的最优组合 多变量测试 MVT 一次测所有组合、看交互效应;反例:吃流量,组合多了跑不动
视觉风格/品牌感对不对 视觉设计测试 / 反应卡情绪词 5 秒测试+受控词表把"感觉"量化;反例:对行为影响判断弱
用户读不读得进长文、忽略了什么 眼动追踪 Eyetracking 生理级注意力证据;反例:"看了"≠"懂了",设备贵样本要求高
跨触点/跨部门体验割裂在哪 旅程地图 → 服务蓝图 先用户视角再组织视角;把 UI 问题追到组织/流程根因
大流量产品持续监控、问题有多大 Analytics for UX 规模真实持续;反例:看行为不看动机,必须配定性

按"项目处在哪个阶段"选

阶段 主力方法 心法
探索 / 问题定义 访谈 · 焦点小组 · 田野 · 日记 · 卡片分类 · 任务分析 这阶段求发散和理解,几乎全是定性;别急着上 A/B
概念 / 信息架构 卡片分类 → 树测试 · Kano(功能优先级) · 旅程地图(理想未来) 在没有视觉稿时就把"骨架"打磨好,降低返工
设计验证(上线前) 可用性测试 · 认知走查 · 启发式评估 · 树测试复测 · 视觉测试 上线前排雷:先专家法扫明显坑,再真用户验深坑
上线后 / 增长优化 Analytics · 漏斗 · 路径 · A/B · MVT · RCA · 日记(长期) 这阶段求量化和验证,以行为定量为主
复盘 / 持续监控 RCA · Analytics 看板 · 定期轻量 Kano/日记 把核心漏斗钉在看板,例行复盘,不要只在异常时才查

按预算 / 能力门槛选(从便宜到贵)

门槛 方法 备注
几乎零成本、内部就能做 启发式评估 · 认知走查 · 任务分析 专家法不用招募真用户
低成本、需招少量用户 访谈(5-6 人起) · 可用性测试(5 人) · 卡片分类(定性 15 人) · 树测试 定性看饱和点,详见NNGroup 定性研究与研究方法工具箱(方法全景/访谈/共情图/样本量/任务设计/主持/专家评估/工作坊/伦理)
中成本、需工具/平台 调查问卷 · 焦点小组 · 视觉测试 · 远程树测试/卡片分类 在线工具(OptimalSort/Treejack/UserZoom)
高成本、要流量或设备 A/B · MVT · 眼动 · 田野 · 长周期日记 A/B 要够流量+时间;眼动要专用设备;田野要差旅+长周期
高人力、跨部门协作 服务蓝图 · 旅程地图(共创) · RCA 不贵在钱贵在"组织时间",要管理层支持

三、五大族详解(何时用 / 怎么选 / 反例)

族 1:定性探索——挖"为什么"和"真实场景"

方法 核心定位 何时选它而不是邻居
用户访谈 一对一深挖动机/心智 要个体深度故事;详见NNGroup 定性研究与研究方法工具箱(方法全景/访谈/共情图/样本量/任务设计/主持/专家评估/工作坊/伦理)
焦点小组 Focus Group 多人讨论激发观点/态度 要群体相互激发、看不同角色冲突;绝不用它判界面好不好用
田野研究 Field Study 真实环境现场观察 环境/空间/协作是关键变量(医院、门店、工厂、客服中心)
日记研究 Diary Study 纵向、用户自记 要看"长期、跨天、情绪渐变"(学习曲线、留存动机)
任务分析 Task Analysis 拆解"怎么一步步做" 流程复杂、要找认知负荷高/冗余步骤,产 HTA 层级图

Why 这族: 行为数据(Analytics/漏斗)只告诉你"用户在第 3 步掉了 40%",但永远不告诉你"为什么掉"。定性探索就是补这块。

焦点小组的经典反例(必记): NNGroup 反复强调——研究者演示文本浏览的"窗口模型 vs 滚动模型",用户在小组里口头都说更喜欢滚动,但真实使用时窗口模型表现更好。所以现代 GUI 用窗口逻辑。教训:口头偏好 ≠ 实际表现,焦点小组测态度不测可用性。

日记研究的硬数字: 周期按行为频率定(语音助手每日多次→1 周;外卖每周几次→2-3 周;选手机约 2 周内完成),不是越长越好(长了流失高)。三种记录触发:事件型(每次行为就记)/ 时间段型(每天固定时间)/ 信号型(研究者推送提醒)。招 5-12 / 12-30 人,要超招防流失;奖励设上限防"编日记"。结束后务必补一轮回访访谈,用用户自己的日记当素材追问。

田野的独特价值: 看到"人-设备-环境"完整图景和"用户说不出口的权宜之计"。常见产出:旅程地图 + 服务蓝图 + 现场证据卡。

族 2:定量行为——测"多大、多严重、走哪条路"

方法 看什么 与邻居的分工
Analytics for UX 宏观:规模/趋势/持续监控 最广,做"问题指示";五维定位法见下
转化漏斗 Funnel 线性路径上每一步的转化/流失 答"哪一步掉人",适合预定义"理想路径"
用户路径 Sankey 非线性真实路径、绕路、回退 比漏斗灵活,能捕捉多分支;适合 SaaS/内容导航
眼动 Eyetracking 注视点/扫描路径(生理级注意力) 唯一能区分"看没看"而非"做没做"

Why 这族: 流量大的产品没法靠访谈触达全貌,行为数据是"望远镜"。但四个方法都有同一句话:只看行为看不到动机,必须配定性。

Analytics 的五维定位法(实用): 指标异常时,按这五类快速分诊原因——① 流量 Traffic(某渠道骤降)② 技术 Technical(事件没触发/前端报错)③ 内容 Content(文案不清)④ 导航 Navigation(关键链接没人点)⑤ 视觉 Visual(按钮太弱)。配 measurement plan(目标→微转化→指标→数据源)。

漏斗 vs 路径(别混): 漏斗是"你预先定好的楼梯",路径是"用户实际走的网"。漏斗层级控制在 4-7 步;路径的原始 Sankey 图噪音巨大,必须过滤+高亮才能读。路径分析有个反直觉技巧:从终点(如"删除账号")往前看 3-5 步,比从首页往后看更能发现问题。

眼动四种扫描模式(内容设计直接用): F-pattern(长段落无层级→大量信息被忽略)/ Spotted(跳着找关键词和列表)/ Layer-cake(沿粗体副标题跳读)/ Commitment(高兴趣或要考试→逐字读)。设计建议:加副标题层级、用列表、关键词加粗、段落 1-3 行、留"停靠点"。注意阿拉伯语等 RTL 语言的 F-pattern 是镜像。

族 3:实验对照——"哪个版本更好"

方法 测什么 选择规则
A/B 测试 少数整体版本对比 改动少、目标单一、流量够
多变量 MVT 同页多元素的所有组合 想知道"哪个组合最优"+"每个元素的独立/交互贡献"

A/B vs MVT 的路径依赖陷阱(核心知识点): 假设要优化详情页的"图/视频"和"按钮文案"两个变量。

  • 连续 A/B:先测图 vs 视频(视频赢)→ 再在视频上测文案。问题:如果真正最优是"图 × Buy Now",这条路径永远测不到(第二轮被锁死在"视频"前提里)。
  • MVT 一次测全部 4 个组合,避免这种局部最优,还能拆出主效应("视频整体比图高 15%")和交互效应("视频 × Add to Cart 远超其他")。
  • 代价:组合数随变量相乘暴涨,吃流量。早期实践从 2 变量 × 2 变体起步。

实战分工: 大改版用 A/B 定方向 → 胜出版本上用 MVT 做元素级精修。A/B 经典数字:弱化优惠券输入框 → 销售额提升 20-50%;大按钮 → +1%(但不知为什么)。两者都只说"哪个好"不说"为什么",且只看短期会牺牲长期(搜索引擎堆广告短期点击涨、长期用户跑光)。真正 100% 级增长来自信任/信息质量/核心流程的重大改进,那要先做定性发现。

族 4:专家评估——不用真用户,先省钱扫一遍

方法 视角 评什么 范围
启发式评估 分析专家 整体可用性(对照十大原则) 全面
认知走查 模拟新手 可学性(逐步问 4 问) 特定任务

详细操作(3-5 人独立评、严重性 5 级、十大启发式、4 个走查问题)在 NNGroup 可用性测试与十大可用性启发式(10 条启发式完整表 · 复杂应用应用 · 用户愉悦层级 · 测试方法 5 人法则/招募/远程/任务场景/分步任务/态度vs行为/4步分析/小样本误差/竞争性评估) 和 NNGroup 定性研究与研究方法工具箱(方法全景/访谈/共情图/样本量/任务设计/主持/专家评估/工作坊/伦理) 已讲透,这里只给选型要点:

  • 都替代不了真用户,只能补充、为真用户测试指方向。
  • 预算/早期 → 先启发式扫明显坑,把宝贵的真用户时间留给深层问题。
  • 评新手能否上手某条关键流程(注册/支付/开户)→ 认知走查。
  • 启发式不是法律:可有意违反(小屏汉堡菜单违反"识别优于记忆"但空间所限合理),但要标注"待用户研究验证"。
  • 不确定的问题宁可标"测一下"也别拍板——专家个人好恶不算客观依据。

族 5:信息架构 IA——"内容怎么组织、用户找不找得到"

方法 干什么 顺序
卡片分类 Card Sorting 发现"结构该长什么样"(用户自下而上分组) 先
树测试 Tree Testing 验证"这个结构好不好找"(纯文字菜单找内容) 后

Why 配对用: 卡片分类揭示心智模型(用户按语义相似度分组,不按品牌/形式),但它不含页面上下文、只给一级分类;树测试在剥掉视觉/搜索的"纯菜单"里量化可找性。标准链路:卡片分类生成候选结构 → 树测试评估优劣 → 可用性测试验证真实界面整体体验。

硬数字(选型时要的):

  • 卡片分类样本量:定性 ≥15 人,定量 30-50 人。卡片数 30-50 张(太多会疲劳产生"杂项"堆)。NNGroup Fidelity 研究:15 人 r=0.90 是多数项目最优性价比(5 人 r=0.75 不够、30 人 r=0.95、60 人 r=0.98 性价比极低)。三种模式:开放(自由建组,最常用)/ 封闭(放进既有组,验证用)/ 混合。产出:相似度矩阵 / 标准化网格 / 树状图 Dendrogram。
  • 树测试核心指标:任务成功率 + "直接命中率"(一次选对 vs 多次试探)。NNGroup 实例:某任务 74% 最终找对,但只有 50% 直接找到(另一半要退回重选)——所以光看成功率会骗人。任务描述要简短场景化、不能直接用菜单标签原词(否则人为抬高成功率)。多版本对比用不同参与者看不同树(避免学习效应)。
  • IA 通病:用户回避"其他/杂项/综合"这类模糊大类;部门内部黑话外部用户完全看不懂;适当多路径入口能降迷路成本。

族 6:评估与综合框架——"装别的方法的容器"

这几个不是单一原子方法,而是把别的方法装进去的框架/可视化骨架:

框架 它整合什么 关键点
可用性测试 行为+定性的核心评估 任务编写见NNGroup 定性研究与研究方法工具箱(方法全景/访谈/共情图/样本量/任务设计/主持/专家评估/工作坊/伦理);本篇当"验证 IA/漏斗假设"的下游
根因分析 RCA 漏斗+路径+会话回放+访谈+A/B 串成因果链 流程:可行动化问题陈述 → 多源数据 → cohort/漏斗/路径定位 → 5 Whys/鱼骨图提假设 → 验证 → 锁根因
Kano 模型 访谈(梳特性)+ 结构化问卷(正反双问) 五类:基本型 Must-be / 期望型 One-dim / 兴奋型 Attractive / 无差异 / 反向。兴奋型会随时间下沉为基本型(触屏、免费 Wi-Fi)
旅程地图 访谈/日记/客服/漏斗数据 → 一个角色一个场景的故事 5 要素:角色+场景期望+阶段(4-7 个)+行为/思维/情绪+机会。底部必须有"机会+负责人+指标"否则驱动不了行动
服务蓝图 旅程地图往下扩(加后台/系统/证据泳道) 用"可见性分界线"区分前台/后台;把"看似 UI 问题实为组织/流程问题"暴露出来
视觉设计测试 5 秒测试+首次点击+偏好+开放/封闭词表+评分+眼动+A/B 的组合 测"感觉";词表必含正向+负向+干扰词,负面词需 ≥40% 占比才不失真

Kano 的可操作公式: 对每个特性问正向("有这功能你感觉如何")+反向("没有你感觉如何"),五级答案套矩阵分类。可选算两个系数:Better =(兴奋+期望)/(兴奋+期望+基本+无差异) 越高越能提升满意度;Worse = −(基本+期望)/(同分母) 越接近 −1 缺了越招骂。优先级:基本型+高 Worse 必做(底线)→ 高 Better 兴奋/期望做差异化 → 无差异/反向砍掉。每个细分群体至少 30-50 人。

RCA 的 5 Whys 示例: 从"新用户第 7 天留存下降"出发,逐层追到"引导流程过长 / 价值点延迟 / 关键功能难懂"。鱼骨图按"产品体验 / 价格策略 / 市场竞品 / 用户类型 / 技术稳定性"五维分组假设。Cyberbiz 实战:功能 adoption 低的根因不在技术而在可用性与学习成本(入口位置/命名难懂、路径多跳转)。

反应卡情绪词法(Microsoft Reaction Card): 从微软 118 词表筛 20-25 个视觉相关词,让用户选 5 个最能描述界面的。删功能类词(slow/technical)、留视觉类词(fresh/calm/professional)。在线问卷要随机排序防顺序偏差。输出词频柱状图 + 双群体 Venn 图(年轻 vs 年长差异)。

四、方法搭配链(很少单用一个)

选型的最高境界不是挑一个方法,而是设计一条"发现 → 验证 → 迭代"的链。NNGroup 反复演示的几条经典链:

场景 链路
信息架构改版 卡片分类(发现结构)→ 树测试(验证可找性)→ 可用性测试(真实界面整体体验)
长期体验理解 访谈(当前心智)→ 日记研究(2 周纵向)→ 回访访谈(用日记追问"为什么坚持/中断")
转化率诊断 漏斗(定位哪步掉)→ 路径分析(看绕路)→ 会话回放+热力图(看具体交互)→ 访谈/问卷(问感受)→ A/B(验证改动)
指标异常排查 RCA 框架统筹:Analytics 指示 → cohort/漏斗/路径定位 → 5 Whys 提假设 → 可用性测试/会话回放/小 A/B 验证 → 锁根因出方案
服务体验升级 田野/访谈(发现痛点)→ 旅程地图(用户视角故事)→ 服务蓝图(加后台流程)→ 未来蓝图对比 → 行动清单
功能优先级 访谈(梳候选特性)→ Kano 问卷(分五类+Better/Worse)→ 结合成本/技术/法规 → 路线图
视觉方向决策 5 秒测试(第一印象)→ 反应卡/封闭词表(品牌词命中)→ 偏好测试(2-3 版选一)→ A/B(上线后验证点击)

通用心法(贯穿所有方法):

  • 态度数据要用行为数据校准——用户说"不在意运费",结算时却反复比运费(访谈+可用性测试组合实证)。
  • 定量找到"哪里",定性解释"为什么"——漏斗看到掉人,必配至少一种定性(会话回放/访谈/现场)。
  • 频繁的小研究 > 一次庞大复杂的研究(边际回报递减)。
  • 所有行为数据都依赖埋点质量——命名不一致/漏埋点 → "看起来很专业的错误结论"。

源自 NNGroup Topics / UX Research Methods(23 篇)。访谈/焦点小组/可用性测试/专家评估/工作坊/伦理/样本量深讲见 NNGroup 定性研究与研究方法工具箱(方法全景/访谈/共情图/样本量/任务设计/主持/专家评估/工作坊/伦理)(重叠约 35%,本篇侧重选型与另 13 个方法);定量方法见 NNGroup 定量研究 Quantitative Research(A/B 测试·样本量·置信区间·UX 指标·转化分析·基准测试·学习曲线);十大启发式与可用性见 NNGroup 可用性测试与十大可用性启发式(10 条启发式完整表 · 复杂应用应用 · 用户愉悦层级 · 测试方法 5 人法则/招募/远程/任务场景/分步任务/态度vs行为/4步分析/小样本误差/竞争性评估);与 Google UX 证书 / UX 研究与共情-定义 互补。图片/PDF(启发式 workbook 等)保留在 sources。

来源与关联资料