← 知识整理
产品设计与用户体验 / 知识整理 · 中文

NNGroup 定性研究与研究方法工具箱(方法全景/访谈/共情图/样本量/任务设计/主持/专家评估/工作坊/伦理)

Nielsen Norman Group '定性研究'专题 26 篇精华 —— 实为整套 UX 研究方法工具箱。方法全景四象限(态度说 vs 行为做 × 定性问题 vs 定量数据,加形成性/总结性/远程)+ 何时用哪个 / 访谈(User Interviews 101 + 漏斗技术:先宽开放后窄封闭,别过早引导)/ 把研究变成产物(共情图 Says-Thinks-Does-Feels + 用户需求陈述:[用户]需要[动词需求]以[目标])/ 样本量(定性看饱和点 5-6 起步动态加;卡片分类 15 人 r=0.90)/ 可用性任务编写(定性开放探索 vs 定量唯一解·随机化·虚拟数据)/ 主持 10 步检查清单(说'研究'别说'测试'+边做边想)/ 不用真用户的专家评估(启发式评估 3-5 人独立·认知走查评可学性·严重性 5 级·错误消息评分 rubric)/ UX 工作坊(会议 vs 工作坊·5 类·7 基础活动·纳入用户)/ 研究伦理(知情同意·筛选标准 Inclusion-Exclusion-Diversity+招募矩阵·研究民主化 5 步)。

资料来源:NNGroup 用户体验 · 本站发布:2026-09-26 · 笔记更新:2026-06-03

定性研究用户访谈可用性研究

这个文件夹挂名"定性研究",其实是 NNGroup 的整套 UX 研究方法工具箱 —— 访谈、问卷、共情图、样本量、任务设计、主持、专家评估、工作坊、伦理都在里面。定性研究的内核一句话:不追求"有多少人这样"的统计普适性,而是搞懂"为什么会这样"的现象与原因。下面按 方法全景 → 访谈 → 把研究变产物 → 样本量 → 任务设计 → 主持 → 专家评估(不用真用户) → 工作坊 → 伦理 九块。

一、方法全景:四象限 + 何时用哪个

NNGroup 的经典分类法 —— 任何研究方法都能用两根轴定位:

轴 两端 区别
数据性质 态度型 Attitudinal(用户说什么) ↔ 行为型 Behavioral(用户做什么) 说的和做的常常不一致 —— 想知道真实行为别只靠问
数据形态 定性 Qualitative(发现问题、给方向) ↔ 定量 Quantitative(测指标、给数字) 定性回答"为什么/哪里出问题",定量回答"多严重/多少人"
方法 象限 典型用途
用户访谈 / 焦点小组 态度 + 定性 探索阶段挖需求、动机、心理模型
可用性测试(定性) 行为 + 定性 发现界面问题及原因
可用性测试(定量)/ A/B 测试 / UX 基准 行为 + 定量 测成功率、完成时间、转化率
调查问卷 态度 +(定性或定量) 大样本收态度/满意度
卡片分类 / 树测试 行为 + 定性/定量 信息架构(IA)
日记研究 / 实地 / 情境调查 上下文 Context 自然环境中的长期行为
眼动 / 点击流分析 行为 + 定量 注意力与路径

还有两组正交标签:形成性 Formative(设计早期、为改进找问题)vs 总结性 Summative(评整体表现、对比竞品/旧版);远程 Remote(在线、异地)vs 现场。

二、访谈:漏斗式提问,先宽后窄

用户访谈(User Interviews) 是探索阶段最常用的态度型方法 —— 提问、倾听、追问,挖出体验/痛点/心理模型。产出可喂给共情图、需求陈述、画像、旅程图。

阶段 做法
定目标 当研究不是闲聊;先写下"想回答什么"(为什么会来试?高光低谷?什么让人放弃?)
写提纲 开放式主问题 + 追问;试运行1-2 人校准
暖场 从轻松问题开始("聊聊你的爱好"),避免让人觉得被评判的问题
建立融洽 点头、复述,用言语+非言语线索建信任,但不必刻意交朋友

核心技巧:漏斗技术(The Funnel Technique) —— 每个主问题都从宽到窄走一遍,像引导迷宫里的老鼠:先看它能不能自己找到奶酪,再逐步关掉通道。

  1. 宽开放:"告诉我你上次订电影票的经历"(拿自然行为、不引导)
  2. 开放追问:"能详细说说吗?""你为什么这么想?"
  3. 才上封闭:"你一个人去的吗?"(拿具体事实)

反例/局限:自我报告会失真(记忆错、社会期望偏差想显得更好);数据质量高度依赖研究者别问引导性问题。想要真实行为 → 配可用性测试,别只靠访谈。

三、把研究变成产物:共情图 + 需求陈述

定性数据散在访谈记录里没用,要压缩成团队能对齐的工件:

共情图 Empathy Map —— 四象限可视化一个用户(或群体):

象限 抓什么
说 Says 原话引言("我想要可靠的东西")
想 Thinks 没说出口的内心("我是不是太蠢了?")
做 Does 实际操作(反复刷新、跨店比价)
感 Feels 情绪 = 形容词 + 情境(不耐烦:加载太慢)

单用户图基于一次访谈;多用户汇总图整合同类主题、可作建画像的第一步(但不替代画像)。价值:捕捉特征、暴露知识空白(该补研究的地方)、教育团队避免拍脑袋假设。

用户需求陈述 User Need Statement(设计思维"定义"阶段的核心)—— 把一堆洞察压成一句话,聚焦动词需求而非名词方案:

格式:[一个用户(带标签)] 需要 [一个需求(动词、真实、不含方案)] 以实现 [一个目标(价值)]

例:[Alieda,精通科技、要带两个孩子的妈妈] 需要 [快速自信地比较选项,且不离开舒适区] 以 [把时间花在真正重要的事上]

心法:用户不需要"下拉菜单"(名词),需要"看到选项并选一个"(动词)。过早锁定方案 → 次优设计。可分父级(长期愿景)/子级(具体功能)。区别于开发任务:需求陈述给方向,开发任务("用户需要一个价格对比表")给实现。

四、样本量:定性看"饱和点",不靠统计公式

定性研究不能用功效计算(power analysis)算样本量 —— 因为目标不是统计普适,是理解现象。靠的是饱和点 saturation:新会话不再带来新信息时就够了(开始听到重复)。

影响因素 需要更多人 ↔ 可以更少
人群多样性 背景越杂越多 ↔ 聚焦单一细分越少
研究范围 目标越宽(如"用户对税的心理模型")越多 ↔ 越具体(如"填税表的痛点")越少
研究者水平 新手追问浅要更多人 ↔ 老手单次拿得多,模式更早浮现

操作:从 5-6 人起步(可用性测试尤其够初步分析),每轮后问"还在学到新东西吗?",需要就再加 1-2 人重评。频繁的小研究 > 一次庞大复杂的研究(边际回报递减)。

特例:卡片分类(Card Sorting) 有定量依据 —— Fidelity 研究(168 人)测出:5 人 r=0.75(不够),15 人 r=0.90(多数项目最优性价比),30 人 r=0.95(预算充足大项目),60 人 r=0.98(性价比极低)。

五、可用性测试的任务编写:定性求开放,定量求唯一解

所有可用性研究都要给参与者任务,但定性/定量写法相反:

属性 定性任务 定量任务
特性 开放、探索性 具体、聚焦
细节 适量,建立动机即可 详细,确保唯一解法(否则数据不一致)
顺序随机化 可选 必需
可中途改任务 ✅ ❌(所有人必须做同样的)
例子 "用网站找个你感兴趣的食谱" "预订芝加哥 Hyatt Regency 1/17-19 的双人房"

两者共通原则:从真实用户目标取材(访谈/搜索日志/客服/分析数据);别用界面术语当线索(❌"注册 Alertbox" → ✅"订阅这个网站的新闻邮件");情感中立(❌"给你妈买生日礼物" → ✅"给朋友买");用虚拟数据;先试运行;任务相互独立可随机化;一个任务一个成功标准(别叠加"找地址和开放时间")。

任务排序也用漏斗:先探索性任务(看自然行为)→ 再有目标任务 → 最后定向任务(测特定 UI 元素)。

六、主持可用性测试:10 步检查清单

# 步骤 关键
1 欢迎 别说"测试",说"研究/研究活动",缓解紧张
2 确认名字发音 建立亲切感
3 告知观察员+录制 即便招募时说过也要再提醒、征得同意
4 签同意书 给足阅读时间
5 简短背景访谈(如需) 别问会影响结果的问题
6 设定预期 + 边做边想 强调"测的是设计不是你";请用户出声思考
7 一次给一个任务 书面说明、请用户读出来确认理解
8 任务后追问 "哪里特别容易/困难?"
9 留 5 分钟给观察员提问
10 致谢、发奖励、结束录制

七、不用真用户的专家评估法

预算有限/早期阶段,可用专家法先扫一遍 —— 但都不能替代用户测试,只能补充、为测试指方向。

启发式评估 Heuristic Evaluation:对照一套原则(首选 Jakob Nielsen 十大可用性启发)找问题。

  • 3-5 名评估者独立评(单人会漏,人多边际递减),独立期间不能看彼此记录避免互相影响
  • 先以用户身份走一遍任务熟悉界面,再回头找违反原则处 + 给建议
  • 缩小范围提细节(单任务/部分界面/特定人群/某设备);单次控制 1-2 小时
  • 汇总用亲和图聚类、按严重度排序
  • 铁律:启发式不是法律 —— 可有意违反(如小屏汉堡菜单违反"识别优于记忆",但空间所限是合理妥协),但要用用户研究验证

认知走查 Cognitive Walkthrough:专评可学性(新用户视角),逐步问 4 个问题:① 用户会尝试做对的操作吗?② 能注意到正确操作吗?③ 能把操作和目标联系起来吗?④ 操作后能察觉进展吗?四问全"是"才算该步成功。

  • 适合:复杂/新颖/非标系统(医院自助、金融软件);不适合:常见模式(普通电商结账,走查太冗长)
  • 工作坊形式:2-6 名多角色评审者(产品专家/UX/工程师/领域专家)+ 主持+展示+记录;输入=用户画像+核心任务+正确步骤序列+界面版本;90 分钟约评 2 个完整任务
启发式评估 认知走查
视角:分析人员 视角:新用户
目标:整体可用性 目标:可学性
范围:全面 范围:特定任务

配套量化工具:

  • 严重性分级 Severity:把一长串问题按"频率×影响×持续性×对口碑的影响"分 5 级(高/中/低/Bug/正向反馈 Good)。高=阻断关键任务(无法支付/注册),必修;同时标出"Good"保团队信心。长期用同一套 → 团队信任、沟通快
  • 专家评审保持客观 Keep Opinions Out:评审里个人好恶不算数(除非你正好是目标用户)。每个问题都要有客观依据(违反哪条原则/什么效率损失);找不到客观理由 → 可能没问题 → 不确定时宁可不提,改建议"测一下"
  • 错误消息评分 Rubric:12 条原则 × 3 维度(可见性 Visibility / 沟通性 Communication / 效率 Efficiency),每条 1-4 分,平均分 → A(3.3-4.0)到 D(≤1.5)。实证:Craigslist 2.08(差)、Google Flights 3.17(中)、J.Crew 3.67(好)

八、UX 工作坊:解决问题,不是开会

会议 vs 工作坊:会议=信息交流(浅而广);工作坊=协作解决具体问题(深而专,半天起、准备成本高)。没明确待解问题就别开工作坊(浪费时间还砸招牌)。工作坊走"发散(便签/头脑风暴)→ 收敛(亲和图/强制排序)"。

5 种工作坊(cheatsheet):发现 Discovery(立项对齐目标)/ 共情 Empathy(把心态从功能优先转向用户优先)/ 设计 Design(快速生成多样创意,非定稿)/ 优先级 Prioritization(影响-努力矩阵砍范围)/ 评审 Critique(对照准则迭代方案)。可组合(发现里加优先级)、可压缩(敏捷团队压成一早上)。

7 个基础活动(所有工作坊都是这些的组合):便签生成 Post Up / 亲和图 Affinity / 景观映射 Landscape Mapping / 故事板 Storyboarding / 强制排序 Forced Ranking / 角色扮演 Role Playing / 成果分享 Playback。

纳入真实用户的价值与陷阱:用户现场分享能大幅提升成果,但 —— ① 别盲从用户(建议是视角不是指令,让用户离场后团队再做最终评估);② 别让用户失望(提前说清是头脑风暴非定稿);③ 防偏见(别只请铁粉/员工亲属,要多样)。请不到真用户 → 用代理人(研究员/客服/销售)。

九、研究伦理与运营

知情同意 Informed Consent(历史教训:纽伦堡审判、塔斯基吉梅毒研究 → 催生伦理规范)。同意书 = 研究者告知(目的/形式/时长)+ 参与者理解后自愿。内容含:目的(别泄露会影响行为的假设)、形式与时长、自愿可随时退出、数据如何匿名/存储/谁可访问/能否要求删除、补偿(任务前发,避免感觉在测能力)、未成年人监护人签名。例外:A/B 测试(常规使用产品)、拦截研究(用简单协议页)可简化。

筛选标准 Selection Criteria(招错人 = 整个研究作废:测健身产品却招不健身的人)。别只看人口统计(年龄性别收入预测不了真实行为 —— "1947 年生、富有、多次结婚"既可能是查尔斯王子也可能是奥兹奥斯本)。三类标准缺一不可:

  • 包含 Inclusion = 你想要谁(具体、与目标直接相关;区分"合适"和"最合适")
  • 排除 Exclusion = 必须剔除谁(UX/开发/行业内人士 —— 他们用专家视角而非普通用户视角)
  • 多样性 Diversity = 保证样本接近真实分布(研究航空 App 不能只找头等舱)
  • 用招募矩阵平衡各段位 × 年龄/地域,一人可满足多条,某类够了就补别的缺口

研究民主化 Democratize(5 步):让非研究岗(PM/设计师/PwDR)也做研究 —— 益处(推动更多研究、提升满意度、加深团队对研究的理解);风险(低质研究 → 误导设计、责任不清、资源错配、阻碍 UX 成熟度)。5 步:① 识别需求 → ② 分类资源 → ③ 满足需求(培训+导师+按难度分派:初级做简单、高级做复杂)→ ④ 对齐职责 → ⑤ 反思改进。目标四性:可行 Viable / 影响力 Influential / 可靠 Sound / 高效 Efficient。


源自 NNGroup Topics / Qualitative Research - 定性研究(26 篇,含两版启发式评估已合并)。定量方法见 NNGroup 定量研究 Quantitative Research(A/B 测试·样本量·置信区间·UX 指标·转化分析·基准测试·学习曲线);可用性测试与十大启发式见 NNGroup 可用性测试与十大可用性启发式(10 条启发式完整表 · 复杂应用应用 · 用户愉悦层级 · 测试方法 5 人法则/招募/远程/任务场景/分步任务/态度vs行为/4步分析/小样本误差/竞争性评估);方法速查见 NNGroup UX 研究方法选型(23 法速查/四象限定位/按问题-阶段-预算选/定性探索·定量验证·专家评估·IA·行为分析五大族);访谈产出的画像见 NNGroup 用户画像 Personas(本质/三类型/范围层级/创建/对比 JTBD-原型-分群/应用/维护/5 大失败);与 Google UX 证书 / UX 研究与共情-定义 互补。图片/PDF/xlsx 模板保留在 sources。

来源与关联资料