这个文件夹挂名"定性研究",其实是 NNGroup 的整套 UX 研究方法工具箱 —— 访谈、问卷、共情图、样本量、任务设计、主持、专家评估、工作坊、伦理都在里面。定性研究的内核一句话:不追求"有多少人这样"的统计普适性,而是搞懂"为什么会这样"的现象与原因。下面按 方法全景 → 访谈 → 把研究变产物 → 样本量 → 任务设计 → 主持 → 专家评估(不用真用户) → 工作坊 → 伦理 九块。
一、方法全景:四象限 + 何时用哪个
NNGroup 的经典分类法 —— 任何研究方法都能用两根轴定位:
| 轴 | 两端 | 区别 |
|---|---|---|
| 数据性质 | 态度型 Attitudinal(用户说什么) ↔ 行为型 Behavioral(用户做什么) | 说的和做的常常不一致 —— 想知道真实行为别只靠问 |
| 数据形态 | 定性 Qualitative(发现问题、给方向) ↔ 定量 Quantitative(测指标、给数字) | 定性回答"为什么/哪里出问题",定量回答"多严重/多少人" |
| 方法 | 象限 | 典型用途 |
|---|---|---|
| 用户访谈 / 焦点小组 | 态度 + 定性 | 探索阶段挖需求、动机、心理模型 |
| 可用性测试(定性) | 行为 + 定性 | 发现界面问题及原因 |
| 可用性测试(定量)/ A/B 测试 / UX 基准 | 行为 + 定量 | 测成功率、完成时间、转化率 |
| 调查问卷 | 态度 +(定性或定量) | 大样本收态度/满意度 |
| 卡片分类 / 树测试 | 行为 + 定性/定量 | 信息架构(IA) |
| 日记研究 / 实地 / 情境调查 | 上下文 Context | 自然环境中的长期行为 |
| 眼动 / 点击流分析 | 行为 + 定量 | 注意力与路径 |
还有两组正交标签:形成性 Formative(设计早期、为改进找问题)vs 总结性 Summative(评整体表现、对比竞品/旧版);远程 Remote(在线、异地)vs 现场。
二、访谈:漏斗式提问,先宽后窄
用户访谈(User Interviews) 是探索阶段最常用的态度型方法 —— 提问、倾听、追问,挖出体验/痛点/心理模型。产出可喂给共情图、需求陈述、画像、旅程图。
| 阶段 | 做法 |
|---|---|
| 定目标 | 当研究不是闲聊;先写下"想回答什么"(为什么会来试?高光低谷?什么让人放弃?) |
| 写提纲 | 开放式主问题 + 追问;试运行1-2 人校准 |
| 暖场 | 从轻松问题开始("聊聊你的爱好"),避免让人觉得被评判的问题 |
| 建立融洽 | 点头、复述,用言语+非言语线索建信任,但不必刻意交朋友 |
核心技巧:漏斗技术(The Funnel Technique) —— 每个主问题都从宽到窄走一遍,像引导迷宫里的老鼠:先看它能不能自己找到奶酪,再逐步关掉通道。
- 宽开放:"告诉我你上次订电影票的经历"(拿自然行为、不引导)
- 开放追问:"能详细说说吗?""你为什么这么想?"
- 才上封闭:"你一个人去的吗?"(拿具体事实)
反例/局限:自我报告会失真(记忆错、社会期望偏差想显得更好);数据质量高度依赖研究者别问引导性问题。想要真实行为 → 配可用性测试,别只靠访谈。
三、把研究变成产物:共情图 + 需求陈述
定性数据散在访谈记录里没用,要压缩成团队能对齐的工件:
共情图 Empathy Map —— 四象限可视化一个用户(或群体):
| 象限 | 抓什么 |
|---|---|
| 说 Says | 原话引言("我想要可靠的东西") |
| 想 Thinks | 没说出口的内心("我是不是太蠢了?") |
| 做 Does | 实际操作(反复刷新、跨店比价) |
| 感 Feels | 情绪 = 形容词 + 情境(不耐烦:加载太慢) |
单用户图基于一次访谈;多用户汇总图整合同类主题、可作建画像的第一步(但不替代画像)。价值:捕捉特征、暴露知识空白(该补研究的地方)、教育团队避免拍脑袋假设。
用户需求陈述 User Need Statement(设计思维"定义"阶段的核心)—— 把一堆洞察压成一句话,聚焦动词需求而非名词方案:
格式:
[一个用户(带标签)] 需要 [一个需求(动词、真实、不含方案)] 以实现 [一个目标(价值)]例:
[Alieda,精通科技、要带两个孩子的妈妈] 需要 [快速自信地比较选项,且不离开舒适区] 以 [把时间花在真正重要的事上]
心法:用户不需要"下拉菜单"(名词),需要"看到选项并选一个"(动词)。过早锁定方案 → 次优设计。可分父级(长期愿景)/子级(具体功能)。区别于开发任务:需求陈述给方向,开发任务("用户需要一个价格对比表")给实现。
四、样本量:定性看"饱和点",不靠统计公式
定性研究不能用功效计算(power analysis)算样本量 —— 因为目标不是统计普适,是理解现象。靠的是饱和点 saturation:新会话不再带来新信息时就够了(开始听到重复)。
| 影响因素 | 需要更多人 ↔ 可以更少 |
|---|---|
| 人群多样性 | 背景越杂越多 ↔ 聚焦单一细分越少 |
| 研究范围 | 目标越宽(如"用户对税的心理模型")越多 ↔ 越具体(如"填税表的痛点")越少 |
| 研究者水平 | 新手追问浅要更多人 ↔ 老手单次拿得多,模式更早浮现 |
操作:从 5-6 人起步(可用性测试尤其够初步分析),每轮后问"还在学到新东西吗?",需要就再加 1-2 人重评。频繁的小研究 > 一次庞大复杂的研究(边际回报递减)。
特例:卡片分类(Card Sorting) 有定量依据 —— Fidelity 研究(168 人)测出:5 人 r=0.75(不够),15 人 r=0.90(多数项目最优性价比),30 人 r=0.95(预算充足大项目),60 人 r=0.98(性价比极低)。
五、可用性测试的任务编写:定性求开放,定量求唯一解
所有可用性研究都要给参与者任务,但定性/定量写法相反:
| 属性 | 定性任务 | 定量任务 |
|---|---|---|
| 特性 | 开放、探索性 | 具体、聚焦 |
| 细节 | 适量,建立动机即可 | 详细,确保唯一解法(否则数据不一致) |
| 顺序随机化 | 可选 | 必需 |
| 可中途改任务 | ✅ | ❌(所有人必须做同样的) |
| 例子 | "用网站找个你感兴趣的食谱" | "预订芝加哥 Hyatt Regency 1/17-19 的双人房" |
两者共通原则:从真实用户目标取材(访谈/搜索日志/客服/分析数据);别用界面术语当线索(❌"注册 Alertbox" → ✅"订阅这个网站的新闻邮件");情感中立(❌"给你妈买生日礼物" → ✅"给朋友买");用虚拟数据;先试运行;任务相互独立可随机化;一个任务一个成功标准(别叠加"找地址和开放时间")。
任务排序也用漏斗:先探索性任务(看自然行为)→ 再有目标任务 → 最后定向任务(测特定 UI 元素)。
六、主持可用性测试:10 步检查清单
| # | 步骤 | 关键 |
|---|---|---|
| 1 | 欢迎 | 别说"测试",说"研究/研究活动",缓解紧张 |
| 2 | 确认名字发音 | 建立亲切感 |
| 3 | 告知观察员+录制 | 即便招募时说过也要再提醒、征得同意 |
| 4 | 签同意书 | 给足阅读时间 |
| 5 | 简短背景访谈(如需) | 别问会影响结果的问题 |
| 6 | 设定预期 + 边做边想 | 强调"测的是设计不是你";请用户出声思考 |
| 7 | 一次给一个任务 | 书面说明、请用户读出来确认理解 |
| 8 | 任务后追问 | "哪里特别容易/困难?" |
| 9 | 留 5 分钟给观察员提问 | |
| 10 | 致谢、发奖励、结束录制 |
七、不用真用户的专家评估法
预算有限/早期阶段,可用专家法先扫一遍 —— 但都不能替代用户测试,只能补充、为测试指方向。
启发式评估 Heuristic Evaluation:对照一套原则(首选 Jakob Nielsen 十大可用性启发)找问题。
- 3-5 名评估者独立评(单人会漏,人多边际递减),独立期间不能看彼此记录避免互相影响
- 先以用户身份走一遍任务熟悉界面,再回头找违反原则处 + 给建议
- 缩小范围提细节(单任务/部分界面/特定人群/某设备);单次控制 1-2 小时
- 汇总用亲和图聚类、按严重度排序
- 铁律:启发式不是法律 —— 可有意违反(如小屏汉堡菜单违反"识别优于记忆",但空间所限是合理妥协),但要用用户研究验证
认知走查 Cognitive Walkthrough:专评可学性(新用户视角),逐步问 4 个问题:① 用户会尝试做对的操作吗?② 能注意到正确操作吗?③ 能把操作和目标联系起来吗?④ 操作后能察觉进展吗?四问全"是"才算该步成功。
- 适合:复杂/新颖/非标系统(医院自助、金融软件);不适合:常见模式(普通电商结账,走查太冗长)
- 工作坊形式:2-6 名多角色评审者(产品专家/UX/工程师/领域专家)+ 主持+展示+记录;输入=用户画像+核心任务+正确步骤序列+界面版本;90 分钟约评 2 个完整任务
| 启发式评估 | 认知走查 |
|---|---|
| 视角:分析人员 | 视角:新用户 |
| 目标:整体可用性 | 目标:可学性 |
| 范围:全面 | 范围:特定任务 |
配套量化工具:
- 严重性分级 Severity:把一长串问题按"频率×影响×持续性×对口碑的影响"分 5 级(高/中/低/Bug/正向反馈 Good)。高=阻断关键任务(无法支付/注册),必修;同时标出"Good"保团队信心。长期用同一套 → 团队信任、沟通快
- 专家评审保持客观 Keep Opinions Out:评审里个人好恶不算数(除非你正好是目标用户)。每个问题都要有客观依据(违反哪条原则/什么效率损失);找不到客观理由 → 可能没问题 → 不确定时宁可不提,改建议"测一下"
- 错误消息评分 Rubric:12 条原则 × 3 维度(可见性 Visibility / 沟通性 Communication / 效率 Efficiency),每条 1-4 分,平均分 → A(3.3-4.0)到 D(≤1.5)。实证:Craigslist 2.08(差)、Google Flights 3.17(中)、J.Crew 3.67(好)
八、UX 工作坊:解决问题,不是开会
会议 vs 工作坊:会议=信息交流(浅而广);工作坊=协作解决具体问题(深而专,半天起、准备成本高)。没明确待解问题就别开工作坊(浪费时间还砸招牌)。工作坊走"发散(便签/头脑风暴)→ 收敛(亲和图/强制排序)"。
5 种工作坊(cheatsheet):发现 Discovery(立项对齐目标)/ 共情 Empathy(把心态从功能优先转向用户优先)/ 设计 Design(快速生成多样创意,非定稿)/ 优先级 Prioritization(影响-努力矩阵砍范围)/ 评审 Critique(对照准则迭代方案)。可组合(发现里加优先级)、可压缩(敏捷团队压成一早上)。
7 个基础活动(所有工作坊都是这些的组合):便签生成 Post Up / 亲和图 Affinity / 景观映射 Landscape Mapping / 故事板 Storyboarding / 强制排序 Forced Ranking / 角色扮演 Role Playing / 成果分享 Playback。
纳入真实用户的价值与陷阱:用户现场分享能大幅提升成果,但 —— ① 别盲从用户(建议是视角不是指令,让用户离场后团队再做最终评估);② 别让用户失望(提前说清是头脑风暴非定稿);③ 防偏见(别只请铁粉/员工亲属,要多样)。请不到真用户 → 用代理人(研究员/客服/销售)。
九、研究伦理与运营
知情同意 Informed Consent(历史教训:纽伦堡审判、塔斯基吉梅毒研究 → 催生伦理规范)。同意书 = 研究者告知(目的/形式/时长)+ 参与者理解后自愿。内容含:目的(别泄露会影响行为的假设)、形式与时长、自愿可随时退出、数据如何匿名/存储/谁可访问/能否要求删除、补偿(任务前发,避免感觉在测能力)、未成年人监护人签名。例外:A/B 测试(常规使用产品)、拦截研究(用简单协议页)可简化。
筛选标准 Selection Criteria(招错人 = 整个研究作废:测健身产品却招不健身的人)。别只看人口统计(年龄性别收入预测不了真实行为 —— "1947 年生、富有、多次结婚"既可能是查尔斯王子也可能是奥兹奥斯本)。三类标准缺一不可:
- 包含 Inclusion = 你想要谁(具体、与目标直接相关;区分"合适"和"最合适")
- 排除 Exclusion = 必须剔除谁(UX/开发/行业内人士 —— 他们用专家视角而非普通用户视角)
- 多样性 Diversity = 保证样本接近真实分布(研究航空 App 不能只找头等舱)
- 用招募矩阵平衡各段位 × 年龄/地域,一人可满足多条,某类够了就补别的缺口
研究民主化 Democratize(5 步):让非研究岗(PM/设计师/PwDR)也做研究 —— 益处(推动更多研究、提升满意度、加深团队对研究的理解);风险(低质研究 → 误导设计、责任不清、资源错配、阻碍 UX 成熟度)。5 步:① 识别需求 → ② 分类资源 → ③ 满足需求(培训+导师+按难度分派:初级做简单、高级做复杂)→ ④ 对齐职责 → ⑤ 反思改进。目标四性:可行 Viable / 影响力 Influential / 可靠 Sound / 高效 Efficient。
源自 NNGroup Topics / Qualitative Research - 定性研究(26 篇,含两版启发式评估已合并)。定量方法见 NNGroup 定量研究 Quantitative Research(A/B 测试·样本量·置信区间·UX 指标·转化分析·基准测试·学习曲线);可用性测试与十大启发式见 NNGroup 可用性测试与十大可用性启发式(10 条启发式完整表 · 复杂应用应用 · 用户愉悦层级 · 测试方法 5 人法则/招募/远程/任务场景/分步任务/态度vs行为/4步分析/小样本误差/竞争性评估);方法速查见 NNGroup UX 研究方法选型(23 法速查/四象限定位/按问题-阶段-预算选/定性探索·定量验证·专家评估·IA·行为分析五大族);访谈产出的画像见 NNGroup 用户画像 Personas(本质/三类型/范围层级/创建/对比 JTBD-原型-分群/应用/维护/5 大失败);与 Google UX 证书 / UX 研究与共情-定义 互补。图片/PDF/xlsx 模板保留在 sources。
来源与关联资料
- NNGroup 定量研究 Quantitative Research(A/B 测试·样本量·置信区间·UX 指标·转化分析·基准测试·学习曲线)
- NNGroup 可用性测试与十大可用性启发式(10 条启发式完整表 · 复杂应用应用 · 用户愉悦层级 · 测试方法 5 人法则/招募/远程/任务场景/分步任务/态度vs行为/4步分析/小样本误差/竞争性评估)
- NNGroup UX 研究方法选型(23 法速查/四象限定位/按问题-阶段-预算选/定性探索·定量验证·专家评估·IA·行为分析五大族)
- NNGroup 用户画像 Personas(本质/三类型/范围层级/创建/对比 JTBD-原型-分群/应用/维护/5 大失败)
- Google UX 证书 / UX 研究与共情-定义