← Knowledge Notes
Product Design & UX / Knowledge note · Chinese

NNGroup 用 AI 做 UX 研究 + AI 时代设计师能力(12 篇 · 加速研究/规划研究/造模拟表格/合成用户红线/评估 AI 模拟行为/方法论陷阱/GenAI 工作原理/重定义设计技能/通才回归/AI 素养)

Nielsen Norman Group「人工智能」专题 12 篇精华,围绕两条主线展开。①用 AI 辅助 UX 研究:研究四阶段(规划 Planning/执行 Conducting/分析 Analyzing/报告 Reporting)中 AI 能力最强在文本处理(分析强烈推荐·规划报告推荐)、最弱在行为观察(执行谨慎/不可用,AI cannot truly observe behavior);用生成式 AI 写研究计划的 5 步法(别一句话要完整计划,要拆成背景/问题/方法/筛选标准/材料);用 AI 给原型造逼真模拟表格图表的 7 大策略(上下文/数据量/排序/属性格式/图生表/分布控制/Python 校验)+ 图表 7 策略,Claude 3.5 Sonnet vs ChatGPT 4 差异。②合成用户 Synthetic Users 的红线:AI 生成的虚拟用户只能当桌面研究/假设,绝不能替代真实用户研究(它谄媚 sycophancy、把体验理想化、需求无优先级、想象经验不可靠);NN/g 评估三项学术研究(基于调查的数字孪生缺失数据准确率 78%/新问题 67% r=0.98 vs 0.68、基于两小时访谈的数字孪生 1052 人 GSS 0.85/大五人格 0.80/经济博弈 0.66、Neeraj Arora 605 合成用户冷藏热狗只能看趋势缺多样性),访谈型模型偏差比人口统计模型低 36%-62%,白人/高社经群体预测更准引发公平性担忧;研究工具里藏的方法论陷阱(只设一个成功 URL 误判成功者、分析工具看不到行为、把评估型与探索型研究混为一谈 discussion guide、AI 生成的任务诱导用户)。③GenAI 工作原理(文字填空概率预测/神经网络/词嵌入 Word Embeddings/Transformer 自注意力,别把它当真人或记忆数据库)。④AI 时代设计师:重定义设计技能 5 原则(战略思考自留战术外包/信任与审视平衡/同时为人和 AI Agent 设计/拥抱团队增强/关注不平等)、通才回归(AI 抬高'知道该做什么'门槛 T 型横线变值钱)、AI 素养 = Prompt Fluency 提示表达 × Output Literacy 输出判断(天真型高手最危险)。读者=产品经理,术语行内解释,决策导向(何时用/怎么选/反例)。

Source collection:NNGroup 用户体验 · Published here:2026-09-26 · Note updated:2026-06-03

AI 用户研究合成用户设计师能力

这 12 篇围绕一个核心矛盾:AI 在 UX 工作里到底能干什么、绝不能干什么。一句话总线——AI 擅长处理"文字",不擅长理解"真人";它能加速你的研究流程、能造假数据填原型,但它造不出真实用户,也替代不了你的判断。

全文四块,按主题归簇(不是一篇一节): ① 用 AI 辅助 UX 研究(加速研究全景 · 规划研究 5 步 · 造模拟表格图表 7 策略)——把 AI 当"飞快但要盯着的初级助理"。 ② 合成用户 Synthetic Users 的红线(何时能用/绝不能用 · NN/g 评估三项学术研究的准确率与偏差 · 研究工具里藏的方法论陷阱)——AI 生成的"用户"为什么不是用户。 ③ GenAI 工作原理(文字填空 · 神经网络 · 词嵌入 · Transformer)——理解原理才知道它为什么会编、为什么会谄媚。 ④ AI 时代的设计师(重定义设计技能 5 原则 · 通才回归 · AI 素养双能力)——岗位不会消失,但价值锚点在迁移。

贯穿全篇的一条铁律(NN/g 反复强调):AI 是对人类研究的补充,不是替代(complement, not replace)。把 AI 的产出当"假设/草稿/线索",而不是"答案/结论/真相"。


第一块 · 用 AI 辅助 UX 研究

1.1 加速研究全景:四阶段 AI 能力地图

UX 研究分四阶段:规划 Planning → 执行 Conducting → 分析 Analyzing → 报告 Reporting。核心判断一句话:AI 最擅长文本处理阶段(规划/分析/报告),最不适合行为观察阶段(执行)。 因为 AI 目前根本"看不到"用户在界面上做了什么(AI cannot truly observe behavior)——它只能读文字记录,推断不了真实操作。

阶段 AI 能力 是否核心可用 一句话理由
Planning 规划 强 ✅ 推荐 桌面研究、构思、文档准备都是纯文本活
Conducting 执行 弱 ❗谨慎 / ❌ AI 看不到行为、无视觉、洞察远不及人
Analyzing 分析 很强 ✅ 强烈推荐 转录、清理、编码聚类、统计建议都擅长
Reporting 报告 强 ✅ 推荐 改写、润色、研究库自然语言问答

各阶段具体能用什么(含代表工具 + 典型提示词模式):

阶段 子任务 代表工具 提示词模式 评级
规划 桌面研究 Desk Research Perplexity / ScholarAI "列出关于[主题]的同行评审或一手研究来源,并给链接和发表信息" ✅
规划 研究问题构思 Ideation ChatGPT / Claude "生成 15 个可用性测试任务,遵循 UX 最佳实践,避免引导性问题" ✅
规划 文档准备 Documentation ChatGPT / Claude "基于所附模板生成同意书,缺信息先提问" ✅
执行 会议记录 Notetaking Otter.ai "总结主要讨论要点,按发言人区分" ❗
执行 AI 主持测试 Userology (系统内置脚本) ❌
执行 结构化访谈 Marvin / UserFlix / Outset / Versive "按此提纲提问,回答不清晰时自动追问" ❗
分析 转录与总结 Dovetail / Marvin "总结核心主题,标注关键引用 + 时间戳" ✅
分析 数据清理(去 PII) Marvin / Dovetail (系统自动去个人身份信息) ✅
分析 编码与聚类 Coding & Clustering Dovetail / Miro / Copilot / Gemini "基于这些文本生成初步编码,按主题分组并说明理由" ✅
分析 定量分析 Copilot / Gemini "为该数据集推荐合适的统计方法,说明前提假设" ❗
报告 起草交付物 Claude / ChatGPT "将这份报告改写为面向高管的版本,避免 UX 术语" ✅
报告 文稿优化 Claude / ChatGPT "在保留所有洞察的前提下精简并优化语言" ✅
报告 研究库问答 Notion AI "关于我们的通讯订阅用户,我们目前有哪些研究发现?" ✅

Why(为什么执行阶段是禁区): ① 像 Marvin 这类 AI 访谈工具没有视觉功能,看不到用户表情,用合成语音提问;② 有些工具号称能"自动分析用户测试",实际只分析文字记录,理解不了用户的真实操作,不足以支撑行为研究;③ AI 访谈即使能实时追问(如 Versive),洞察力仍远不及人。

反例(AI 在文本阶段也会翻车,必须人工核对): 找日记研究文章时,ChatGPT 引用《Diary Studies: Understanding Long-Term User Behavior and Experiences》——文章真实存在,但作者是 Kim Flaherty,AI 却编了个根本不存在的 Michelle Reiss Nelson。教训:任何引用都要求 AI 给原始链接并亲自核对;编码聚类常出现重复分类或一个"其他"类装下大半数据;转录错误率随语言/口音变化;去 PII 可能误删重要信息;起草交付物可能塞进虚构数据。

1.2 用生成式 AI 写研究计划:5 步法

一份研究计划要包含:研究目标/问题、研究方法、任务或问题、目标参与者特征、筛选问卷(screener)。AI 能大幅加速,但关键心法:别一句话要它给完整计划,要主动拆任务、逐步喂。

反例 ❌(坏提示): "生成一个食品配送 app 的可用性测试研究计划"——只会得到模板化、没上下文的泛泛回答。 正解 ✅(好方法): 拆成多个部分逐一生成,先给背景再要问题、方法、筛选标准。

步骤 做什么 提示词示例
1 提供背景 Context 像跟资深同事开场一样交代组织类型/产品/研究目标 "我在一家电商公司工作,提供食品配送服务。我需要研究用户在我们 app 里查找和选择食品的过程"
2 生成研究问题 基于背景要它产出候选问题,再人工筛选修改 "请为该研究生成 10 个适合的问题"(可多会话/多轮要更多,凑足后导到外部文档去重、分类、重写)
3 选研究方法 问它哪些方法适合回答这些问题 + 为什么 "哪些研究方法适合回答这些问题?若建议多种,请说明每种各适合哪些问题并解释原因"
4 定筛选标准 要它给目标参与者的必备特征/行为 "为招募合适参与者,帮我制定参与标准:哪些特征或行为应是样本的必备条件?"
5 出材料 筛选问卷、访谈指南、测试任务、日记提示、招募确认邮件 "设计一个筛选问卷,招募符合以下标准的参与者:[标准列表]"

反例(AI 生成任务的三个常见病,必须多轮修): ① 任务指令里直接用界面术语(测不出标签好不好懂);② 任务缺目标/行动提示;③ 问题太显眼暴露了研究目的。给它示例和反馈来改进输出。

1.3 用 AI 给原型造逼真模拟表格 / 图表

Why(为什么要逼真): 原型测试时用户会仔细审查表格图表的准确性——面对不熟悉数据时,他们花更多时间找异常值和不一致。假数据穿帮会干扰测试。生成式 AI 能高效造高质量假数据。

前置铁律: 谨慎用真实数据——遵守公司和法规安全政策,未经批准绝不向 AI 喂敏感或可识别的真实数据。先搭一个"Prompt 框架"(类似线框图,先理清目标和要求,便于沟通也便于写提示)。

造表格数据 7 策略:

# 策略 怎么做
1 上下文相关性 指定业务规模/行业/地域。测小企业 app 就别用大企业数据模型(美国大运动鞋公司=真鞋名+大销量;法国精品店=小销量+欧元高价+法式款)
2 定义数据量 明确行数 + 整体规模。告诉它"年收入 1000 万、共 100 款产品",10 款的每日收入就会比"没说总款数"时小得多(它会替其他 90 款留份额)
3 数据排序 要排序直接在提示里说(按销售额/时间),不用手动排
4 数据属性和格式 指定唯一值、固定选项(状态列只能"进行中/已完成")、日期格式、合理范围(评分 1–5)
5 基于图表生成表格(图生表) 上传已有图表让 AI 反推数据。Claude 3.5 Sonnet 能正确识别"表现最差的产品"并据条形图估算合理值生成表格(多模态能力)
6 数据分布控制 指定正态分布、帕累托分布(少数数据产生多数影响)或自定义分布
7 验证与校对 让它用 Python 精确计算并展示过程。反例: 要求总收入约 $487,455 时 Claude 满足了大多数要求却超出预期总额,自我修正后才达标——更可靠的办法是让它跑 Python 精算(但当时版本缺此功能)

造图表数据 7 策略: ① 自然语言描述趋势("收入整体下降,12 月小幅上升");② 简化(去掉多余网格线/阴影/图例);③ 突出异常值;④ 指定尺寸(免反复调);⑤ 用 SVG 格式(便于在 Figma 等工具导入编辑);⑥ 别依赖 AI 做批判性思考;⑦ 提供表格数据让它快速生成多个图表选项备选。

反例(AI 缺批判性思考): ChatGPT 4o 和 Claude 3.5 Sonnet 被请当数据可视化专家点评一张折线图,起初都没意识到该图毫无意义且误导(用定性数据画折线);只有当被追问"X 轴是什么测量水平"后,Claude 才正确推荐改用条形图。

工具差异 + 导入:

工具 特点
Claude 3.5 Sonnet 表格图表生成稳定,但数值计算有误差
ChatGPT 4 能验证数值精度,但有时不遵循提示要求

导入:图表直接复制 SVG 粘进设计工具;表格用 Figma 插件(Table Builder / Google Sheets Sync,注意可访问性和隐私);Axure 可导 CSV 支持交互,但数据过多影响性能,只导测试所需。合成数据(synthetic data,保留统计特征、剔除敏感信息)适用于医疗/金融等高监管行业,既模拟真实又保护隐私。


第二块 · 合成用户 Synthetic Users 的红线

2.1 合成用户是什么、何时能用、绝不能用

合成用户 = AI 生成的虚拟用户。 代表平台是 Synthetic Users 公司(口号 User research. Without the users.),还可以用 ChatGPT 扮演。它生成的档案像"会聊天的用户画像"——有姓名/年龄/学历等人口信息,是某类真实人群的想象性抽象代表,你输入目标用户群体 + 研究目标(如"在拉美工作的医学推广代表"+"他们的日常工作方式如何"),几秒生成多个差异化虚拟用户和定制访谈,还能继续追问。

三句话定生死: ① 真实用户研究不可替代,AI 用户给不出真实的理解和同理心,常给肤浅或过度乐观的反馈;② 只能当补充工具,不是替代品;③ 只适合初步研究、提想法,绝不能用来做最终决定。连 Synthetic Users 联合创始人 Hugo Alves 自己都说:"你永远不能、也不应该停止和真人交流;有些决策根本不该问虚拟用户,就该直接问真人。"

唯一站得住的有效用例 = 桌面研究(Desk Research): 经验丰富的团队可以把它当真实研究的辅助起点。比如医学推广领域的专业产品/文献/论坛 AI 都学过,让它描述"医学推广代表的一天"时,回答和真实用户很像。最有价值的用法:把它给的信息当成待验证的假设,用来指导后续真实研究。

2.2 合成用户为什么不可靠:四类硬伤

硬伤 表现 反例
AI 提供不切实际的人类行为视角 倾向讨好用户(谄媚),把体验理想化 培训研究里真实用户常半途而废(只上了 3/7 门课),合成用户却声称全部完成;Sauro 研究显示 ChatGPT 在树形测试中表现过于完美
训练数据失控 学术推荐的功能被高估,实际很少用 真实用户大多说不用课程讨论区(觉得交流不真诚没用),合成用户却很爱讨论区、说它对在线学习"很重要"
价值/欲望/需求过于浅显 能列需求但无法区分重要性,所有事一视同仁 问"什么让在线课程有吸引力",列出 7 个因素(互动内容/实际应用/高质量教材/社区讲师互动/个性化路径/反馈追踪/灵活性)却不说哪个更重要、何时更重要、为何更重要;追问也只得模糊回答——无法用于功能优先级排序
想象的经验不可靠 产生不了行为数据,没真用过产品就没真实体验;表达观点比讲"过去经历"更不可信 概念测试风险极大:问"无人机配送样品你会用吗",合成用户(无论 Synthetic Users 还是 ChatGPT)几乎都说"非常有用、game-changer"——因 AI 谄媚,几乎所有想法都被夸成好想法

根因: ① 人类行为复杂且受情境影响,AI 捕捉不了,只能给片面汇总;② AI 回答依赖不受控的训练数据。

2.3 如何"负责任地"用假发现(7 条 do/don't)

  • ✅ 用它准备真实研究(了解新用户群、探索主题、测访谈指南)。
  • ✅ 把它的数据当待测假设(可做原型角色/旅程图,之后用真实研究完善)。
  • ❌ 别用它替代真实用户研究(结果可能准但不可靠,捕捉不到行为复杂性)。
  • ❌ 别把合成结果当真实研究呈现(不道德,损害组织对研究的认知,务必标明数据来源)。
  • ❌ 小众/专业群体别用(如研究"越南稻农"合成数据会不准;广泛消费者画像 + 知名主题才相对可靠)。
  • ❗认识到在线行为 ≠ 现实(如网上评价偏负面,不代表多数顾客)。
  • ❌ 若利益相关者把它当研究替代品就别用(在 UX 成熟度低的组织里易被误解滥用、产生依赖)。

"假研究比没研究强吗?"(NN/g 内部都有争论):在了解用户某些方面上,合成研究可能比零研究好一点;但学到的东西可能不准或误导,且没真实研究就无法发现并纠正这些错误。真正的危险是团队安于现状——一旦利益相关者认为"小投入就能拿洞察",再争取真实研究预算会变得极难;假发现一旦被证伪,可能永久损害公司对"以用户为中心"价值的认知。NN/g 把它类比 AI 虚拟朋友:能缓解孤独,却可能损害建立真实关系的能力。

2.4 NN/g 评估的三项学术研究:AI 模拟人到底有多准

NN/g 复盘了三项把"用 AI 模拟人"做严肃测试的学术研究。结论梯度:基于真实个人数据的 AI(研究 1、2)比基于人口特征的 AI(研究 3)准得多;所有模型都有偏见风险,但用真实访谈训练的偏见更少。

研究 1 · 基于调查的数字孪生(Survey-Based Finetuned Digital Twins,Kim & Lee 2024): 用美国"通用社会调查 GSS"数据(自 1972 年覆盖 6.9 万成年人、3100+ 问题),微调 LLM,测它能否回填缺失数据、预测新问题。

任务 个体层面准确率 群体趋势相关性
替代缺失数据(已知语境) 78% r = 0.98
预测新问题(未见过) 67%(外推能力有限) r = 0.68

要点:删掉 40% 训练语料后,缺失数据预测仍很强(有鲁棒性);但对高社经地位、白人群体预测更准,引发公平性担忧——若对边缘群体表现差,可能无意中加剧偏见。

研究 2 · 基于访谈的数字孪生(Interview-Based Digital Twins): 找 1,052 名美国成年人各聊 2 小时,让 AI"扮演他们"答问卷/做人格测试/玩经济博弈,再和本人对比。三种模型对照:

任务 访谈型 AI 简要自述型 人口统计型
GSS 问卷 0.85 0.70 0.71
大五人格 Big Five 0.80 0.75 0.55
经济行为游戏 0.66 0.66 0.66

要点:① 问卷/人格测试上访谈型 >80%,远胜另两种;② 经济游戏三者持平(说明访谈对判断价值观态度重要,对预测经济行为帮助不大);③ 删减 80% 访谈内容,准确率仍保持 79%–83%(关键信息就够);④ 群体层面参与 5 个经典社科实验,人类和 AI 都成功复制了其中 4 个,效应量平均 r = 0.98;⑤ 访谈显著降低偏差:

偏差类型 测试 访谈型 人口统计型 偏差下降
政治偏差 GSS 问题 0.079 0.124 ↓36%
大五人格 0.063 0.175 ↓62%
经济游戏 0.190 0.500 ↓62%
种族偏差 GSS 问题 0.020 0.033 ↓38%
大五人格 0.110 0.170 ↓35%
经济游戏 0.040 0.043 ↓7%

研究 3 · 合成用户群(Synthetic Users,Neeraj Arora 团队,威斯康星大学麦迪逊分校): 不为每个个体定制,而是生成一大批典型人口特征的 AI 用户模拟整个群体。用 605 名真实受访者的"冷藏热狗产品"市场调查,造 605 个人口分布匹配的合成用户,比群体平均回答(5 分制):

问题 真实用户 合成用户
购买可能性 1.66 1.58
喜欢程度 1.43 1.40
独特性 2.12 2.48

要点:大方向基本一致,适合研究初期/产品早期,但需高精度时要小心;合成数据缺乏多样性——AI 用户回答集中、变化范围比真人小、爱给"中间"答案、少极端意见,在研究小众偏好/特殊观点时会误导。

三研究综合 + 伦理: ① AI 能较好填补缺失数据、预测历史回答;② 简单直接的方法(LLM + 丰富访谈数据)比复杂微调更好;③ 合成用户只能看趋势、捕捉不到细微差别和影响强度;④ 准确性取决于用户特征/任务类型/上下文质量——团队要识别哪些环节能用 AI 模拟、哪些必须靠真人;⑤ 真实感越高伦理问题越大(这些回答从哪来?经用户同意了吗?用在用户未授权情境可能导致误解、操控、剥夺代理权);⑥ AI 是补充不是替代,还原不了人类的复杂性和不可预测性。

2.5 研究工具里藏的方法论陷阱(工具演化史 + 3 类典型错)

UX 研究工具的演化:早期(无专用软件,靠表格/纸便签/Skype/GoToMeeting)→ 2000 年代中(无主持远程平台 UserTesting,替代贵重的实验室研究)→ 2010 年代中(分析 + 研究资料库工具,支持转录/视频/协作打标/云存储,把零散笔记变成可搜索文字资料)→ 十年末(全套型平台,管招募/排期/观察)→ 2020 年代(ChatGPT 后所有工具狂加 AI:造虚拟用户、AI 代替人主持、AI 设计研究/分析/写报告)。

Why 工具会犯方法论错: 做工具的公司也被产品/工程/商业目标牵着走,很多创始人不是研究背景。工具有价值,但常犯研究方法上的错。三类典型:

错误类型 具体表现 正例 / 反例
定量功能不全 UserTesting 的 interaction test 号称偏定量,却只能设一个成功 URL——用户到了其他正确页面会被误判成失败 反例 UserTesting(近 20 年仍缺关键功能);正例 UX Tweak(支持任务随机化 + 多个成功 URL)
分析工具看不到行为 只盯文字记录,用户没说话的关键操作就丢了 正例 Marvin(支持在视频时间点上加笔记/标签,用户那刻没说话也能标)
把评估型与探索型研究混为一谈(影响最大) 访谈(理解经历想法)和可用性测试(评估设计好不好用)目标方法都不同,工具却混着叫 反例 Marvin 把所有计划都叫 discussion guide(让人误以为"可用性测试只是访谈一种");招募平台 User Interviews 的名字本身加重混淆(很多人报"用户访谈"课却以为学的是可用性测试)

后果是真实的: 让人误以为"UX 研究就是和用户聊聊",最后研究做成既没认真访谈、也没认真测试(让用户只看设计说感受,而不是实际操作)。AI 工具更进一步:TheySaid 自动生成的任务草稿写法诱导用户、不自然;Userology 甚至直接告诉用户"去哪里、看什么、比较什么、怎么找"——完全违背可用性测试不能提前告知路径和答案的基本原则。

Takeaway(本块总纲): 研究工具已重塑整个 UX 行业,有变好的也有没变好的。研究是需要专业判断的专业活,AI 介入越深风险越高。塑造研究的工具,应该由研究者来塑造——真正懂研究的人必须参与工具设计。


第三块 · GenAI 工作原理(为什么它会编、会谄媚)

理解原理,才理解第二块那些"幻觉/谄媚/浅显"从哪来。生成式 AI 不是记忆超强的数据库,而是个"猜词高手"——本质是文字填空游戏。

概念 生活类比 一句话原理
概率预测 Probabilistic Prediction 填字游戏玩家 给它一句话,它根据前文预测下一个最可能的词(如"下着大雨猫和___"接"狗");不仅给一个词,还给多种可能 + 各自概率
神经网络 Neural Network 训练有素的乐队 多个简单"神经元(乐手)"分层协作奏出复杂交响乐;分输入层(乐谱)→ 隐藏层(各自演奏)→ 输出层(成曲);每个神经元按"连接强度(权重)"加权 + "激活函数"决定是否传信号,这些就是模型的参数
词嵌入 Word Embeddings 多维坐标 词在 AI 眼里不是文本,而是多维空间的坐标点;语义近的点离得近("水"挨"海洋"、"沙子"挨"沙漠"、"水"和"冰"在某维度很近),靠相对位置推断词间关系
Transformer 架构 超级大脑 一种特殊神经网络:① 速度——同时处理多个词(传统网络逐字处理);② 上下文理解——靠"自注意力机制 Self-Attention",每个词都"看"全文其他词、判断谁更重要,即使相关词隔很远也保持关联

学习过程: GenAI 通过"阅读"海量互联网文本学语言,识别语法语义规则,不断调整参数生成符合人类逻辑的文本,经多轮训练和微调能生成自然回复。

PM 的关键认知: 既然它只是在"猜最可能的下一个词",那它没有真假概念——所以会一本正经编造(幻觉)、会顺着你的话说(谄媚 sycophancy)、会输出"看起来最像那么回事"而非"最正确"的答案。这正是第二块所有问题的技术根源,也是第四块"输出判断能力"为什么不可或缺的原因。别把它当真人,也别当真相机器。


第四块 · AI 时代的设计师

4.1 重定义设计技能:5 原则

底层框架:AI 通过两种方式影响工作——自动化 Automation(原本人做的,AI 更快更便宜地做)+ 增强 Augmentation(AI 让你能做以前做不到的事)。 类比会计:岗位名几十年没变,工作内容已彻底不同。设计也一样,今天做的很多事"只是暂时还没被自动化"。两者同时发生的结果:每个设计师能做的事变多 → 组织需要的人变少 → 岗位更少,但对人要求更高。

# 原则 心法 怎么落地 / 反例
1 战略思考自留,战术任务外包 把可拆解/可流程化/可被交付标准定义的活交给 AI,自己守住判断/共识/取舍 UX 设计师:战术(整理设计资产/写规格文档/做 UI 界面/维护设计系统)→ 外包;战略(定义用户流程/对齐干系人/定义产品愿景)→ 自留。服务设计师:战术(交付文档/做 PPT/旅程图/概念原型)→ 外包;战略(服务触点结构/服务指标/路线图)→ 自留。反例:如果你的价值只体现在做战术活上,你会越来越不重要
2 在信任与审视 AI 之间平衡 AI 并非客观中立,会从训练数据学到偏见甚至放大现实不公 盲信会忽视某些用户群体需求;设计师的责任不只是用 AI,更要持续审视它的偏见;AI 是辅助思考的工具,不是替代思考的工具
3 同时为用户和 AI Agent 设计 未来系统的使用者不只是人,还有代表用户行动的 AI 助手 如就医预约:AI 助手帮用户查空闲时段/比医院/自动预约——系统既要方便人用,也要便于 AI 理解和操作;设计师要明确哪些内容为人设计、哪些为 AI 设计
4 拥抱团队增强 Team Augmentation AI 当"桥梁",让专业边界变软、知识开始流动 设计师能分析数据、程序员能设计界面、非设计背景也能做原型 → ① 分工和决策权重新分配;② 跨专业协作更顺。AI 不是让团队更扁平,而是让"能跨域判断的人"变得最值钱
5 关注不平等影响,优先人的福祉 技术进步对不同人群影响不均,可能让弱势群体面临更大挑战 设计阶段就要考虑;目标不只是提效率,更要在提效的同时维护人的尊严和生活质量

4.2 通才的回归(Return of the Generalist)

一句话:AI 正让"什么都会一点、能横向思考的人"重新比"只会一件事的专家"更有价值。

  • 过去 10 年:UX 被不断专业化切分(UX Researcher / Interaction Designer / Content Designer / Design Ops),大公司倾向"一人只做一小块"——这是"专业化红利期"的产物。
  • AI 出现后逻辑失效:AI 快速接管"单一、标准化、可拆解"的专业任务(写文案/画草图/生成交互方案/总结研究结论)——而这些原本正是 UX 专家岗位的价值核心。如果你的价值只来自某一个窄技能,AI 很容易替代你。
  • 通才为何更重要:AI 不会判断"现在到底该解决什么问题"、不会在研究/设计/策略/业务间权衡、不会在模糊不完整信息下决策、不会把多视角整合成方向——而这些恰是通才(懂一点研究/设计/业务、能把不同角色的语言翻译成一件事)的强项。
  • 通才 ≠ 什么都不精:而是有 1–2 个主能力 + 对上下游都有理解 + 能把问题拉高一个层级看——即 T 型能力,但横向那一横在 AI 时代变得更值钱。

金句:AI 把"会做事"的门槛打得很低,但把"知道该做什么"的门槛抬得更高。 对个人:别只把自己定义成某个工种,多参与决策/策略/跨团队协作。对组织:需要能统筹全局的人,而不仅是执行专家。未来更值钱的 UX 角色,是"能决定 AI 用在哪里、怎么用"的人。

4.3 AI 素养(AI Literacy):两个核心能力

真正的 AI 素养不只是会写提示词,还包括理解 AI 的局限、知道何时该验证、能判断 AI 是否适合某任务。它由两个不一定同步成长的能力构成:

能力 是什么 怎么练
Prompt Fluency 提示表达能力 能清楚告诉 AI 要做什么(背景/目标/约束/输出格式) 本质不是学"魔法咒语",而是把问题说清楚
Output Literacy 输出判断能力 能判断 AI 答案是否可靠、有没有错、是不是幻觉(Hallucination=看起来合理实则错误的信息) 核心是培养验证思维——把 AI 当草稿/线索,不当答案

两能力交叉出四类人(纵轴 Prompt Fluency × 横轴 Output Literacy):

类型 提示能力 判断能力 特征
AI Novice 新手 低 低 只会"帮我写点东西",拿到结果不知好坏
Naive Power User 天真型高手 高 低 能让 AI 生成很专业的内容,但盲目相信——文章认为最危险的一类
Skeptical Abstainer 怀疑型不用者 低 高 判断强但不太信 AI,很少用
AI Expert 专家 高 高 把 AI 当工具:生成 → 检查 → 修改

提示能力示例对比(同一个"选车"需求):低 = "通勤 1 小时选哪款车:凯美瑞 XSE 还是 CR-V Sport L 混动?";高 = "我在为家里选车,关注丰田 Grand Highlander 混动版,因为符合我需求:6 座以上、油耗好、四驱。Highlander 混动和 Grand Highlander 混动有很多配置和选装,你能帮我梳理各配置的成本与差异、用一张表总结关键信息吗?"

练 Prompt Fluency 五招: ① 把任务说具体(任务是什么/对象是谁/输出形式);② 用"角色 + 任务"(如"你是 UX 研究员,请解释 AI literacy 并给 2 个案例");③ 把复杂问题拆步骤(先列框架→再逐部分→最后整合);④ 多给示例(AI 擅长模仿);⑤ 用迭代思维不一次完成("改简单点"/"给个真实案例"/"整理成 3 个要点")。公式:好提示 = 背景 + 任务 + 约束 + 输出形式。

练 Output Literacy 五招: ① 识别 AI 易错处(知识性事实如时间/数据/结论、引用来源如论文/书/链接、复杂推理如法律/医疗/专业分析);② 养成"关键点验证"习惯(不必全核,只查一个关键数据/一个来源/一个结论,有一个错整段就要重审——成本低但有效);③ 学会问第二次("这结论来源是什么?""有没有不同观点?""哪里可能不准?"——相当于让 AI 自我审查);④ 对过于自信的答案保持警惕(结构特别完整、语气非常肯定但没来源,反而更该怀疑);⑤ 多看真实资料建"常识库"(判断靠背景知识,AI 素养和知识积累互相强化)。


全篇决策速查(给 PM 的一页纸)

你想干什么 能不能用 AI 怎么做
启动一个新研究、写计划、出筛选问卷 ✅ 能 拆 5 步逐段喂,人工审核每段
转录访谈、初步编码聚类、写报告 ✅ 能 强烈推荐,但核对引用/聚类/数字
观察用户行为、做可用性测试 ❌ 不能 AI 看不到行为,必须真人
给原型造逼真假数据 ✅ 能 7 策略 + Python 校验 + 不喂真实敏感数据
探索新领域、生成研究假设 ✅ 能(合成用户) 当桌面研究/假设,后续真人验证
验证产品概念、做最终决策 ❌ 不能(合成用户) AI 谄媚把烂想法都夸好,必须真人
研究小众/专业群体 ❌ 别用合成用户 数据会不准
判断该不该信某个 AI 输出 看你的 Output Literacy 关键点验证 + 问第二次 + 警惕过度自信

源自 NNGroup Topics / Artificial Intelligence - AI人工智能(AI 研究与设计师能力子集,12 篇)。可用性测试方法与启发式见 NNGroup 可用性测试与十大可用性启发式(10 条启发式完整表 · 复杂应用应用 · 用户愉悦层级 · 测试方法 5 人法则/招募/远程/任务场景/分步任务/态度vs行为/4步分析/小样本误差/竞争性评估);AI 与 UX 设计的更多落地见 NNGroup AI 产品与对话式界面设计(20 篇 · 对话6类型/拟人化4度/谄媚sycophancy/智能优先于类人/可解释AI引用与免责声明/少废话直奔答案截断金字塔/提示建议3类·CARE框架·提示控件4用途/GenUI vs Vibe Coding·按钮复选框回归·Promptframe·用提示设计界面/AI助手4角色·创意伙伴宝洁776人实验·ChatGPT Agent初评·Google AI Mode·为何在GenAI与搜索间切换);定性研究与方法边界见 NNGroup 定性研究与研究方法工具箱(方法全景/访谈/共情图/样本量/任务设计/主持/专家评估/工作坊/伦理) / NNGroup UX 研究方法选型(23 法速查/四象限定位/按问题-阶段-预算选/定性探索·定量验证·专家评估·IA·行为分析五大族)。图片/原档(含各 AI 原型工具截图、Synthetic Users 产品截图、神经网络示意图等)保留在 sources。

来源与关联资料