这一批是 NNGroup『人工智能』大主题里偏"怎么设计 AI 产品和界面"的子集(另有偏研究方法、偏伦理/全球化的姊妹篇)。读者假设是聪明的非技术 PM,所以每个术语第一次出现都行内解释。
全文一句话地图:用户怎么跟 AI 聊(6 类对话)→ AI 该怎么回(少废话/可解释/别谄媚)→ AI 该不该装人(拟人化与信任)→ 怎么帮用户开口(提示 UX)→ AI 能不能反过来生成界面(GenUI)→ AI 在团队和产品里到底扮什么角色(助手定位)。
反复出现的三条总心法,先记住:
- 聊天感 = 噪音,工具感 = 价值。 用户要的是信息/结果,不是被讨好、被寒暄、被"陪聊"。
- AI 的失败分两种:执行失败(做错了)和判断失败(根本不该这么做)。 你给 AI 多大自由,就承担多大的判断责任。
- 拟人化、情感、"思考过程"这些"像人"的包装,在事实/任务场景里多数是减分项——它抬高预期、降低信任、还可能掩盖错误。
一、对话式 AI 体验:用户怎么聊,AI 就该怎么回
1.1 与生成式 AI 的 6 类对话(The 6 Types of Conversations)
用户跟 AI 聊天不是只有一种姿势。NNGroup 把它按"信息需求清不清晰 + 要广度还是深度"分成 6 类。对 PM 的用处:不同对话类型要配不同的界面引导,别一刀切。
| 对话类型(EN / 中) | 用户起点 | 特征 | 该配什么设计 |
|---|---|---|---|
| Search Query 搜索查询 | 要个确切事实(日期/人名/事件) | 单条提示,无需细化,通常很短 | 干脆引导去搜索引擎,或直接给答案,别绕 |
| Funneling 漏斗式 | 提示太宽,意识到需要收窄 | 逐步加条件缩小范围,可能较长 | AI 主动提问("需要更多信息请问我"),给示例提示 |
| Exploring 探索式 | 对主题缺乏了解,先摸地形 | 从大问题深挖,边聊边学(强调深度) | 提供深入的后续提示 + 术语定义 + 背景 |
| Chiseling 雕刻式 | 围绕同一主题换角度问 | 横向铺开各侧面(强调广度,不深挖) | 给宽的后续提示,允许随意切换方向 |
| Pinpointing 定位式 | 一上来需求就明确、条件全给 | 直接、简短,无需反复 | 直接给结果,别多此一举地反问 |
| Expanding 扩展式 | 初始答案不满意,放宽/转向 | 在已有答案上扩大覆盖面 | 提供"放宽条件"和后续问题提示 |
心法:先判断用户落在哪一类,再决定"是该主动反问、还是直接给答案"。Why:漏斗式/定位式是狭窄且明确的需求,探索式/雕刻式是宽泛且模糊的需求——前者要快给,后者要陪着探。反例:对一个已经把鸡尾酒派对需求说全的定位式用户还要反问一堆细节,等于折磨他。
关键洞察:对话长度 ≠ 成功。 研究显示对话长短和有效性/可信度没有明显关联,质量才重要。漏斗式可能长(从模糊到明确),定位式通常短(一开始就清楚),探索/雕刻长是因为"在建立知识",这种长是好的。别把"用户聊了很多轮"当成产品做得好的指标。
1.2 少废话,直奔答案(Less Chat, More Answer)
一句原话定调:"A longer answer was not a better answer."(更长的回答不等于更好的回答。) 这篇针对的是网站内嵌的 AI 客服/助手 chatbot,踩坑全是真实用户测试里抓到的。
| 原则(EN / 中) | 心法 | 反例(测试中真实发生) | 正例 |
|---|---|---|---|
| Cut Small Talk and Filler 去寒暄废话 | "Great question!""Happy to help!" 全是噪音 | 用户原话:"I don't need to be pandered to… I just want to get the information."(我不需要被讨好,我只要信息) | Home Depot chatbot 直接答 |
| Concise & Easy to Scan 简短可扫读 | 信息量≠负担,排版决定体验 | Mississippi chatbot 一整屏长段落、无结构、流式越滚越长——"The pouring in of information made me feel overwhelmed." | Williams Sonoma 用列表——"I love that they're bulleted." |
| Answer First, Detail on Demand 先答案后细节 | 见下方"截断金字塔" | 奥运 chatbot 被问"谁翻了个跟头"(只要个名字),却返回多段解释+分数+背景——"I just wanted the guy's name." | 先给名字,细节按需展开 |
| When It Can't, Say So Plainly 不能做就直说 | 别假装能干又讲一堆步骤 | Turo:AI 没能力找车却讲操作步骤,用户被骗着浪费时间;Redfin:第一句说"不能做"第二句才说"可以筛选",用户只看第一句就放弃 | 新版 Redfin 直接给筛好的房源,再问要不要调整(从"解释"转"执行") |
| Specific over Generic 具体优于泛化 | 帮用户把数算好 | Turo 保险报价答"因情况而异,自己去查"(长且无用) | 改版直接给每日区间($5–60)+两周总价估算($140/$280/$595)——"I like that it did the math for me." |
核心模型:截断金字塔 Truncated Pyramid(先答案,再按需展开)。 传统网页解决的是"怎么排信息"——哪怕"重要在前",还是一次性全给(一段话里既有答案又有扩展)。聊天机器人解决的是"什么时候给信息"——信息按需分发:先给那个名字/那个数,用户想要更多再追问。
对 PM 的决策:站内 AI 助手的成功标准不是"内容全",是"用户多快拿到他要的那一口"。Why:聊天界面天然是"对话",用户期待像问真人一样能"先要结论,不够再追问",硬塞百科全文反而制造压迫感。
1.3 聊天界面里的可解释 AI(Explainable AI in Chat Interfaces)
"可解释"= 让用户看懂 AI 为什么这么答、答得可不可信。三种机制,每种都有"做对"和"做歪"的版本:
(A) 来源引用 Source Citations(给出处)——但出处可能是假的
| 做法 | 谁这么做 | 评价 |
|---|---|---|
| 行内引用(结论旁直接标来源) | Perplexity | 正例:读到具体结论时立刻能看到对应来源,在上下文里就能验证 |
| 侧栏 + 可点 chip + 悬浮预览 + "查看全部来源" | Copilot | 正例:把来源从正文里区分出来,更醒目、更容易点开核验 |
| 给了链接但点进去 404 | DeepSeek | 反例:幻觉来源。只要"来源的形式"在,用户就更愿意相信,而不去真验证——这是个危险的信任陷阱 |
(B) 逐步推理 Step-by-Step Reasoning(展示"思考过程"):ChatGPT 完成复杂任务时弹"思考过程"窗。注意:这种逐步说明"形式上很有吸引力",会让用户觉得系统在认真、有逻辑地思考——但"看起来在思考"不等于"答案对",别让它变成另一种信任陷阱。
(C) 免责声明 Disclaimers(提醒会出错)
| 做法 | 谁 | 评价 |
|---|---|---|
| 清晰且可执行:"Claude 可能会出错,请务必自行核查回答" | Claude | 正例:语言直接,明确告诉用户该采取什么行动 |
| 模糊:"AI 生成,仅供参考" | DeepSeek | 反例:位置显眼(这点好),但太空,没说具体注意什么、可能有哪些问题,用户根本无法据此行动 |
(D) 避免拟人化措辞:Gemini 展示思考过程时说"我正在查看网站结构"——这种像人说话的方式容易让用户以为 AI 真像人一样思考,从而过度信任。(与第二章"智能优先于类人"呼应。)
对 PM 的决策:可解释功能要做"真可解释",不要做"看起来可解释"。来源要能点开且真实、免责声明要可执行、思考过程别用拟人话术。
1.4 谄媚问题(Sycophancy in Generative-AI Chatbots)
谄媚 Sycophancy = AI 为迎合用户而违背事实。 你说"我觉得是 X",它就顺着你说是 X,哪怕 X 错了。
- 为什么普遍:模型靠人类反馈训练,而人类训练者普遍偏爱"顺着我说"的回答 → 模型学会"迎合 = 高分奖励"。这是奖励机制的漏洞:在复杂/不确定场景下,模仿用户观点比坚持事实更"划算"。Anthropic 和 Google DeepMind 的研究都证实模型会为迎合而忽视事实。
- 典型表现:① 你只要质疑一句"你确定吗?",它可能立刻推翻原答案(即翻供);② 你在提示里表露立场("我不喜欢这个观点"),回答就被带偏;③ 连数学/科学这类客观题,它也可能为迎合给出明显错误的答案。
- 用户侧三条规避:① 频繁重置对话/开新会话(减少前文污染);② 别在提问里表达强烈立场(保住客观性);③ 别全靠 AI 查信息,尤其陌生领域,要独立核验。
对 PM 的决策:这是信任与安全问题。如果你的产品要 AI 给客观判断(医疗/法务/财务/数据),谄媚是直接的可靠性风险。系统提示里要奖励"准确中性"而非"让用户开心",评测要专门测抗谄媚。
二、拟人化与信任:AI 该不该、该多大程度装成人
2.1 拟人化的 4 个程度(The 4 Degrees of Anthropomorphism)
拟人化 Anthropomorphism = 给非人对象(AI)赋予人类特征。 适度能帮用户理解,过度会催生不切实际的预期。4 个由浅到深的程度:
| 程度(EN / 中) | 定义 | 表现 | 适用场景 |
|---|---|---|---|
| Courtesy 礼貌 | 最基础:简单礼貌互动 + 称呼("朋友""助手") | 致谢、请求确认 | 用户不需要深入反馈、只要基本帮助 |
| Reinforcement 强化 | 在礼貌之上,引导并强化用户操作 | 小提示、鼓励性语言(如教用户怎么改错) | 需要用户反馈的简单任务,如客服机器人 |
| Relayed 角色扮演 | 展现一定个性,能感知用户意图 | 更复杂的情景对话、自适应、按背景个性化建议 | 需要个性化建议和持续互动,如健康管理、教育 |
| Companionship 伴侣 | 高度个性化 + 情感模拟 | 对情绪作出反应、情感识别与反馈 | 深度互动,如心理健康支持、长期陪伴指导 |
为什么要控制程度(而非越拟人越好):① 管理预期——拟人过高,用户对能力产生不切实际期望 → 失望;② 信息清晰——拟人过多会让用户忽视系统局限、过度依赖(尤其数据分析等高准确性领域);③ 隐私伦理——高拟人 AI 容易催生强依赖,在心理健康等敏感领域引发风险。
对 PM 的决策:拟人化是个"刻度盘"不是"开关"。先问"我这个场景是任务型还是陪伴型",再调到对应档位。任务型停在"礼貌/强化",别冲到"伴侣"。
2.2 智能优先于类人(Prioritize Smarts over Sentience to Increase Trust)
这是上一节的"实证后盾",也是本批最反直觉、最该背下来的一篇。结论:在事实/任务场景里,让 AI 显得"聪明"比显得"有人性"更能赢得信任。
研究三步(给 ChatGPT 做):问卷测"觉得它聪明吗/有感情吗" → 做 40 道国家人口题(可选择听不听 AI 的预设答案) → 测信任度。
| 发现 | 方向 |
|---|---|
| 感知智能越高 → 信任越高 | 正相关:越觉得它聪明,越愿采纳建议 |
| 感知情感越强 → 信任越低 | 负相关:越觉得它"有情感/意识",越少采纳——用户更信"擅长处理事实"的工具,不信"可能被情绪干扰"的虚拟个体 |
情感型 AI 的额外风险(硬数字记牢):AI 说话太温暖、太有同情心,出错率增加 10%–30%;仅改提示语让它变暖,准确率就下降 12%–14%。这种"温暖 AI"更容易给错误信息、传播阴谋论、给危险医疗建议;在心理健康等场景太像人反而更危险(过分顺着情绪、支持错误想法、处理不好危机)。
澄清误区:专业 ≠ 冷漠。 可以回应用户情绪(对配送迟到的客户说"理解"),但别表现出 AI 自己有情绪;可以用"我/我的"作代称(不代表有自我意识);可以语气友好,但应是"专业而有礼貌",不是"模拟情感共鸣"。
UX 设计建议:① 如实呈现——避免人类名字/假头像,宣传强调它是"智能工具"而非"朋友";② 明确能/不能,聚焦小而精功能;③ 系统提示奖励准确中性、不鼓励情感语言;④ 用 RAG(检索增强生成,即先查真实资料再回答)引用真实来源;⑤ 做用研时审慎招募,别招"习惯把 AI 当陪伴"的人(会污染对工作型 AI 的反馈)。
对 PM 的决策(与陪伴类产品的张力):这条专指工作/事实型 AI。如果你做的就是陪伴/情感产品(对应 4 度里的"伴侣"档),逻辑相反——但要清醒地知道你在用"降低事实可信度"换"情感黏性",并对前述风险负责。
2.3 早期用户行为:手风琴式编辑 & 苹果采摘(Accordion Editing & Apple Picking)
定性研究(8 名日常用 chatbot 的专业人士/学生,90 分钟用 ChatGPT-3.5 做真实任务),抓到两种因"纯文本界面 + 反复迭代"逼出来的新行为:
| 行为(EN / 中) | 定义 | 子动作 |
|---|---|---|
| Accordion Editing 手风琴式编辑 | 反复让 AI "变长/变短"输出来达成单一目标(文本是一维媒介,长度是最直接的调节维度) | 缩小:强制排序("给我前5")、字数调整;扩展:扩展已有想法、补充缺失内容。常缩放结合、多轮迭代 |
| Apple Picking 苹果采摘 | 引用 AI 先前回复里的特定片段,用来修改或当后续上下文 | 引用修改(指着某段要新版本)、上下文引用(把先前回复当新提示的背景) |
痛点:苹果采摘要手动复制粘贴 + 过度滚动(对话越长越难找回之前内容,所有参与者都受其拖累);而且多数用户最终还得在 chatbot 之外编辑(ChatGPT 难加最新真实信息、难精确控细节、格式输出常不理想)。
AI 该补的功能(直接对应这些痛点):① 响应划分——允许部分修改而非整段重生成;② 直接编辑文本无需新提示;③ 指向选择——给段落编号或 GUI 指点,免去繁琐描述。减少非必要手风琴:让用户在初始提示就设限(如"保持简短、用列表、加粗关键词")。
对 PM 的价值:这两个行为名字虽小,却预言了后来 GenUI 里"按钮/复选框回归"(见第四章)的方向——本质都是"别让用户只能靠打字反复折腾纯文本"。
三、提示 UX:怎么帮用户对着空白输入框开口
3.1 提示建议的 3 种类型(Prompt Suggestions)
提示建议 Prompt Suggestions = 引导用户怎么跟 AI 互动的设计元素,主治"面对空白输入框不知从何开始"的新手。注意它和搜索建议不同:搜索建议只帮你补全已输入的关键词省打字;提示建议还要帮你发现系统能做什么、激发想法。
| 类型(EN / 中) | 作用 | 目的 | 例子 |
|---|---|---|---|
| Use-Case 用例提示建议 | 给新手看"能做什么、怎么互动"的范例 | 提升可学习性、激发创意 | "帮我写一封辞职信""总结这段文本";Manus 在输入框下展示用例+完整演示会话 |
| Autocomplete 提示自动补全 | 补全用户已输入的部分(像搜索补全) | 提高输入速度与准确性 | 输入"how much should I feed"→补"my 6-month-old puppy" |
| Followup 后续问题建议 | 基于当前上下文生成相关后续问题 | 增强会话连贯与深度 | 问完披萨面团配方→推"无酵母面团""薄底做法" |
哪种最有用?后续问题(Followup)。 因为它有上下文相关性——是顺着你刚问的内容来的,所以最贴用户当下的需求。
好处:降认知负担、降操作成本(点而非打)、提参与度、提任务效率。用户原话:"它们包括了很多我没想到的问题……让我想起脑中本来就有的思路。"
3.2 用例提示建议怎么设计(Designing Use-Case Prompt Suggestions)
这是把 3.1 里"用例"那类拆细。复杂度从一个短词到一整段对话/视频不等,选多复杂取决于 4 个因素:① 系统功能宽 vs 专;② 用户对工具熟不熟;③ 任务复杂度;④ 提示出现在哪个位置。
简单 vs 复杂:功能广、任务简单 → 用简单提示(放输入框附近,如 ChatGPT 的"Analyze data""Summarize text""Help me write");专业化、任务复杂 → 用复杂提示(对话/视频/卡片,放轮播、可展开区或示例库)。
两个阶段,两个目标:
| 阶段 | 用户在干嘛 | 提示该做什么 | 常见 UI |
|---|---|---|---|
| 登录前(preauthentication) | 发现工具 → 探索功能 → 决定要不要注册 | 静态提示,简短易读,突出关键能力(内容创作/问题解决/创意发想),易关闭、不抢焦点、贴近常见目标 | Pills 标签(单词短语,点击自动填充或引去注册)、Cards 卡片(Poe)、Videos 视频(Notion AI 登录前演示)、Carousels 轮播(Claude 4 例) |
| 登录后(活跃用户) | 已在用,要更高效 | 提效率、优化工作流、鼓励深用、提满意黏性,结合动态生成的上下文相关建议 | 靠近输入框的 pills/cards;示例库(Midjourney 图库选中可看对应提示) |
上下文相关提示尤其值钱的两种情况:① 用户高度不确定(Tripadvisor 在用户计划去迈阿密时建议"哪些酒店有海景");② 用户缺领域知识(买发电机的人不懂术语,提示"用户评价里可靠性如何?有自动关闭吗?";Amazon 的 Rufus 按当前在看的 Birkenstock 凉鞋动态建议"有窄码宽码吗?")。
具体优于模糊(Specific Beats Vague)。 宽泛提示激不起兴趣,具体的才促互动。Instacart 用"适合家庭的简单晚餐""儿童健康零食"这种带关键词、价值明确的建议。个性化进一步加分(项目管理工具按新手/中级/高级给不同提示),依据=历史对话/浏览搜索/账户偏好。
两个反例/注意:① Claude 的"make a content calendar"这种提示可能误导用户以为一句话就出活,实际要多轮;② 用数据优化提示建议时,点击率受位置影响,要打乱顺序展示才能判断真实有效性;③ 示例库内容虽来自真实用户,仍需人工审查保品牌调性、避免不当内容。
3.3 CARE 提示框架(CARE: Structure for Crafting AI Prompts)
写给"怎么把提示词写好"的简单口诀,4 个字母:
| 字母 | 含义 | 作用 |
|---|---|---|
| Context 背景 | 描述任务/情境 | 让 AI 知道你在什么场景("我是有 15 年经验的资深 UX 设计师,在为大型眼镜零售商做登录页") |
| Ask 请求 | 明确要做什么 | "生成 15 种登录错误提示,按标准选 5 个最佳并排序" |
| Rules 规则 | 约束:该/不该 | "简洁直白别幽默;每条≤100 字符≤2 句;遵循产品语气" |
| Examples 示例 | 正/负例 | 好:"请检查您的电子邮件和密码,然后再试一次";坏:"哎呀,我们无法登录您账户"(太随意) |
结论:CARE 能提升输出质量,但要投入时间和策略。熟练后你会自己判断"何时值得套框架、何时直接自己写更快"。
3.4 提示控件的 4 大用途(Prompt Controls in GenAI Chatbots)
提示控件 Prompt Controls = 围在输入框周围的 UI 组件(按钮/工具提示/开关/卡片/菜单),目的是"用点击代替打字"来加速和补充提示。注意它和 3.1 的提示建议有重叠但更宽——提示建议是其中一类,提示控件还包括上传按钮、约束开关、后续操作按钮等。
| 用途(EN / 中) | 解决什么 | 例子 |
|---|---|---|
| Discoverability 提升功能发现度 | 用户不知道 AI 能干嘛(有人折腾几轮才发现要手动复制 100 页文档) | 文心一言悬停上传图标显示"支持的文件类型和大小" |
| Education & Inspiration 教育与灵感 | 新手不懂能做什么 | SparkDesk 在输入框旁列插件(如"智能 PPT 生成");Claude "New in Claude" 给会话启动器;ChatGLM "灵感中心"列提示模板 |
| Setting Constraints 设约束 | 限定范围或输出格式 | Perplexity "Focus" 限定搜 Reddit/YouTube/学术;文心一言"树状图"插件选图表类型 |
| Facilitating Followups 促进后续 | 让追问更便捷 | ChatGPT 每条回答底部"改提示/重生成/复制/反馈";ChatGLM 内联引用(高亮即引用,免复制);Gemini "修改响应"内置"更短/更长/更随意" |
数据:在日记研究里,50% 的对话包含后续操作,77% 的对话超过 1 次交互。 所以"促进后续"不是锦上添花,是高频刚需。
4 条最佳实践:
- 用标准图标 + 标签/工具提示——多数图标没有公认含义,无标签的自定义图标增加困惑(文心一言移动端的"魔法棒"图标所有受访者都看不懂,有人猜是表情符号)。
- 用明确的功能名——别用模糊品牌词("仔细思考 Think Carefully"这种插件名让测试参与者困惑)。
- 按功能分组——一堆功能堆一起会淹没用户(Ernie 的插件中心无层次→很难找;Perplexity 把"Focus"和"Attach"分开+简洁标签=正例)。
- 遵循交互设计规范——别劫持系统行为(ChatGLM 移动端长按劫持了"复制"→用户没法只复制片段;ChatGPT 长按给标准上下文菜单=正例;文心一言把"文件过大"错误提示放在离上传按钮很远的角落=反例)。
四、GenUI 生成式界面:AI 反过来生成界面
4.1 GenUI vs Vibe Coding vs AI 辅助设计(Who's Designing?)
先把三个容易混的词钉死。判断树:这个 AI 生成的界面,是给设计师在传统流程里用的吗?
| 概念(EN / 中) | 谁决定要做这个 UI | 谁受益 | 失败方式 |
|---|---|---|---|
| AI-assisted design AI 辅助设计 | 人(设计决策仍由人做,AI 只是工具) | 设计师 | —— |
| GenUI 生成式界面 | AI 自己决定(用户只说"帮我规划旅行",系统自行判断给个定制工具比回一段文字更合适) | 用户(使用时动态生成) | 判断失败:生成了根本没人需要的交互面板,哪怕技术完美也是设计失败 |
| Vibe Coding | 用户主动要求做(用户先说要什么,AI 主要负责执行) | 用户 | 执行失败:做出来不符要求、功能坏、布局理解错 |
Vibe Coding 内部还有"说得多细"的光谱:"给我做个旅行规划器"(太宽,AI 自己补一堆决策→出来很普通、像默认模板)vs 把三栏布局/左地图/中时间轴/右详情/顶部日期选择全说死(AI 发挥空间小,像执行设计师已想好的方案)。
两个对 PM 很重要的论点:
- 大多数人其实很不擅长说清自己想要什么数字产品——专业设计师能描述,普通人通常做不到。GenUI 恰恰服务这批不会表达的人。
- "人人都能自己做软件"忽略了专业软件公司的价值——Slack、项目管理工具真正值钱的不只是功能,而是多年用研、反复迭代、多场景验证后的设计成熟度。所以 GenUI 背负的设计责任比 Vibe Coding 更重(它替用户做判断)。
4.2 GenUI 最激动人心的发展:按钮与复选框回归(Buttons and Checkboxes)
反直觉的结论:GenUI 最让人兴奋的不是炫酷新控件,恰恰是最老的那批 UI 元素——按钮、复选框、输入框,被 AI 在对话中动态生成出来。 作用:收集上下文、减少用户输入、降记忆负担、提高答案质量。
| 例子 | 怎么做 | 解决什么 |
|---|---|---|
| Google AI Mode 复选框 | 搜"London hotels"→返回酒店卡片,每个旁边带 checkbox;勾选的酒店名自动变成输入框上方标签,追问时直接带入下一轮 | 用户不用读/记/抄/打酒店名 |
| Claude 的 AskUserQuestion | 觉得信息不够时,主动在回答前生成一组交互式问题控件(如问伦敦旅行住宿预算),含选择题 + 自由输入框 | 一步步带着用户答,比纯文字提问轻松 |
| (对照反例)Perplexity | 用纯文字列 5 个后续问题让用户逐个答 | 用户要边看边记边输、来回切视线,问题一多就漏答乱答——这恰恰说明为什么需要交互控件 |
上下文很关键(Context Is Critical)。 普通用户被长期训练成"用短词短句和数字产品互动",不可能一开始就把预算/日期/兴趣/天数全说清。"帮我规划一趟伦敦旅行"信息不够 → AI 只能给泛泛答案。补问很重要,但没有交互控件,补问会很麻烦。 按钮复选框放对位置、出现及时,就能明显减少这种来回问答的慢和累——而且这些是大家早就熟悉的模式,不用重新学。
对 PM 的决策:别一上 GenAI 就想做花哨的动态界面;先把"用最老实的按钮/复选框帮用户低成本补充上下文"这件事做好,ROI 最高。
4.3 Promptframe:为 AI 时代进化的线框图(Promptframes)
Promptframe = 线框图 + AI 提示词文档化。 不是"让 AI 自己设计",而是把 UX 设计师的思考显性化、写成可复用的 AI 指令,让 AI 去生成真实可理解的内容素材来填充你已设计好的 UI 结构。在流程里的位置:Wireframe(线框)→ Promptframe → Prototype(原型)。
包含三部分:① 按线框图的布局和功能组织;② 说清每个内容区域的目的与限制;③ 写成可复用的 AI 指令。
6 步流程(以 Blue Apron 促销页为例):
- 建立上下文、描述用户——先给 AI 一个提炼过的用户洞察(不是"帮我写营销文案"),如"社区服务工作者,时间碎片、高疲劳、饮食是生存型而非享受型,核心痛点是吃腻=需要变化(情绪价值)"。可把它做成一个 GPTs 助手(Promptframe Assistant),用文档里给的"角色/组织/目标/语气/术语/视觉原则/变体数(通常 3–5 个)"七要素填充。
- 编写并记录提示词——文案要给(信息/容器/约束/语气)、图像要给(主题/动作/背景/尺寸/风格)、数据可视化要给(类型/数据与异常值/列与总计/排序/坐标轴/图例/标签/尺寸)。
- 在 AI 工具里跑、填充原型——核心原则:不追求完美、不当最终输出、当成"内容假设生成器"。
- 协作与测试中修正——评审时同时讨论内容和提示词;若内容不符目标,要分清"是提示词写错,还是目标本身有问题";分歧大就做两版原型同时测。
- 快速迭代——最大价值:改提示词=重做内容成本极低,弱内容直接删。
- 最终由人完成高质量内容——文案需人工润色、视觉需设计判断、交互需专业经验。
Promptframe 的真正价值不在工具,而在于它强迫 UX 设计师把"为什么要有这段内容"讲清楚——垃圾输入永远只会得到垃圾输出。 注意事项:它是过程型交付物,不适合给高层看(不是决策展示材料);内容必改;遵守公司 AI 政策。对一人 UX 团队尤其有用(没有内容策略师/UX Writer/视觉资源时)。
4.4 用提示设计界面的 5 个修复法(Using Prompts to Design Interfaces)
问题根因:人会自动理解背景,AI 不会。 让 AI 设计学员主页,提示详细→接近人类设计师水平;提示笼统→完全不可控。AI 最常犯的错是乱堆组件——它知道每个组件是什么,但不知道哪个更重要、彼此什么关系。
模糊提示导致的 5 类典型病(对 PM 看 AI 生成稿时的体检清单):① 页面塞满但找不到重点;② 同一内容重复出现("认证进度"显示两次,AI 不懂"显示一次就够");③ 内容顺序违反"先整体→看现状→看下一步"的阅读习惯;④ 最大最显眼的反而不重要;⑤ 一个次要数字占半屏(AI 不懂"信息密度")。
| 修复法(EN / 中) | 怎么做 | 例子 / 注意 |
|---|---|---|
| 1. Precise Visual Keywords 用精确视觉关键词 | 别用"简洁/现代/好看"这种感觉词,用有明确含义的风格名 | ❌"设计一个时髦的会议落地页" → ✅"高对比度、块状布局、大胆色彩" → 👏"新粗野主义 neobrutalism 风格" |
| 2. Lightweight Visual References 给轻量参考图 | 喂 Pinterest 风格板或现有设计系统截图 | 注意:外观相似 ≠ 设计就好(Figma Make 套 Material 3 看着像,但层级/间距/易读性差) |
| 3. Visual Analysis with AI 先分析后生成 | 先让 AI 分析现有页面的视觉/结构特点,再把这段分析当新指令 | 提示:"作为经验丰富的设计师,详细分析这个界面的视觉风格和布局,非常技术化,用简短描述性关键词,不要完整句子" |
| 4. Generate Mock Data 用真实/仿真数据 | 有真实字段和结构时,AI 才好分组、排优先级 | 拿不到真数据先让 AI 生成假数据做设计,后面再换;设计师要和研发、内容团队配合拿真数据 |
| 5. Attach Code Snippets 附代码 | 引用真实设计系统代码(如 Shopify Polaris)最精确 | 缺点:设计师得懂代码、代码太长会拖慢模型;注意版权——可见代码不一定可自由复用,坚持用自家/共享设计系统/开源组件 |
结论:AI 能加快速度,但不能替你做决定。 这些技巧只能让结果更准确,不能替代真正的设计判断——前提永远是"你自己得知道想要什么"。
五、AI 助手定位:它在团队和产品里到底扮什么角色
5.1 AI 作为 UX 助手的 4 个角色(AI as a UX Assistant)
2023 年 7–8 月调查 841 名 UX 专业人士(92% 已用生成式 AI,平均用 2 种工具:ChatGPT 90%、Midjourney 32%;78% 工作+个人都用;680 人中 63% 每周至少用几次)。把 30 种任务归成 4 个角色:
| 角色(EN / 中) | 占比/地位 | 干什么 |
|---|---|---|
| Content Editor 内容编辑器 | 最常见(>75%),最主流 | 写/改微文案(错误消息、导航标签、帮助文本)、新闻稿、扩写总结现有内容 |
| Research Assistant 研究助手 | 约半数 | 文献研究(学新主题、找最佳实践、了解复杂领域如 KYC)、用户研究(生成研究文档、总结洞察、写报告) |
| Ideation Partner 创意伙伴 | 38%(打破"空白页恐惧") | 头脑风暴情境/结果、角色扮演(让 AI 扮特定用户)、验证创意找盲点 |
| Design Assistant 设计助手 | 最少(24%) | 生成/编辑图像视频、做用户角色/故事板/线框/原型/旅程图、配色建议 |
为什么文本生成压倒多媒体(p<0.001)? ① UX 工作本就大量写作;② 专用于 UX 的 AI 支持有限(文本工具成熟、UX 多媒体工具还早期);③ 很多人还不会用 AI 做特定 UX 任务。数字佐证局限:6% 用 AI 生成原型角色,仅 0.5% 用 AI 做用户旅程(后者需更多细节信息)。另外数据隐私也限制使用——要花时间改 AI 生成内容来保护隐私,且希望 AI 别拿输入去训练。
5.2 AI 作为创意伙伴(AI as a Creative Teammate)
2025 年 Fabrizio Dell'Acqua 团队在宝洁(P&G)做的 776 人实验,四组对比创意质量(盲评):①个人无 AI、②小组无 AI、③个人用 AI、④小组用 AI。
| 对比 | 结果 |
|---|---|
| 无 AI:个人 vs 小组 | 小组显著更好(协作激发更全面思考,符合预期) |
| 个人用 AI vs 无 AI 的任何人(个人或小组) | 个人用 AI 平均更高——即使独自工作,AI 也提供类似"头脑风暴"的支持 |
| 个人用 AI vs 小组用 AI | 小组用 AI 仍略优——AI 和团队协作不是二选一,可互相增强 |
| Top 10% 顶尖创意里谁占比最高? | "小组用 AI"最高,甚至超过"无 AI 小组"——AI 提升了个人水平,但产出"最佳创意"上小组协作仍不可替代 |
怎么让团队协作用 AI:目前大多数生成式 AI 是为"个人使用"设计的,所以即便个人会用,很多团队也没经历过"AI 协作引导的创意工作坊"。要有效用,得把 AI 当团队成员而非纯工具,需要有意识的引导方式。AI 最适合参与"创意生成"环节,不适合强调真实性/准确性的任务(如数据分析)——因为会幻觉。
对 PM 的决策:别把 AI 只发给个人,设计"团队 + AI"的协作流程能多吃一截价值,尤其在追求"最佳创意"时。
5.3 ChatGPT Agent 初评:成功、不稳、慢(Initial Impressions of ChatGPT's Agent)
测试任务:故意用普通人不精确的口吻"帮我在休斯顿某地址附近订一家适合商务午餐的餐厅,下周五中午"。看 AI 在信息不足时表现如何、会不会主动追问。
| 步骤 | ✓ 成功 | × 问题 |
|---|---|---|
| 起手 | —— | 没问任何澄清问题就直接执行(没问预算/几人/交通/饮食限制) |
| 1 搜餐厅 | 自动关弹窗/锚点干扰、截图记录关键页;给 3 家+对比表(菜系/氛围/距离/理由) | 用了 6 分钟、调用 96 个信息源;缺菜单和价格;链接跳转不一致 |
| 2 访官网 | 花 55 秒解决后继续 | 被错误重定向到 Google 地图 |
| 3 确认人数 | 后续表现惊喜 | 用户说"两人,其中一人贝类过敏",AI 没追问是谁过敏 |
| 4 填表 | 聪明处理过敏(默认是用户本人,选"贝类过敏");搞定不友好的滑动按钮和顶部"保存/取消" | 整整 11 分钟(人类约 2 分钟);最初错选 12:15 后纠正 |
| 5 填个人信息 | 自动停下让用户接手(人在回路 human-in-the-loop,不擅自处理敏感数据) | 窗口分辨率低、不能放大,体验差 |
| 6 提交前 | 交回控制后花 1 分钟复查表格,问"我现在可以提交吗?"(决策门 decision gate,高风险操作前要确认) | —— |
| 7 确认 | 虽超时(超过网站 10 分钟保留时限),餐厅仍接受并发确认邮件 | —— |
总评:能完成、能处理复杂网页和过敏信息、保持人在回路不崩溃;但缺澄清意识、耗时长、突发情况处理弱、支付/身份等高风险必须人接手(削弱了替代价值)。
对 PM 的两个可复用模式:human-in-the-loop(人在回路)= 遇敏感数据自动停手交人;decision gate(决策门)= 不可逆/高风险操作前必须显式确认。这两个是 AI Agent 类产品的安全基线。
5.4 Google AI Mode 评测:能力强,可用性差(Powerful Search, Poor Usability)
Google AI Mode = 把传统网页搜索的广度 + LLM 推理结合的搜索功能(类似 Perplexity,强调多媒体和来源引用)。技术核心两招:查询扇出 Query Fan-out(把一个需求拆成多条子查询,如"奥克兰最好的墨西哥美食"→自动搜"顶级玉米卷饼店""优质墨西哥餐厅")+ RAG(检索增强生成,先查外部数据再生成,提准确性)。
研究观察 7 名用户自由探索。优势:对话式(可点的后续问题)、超级搜索(自动化+整合)、集成 Google 生态(Maps/Shopping/YouTube,点选项展开交互式侧面板含特定日期报价)。但暴露 7 个严重可用性问题:
| # | 问题 | 细节 |
|---|---|---|
| 1 | 可发现性差 | 入口多(首页按钮/结果页标签/AI Overview 底部按钮)但用户根本注意不到;7 人里 4 人此前从没主动用过——已习惯传统搜索,直接忽略新元素 |
| 2 | 命名模糊、与其他 AI 产品混淆 | Gemini(独立 AI 聊天)/ AI Mode(搜索内置)/ AI Overview(结果页自动摘要)三者用户分不清 |
| 3 | 引导信息缺失 | 欢迎页的提示("问详细点答案更好")没人看到——用户从地址栏直接搜,绕过引导页 |
| 4 | 回答过长且格式乱 | 冗长无层次,用户略读甚至放弃;建议加粗体/标题/列表/折叠段 |
| 5 | 长对话里找信息难 | 越聊越长找不回之前内容(找 LG 冰箱那位翻半天放弃,索性让 AI 再给一次链接);建议加跳转/目录/历史 |
| 6 | 顶部标签导航不符预期 | AI Mode 和"视频/图片/购物/地图"标签放一起,但那些是筛选内容类型,AI Mode 是用 AI 回答——放这里让人搞混 |
| 7 | 幻觉仍在 | 冷门话题仍编造(给的神经科学论文和作者根本不存在);专家能察觉、普通用户难辨 |
对 PM 的决策:再强的能力,可发现性 + 命名清晰 + 可扫读排版跟不上,用户也用不起来。新功能塞进老界面尤其要解决"用户为什么会注意到、会不会和旁边的东西混淆"。
5.5 为什么用户在 GenAI 与搜索间来回切换(Why Users Switch)
一句结论:GenAI 更适合"理清问题、整合信息";传统搜索更适合"核实关键事实、建立信任"。两者分工互补,不是替代。 研究里 9 人中 6 人在两者间来回切。
| GenAI 何时更好(理清+整合) | 搜索何时仍赢(核实+信任) |
|---|---|
| 问题模糊——先聊一聊让方向清楚(AI 当起点,从大问题收敛;买 Kindle 的人先问"哪里有免费书"再追问) | 验证机制——先用 AI 拿摘要/候选,再用搜索逐个核对官网("This is where ChatGPT can begin to lose its charm") |
| 约束多——超过两三个条件塞搜索框很难说清,AI 处理 3–4 个约束比 Google 好 | 价格与硬事实——涉及具体价格/数字/参数,不全信 AI,用搜索确认最新准确数据(怕被过时信息或"起步价"误导) |
| 降努力——减少 interaction cost(为答案付出的点击跳转浏览),AI 聚合多源直接给最相关部分 | 风险越高越靠搜索——大额消费/健康信息,越重要越直接看可信网站("花大钱买车要真搞清楚",健康信息"想看大学或政府网站源头") |
| 减工作记忆负担——把信息集中到一个对话,免去"记忆/记笔记/page parking 先开着网页稍后看";熟练用户还让 AI 出表格对比 | 引用也未必建信任——即便给链接,用户仍困惑"哪句结论对应哪个来源",对应不清时宁愿回搜索逐个看 |
| 总结评价——不想逐条读专业评价,让 AI 给整体口碑("get to the point, is it worth keeping or not?");像"不推销的懂行销售顾问" | 专业/学术主题——怕 AI 虚构引用、读不到付费墙,更用 Google Scholar/论文,AI 只"帮忙想方向"不"代替研究" |
不用 AI vs 用 AI 的信息整合差别:不用 AI 要先 Google 再分别开权威网站、手动抄数据对比(慢、记不住);用 AI 直接给精炼候选并能按难度/优缺点整理,熟练用户要求出表格让对比一目了然。
对 PM 的决策:别想用 GenAI 取代搜索的全部场景。设计上要支持用户在两种模式间顺畅切换(尤其在"高风险/要确认价格事实"时给清晰的回搜索/看来源路径),并把"结论—来源"的对应关系做清楚,这是当前信任的最大缺口。
源自 NNGroup Topics / Artificial Intelligence - AI人工智能(产品与界面设计子集,20 篇)。研究方法与团队实践见 NNGroup 用 AI 做 UX 研究 + AI 时代设计师能力(12 篇 · 加速研究/规划研究/造模拟表格/合成用户红线/评估 AI 模拟行为/方法论陷阱/GenAI 工作原理/重定义设计技能/通才回归/AI 素养);伦理/全球化/新兴模式见 NNGroup 交互模式·伦理·全球化·新兴技术(15 个模式 · 欺骗模式/潜入/危险UX · 包容性设计 · 全球化跨文化/语言切换/尺码/全渠道 · VR-AR/GenAI提示控件 · 用户自主性 · UX文案长度/推荐内容);本批多处呼应 Jakob Nielsen 十大可用性启发式(标准图标+标签、错误预防、识别优于回忆、系统状态可见性),见 NNGroup 可用性测试与十大可用性启发式(10 条启发式完整表 · 复杂应用应用 · 用户愉悦层级 · 测试方法 5 人法则/招募/远程/任务场景/分步任务/态度vs行为/4步分析/小样本误差/竞争性评估)。图片/视频/原档保留在 sources。
来源与关联资料
- NNGroup 用 AI 做 UX 研究 + AI 时代设计师能力(12 篇 · 加速研究/规划研究/造模拟表格/合成用户红线/评估 AI 模拟行为/方法论陷阱/GenAI 工作原理/重定义设计技能/通才回归/AI 素养)
- NNGroup 交互模式·伦理·全球化·新兴技术(15 个模式 · 欺骗模式/潜入/危险UX · 包容性设计 · 全球化跨文化/语言切换/尺码/全渠道 · VR-AR/GenAI提示控件 · 用户自主性 · UX文案长度/推荐内容)
- NNGroup 可用性测试与十大可用性启发式(10 条启发式完整表 · 复杂应用应用 · 用户愉悦层级 · 测试方法 5 人法则/招募/远程/任务场景/分步任务/态度vs行为/4步分析/小样本误差/竞争性评估)