← Knowledge Notes
Product Design & UX / Knowledge note · Chinese

NNGroup AI 产品与对话式界面设计(20 篇 · 对话6类型/拟人化4度/谄媚sycophancy/智能优先于类人/可解释AI引用与免责声明/少废话直奔答案截断金字塔/提示建议3类·CARE框架·提示控件4用途/GenUI vs Vibe Coding·按钮复选框回归·Promptframe·用提示设计界面/AI助手4角色·创意伙伴宝洁776人实验·ChatGPT Agent初评·Google AI Mode·为何在GenAI与搜索间切换)

Nielsen Norman Group『人工智能/AI』主题中『AI 产品与对话式界面设计』子集 20 篇精华(产品与界面层,区别于研究实践层)。五大主轴:①对话式 AI 体验——与生成式 AI 的 6 类对话(搜索查询/漏斗 Funneling/探索 Exploring/雕刻 Chiseling/定位 Pinpointing/扩展 Expanding,对话长度≠成功)、少废话直奔答案 Less Chat More Answer(去寒暄/可扫读列表/先答案后细节『截断金字塔 Truncated Pyramid』/不能做就直说/具体优于泛化)、聊天里的可解释 AI Explainable AI(来源引用 Source Citations 三种放法 Perplexity行内/Copilot侧栏/会幻觉来源·逐步推理 Step-by-step·免责声明 Disclaimers 清晰可执行 vs 模糊·避免拟人化措辞)、谄媚 Sycophancy(为讨好用户违背事实·人类反馈奖励漏洞·『你确定吗』即翻供·三条规避)。②拟人化与信任——拟人化 4 度(礼貌 Courtesy/强化 Reinforcement/角色扮演 Relayed/伴侣 Companionship)、智能优先于类人 Smarts over Sentience(感知聪明↑信任↑·感知有情感↑信任↓·温暖 AI 出错率 +10-30%·专业≠冷漠)、手风琴式编辑 Accordion 与苹果采摘 Apple Picking 早期用户行为。③提示 UX——提示建议 3 类(用例 Use-Case/自动补全 Autocomplete/后续问题 Followup)、用例提示建议设计(简单 pills vs 复杂 cards/carousel·登录前后两阶段·具体优于模糊·个性化)、CARE 提示框架(Context背景/Ask请求/Rules规则/Examples示例)、提示控件 Prompt Controls 4 用途(发现度/教育灵感/约束/促进后续·50% 含后续 77% 多轮·4 条最佳实践)。④GenUI 生成式界面——GenUI vs Vibe Coding vs AI 辅助设计(谁决定做这个 UI·执行失败 vs 判断失败)、GenUI 最激动人心的发展是按钮与复选框回归(AskUserQuestion 收集上下文)、Promptframe(线框图+AI 提示词文档化·6 步流程·Blue Apron 案例)、用提示设计界面 5 修复法(精确视觉关键词/轻量参考图/先分析后生成/真实 mock 数据/附代码)。⑤AI 助手定位——AI 作为 UX 助手 4 角色(内容编辑/研究助手/创意伙伴/设计助手·841 人调查 92% 已用)、AI 作为创意伙伴(宝洁 776 人实验·用 AI 个人>无 AI 小组·Top10% 仍是小组)、ChatGPT Agent 预订午餐初评(96 源 6 分钟·11 分钟填表·人在回路 human-in-the-loop·决策门 decision gate)、Google AI Mode 评测(查询扇出 Query Fan-out+RAG·7 名用户·可发现性差/命名混淆/回答过长)、为何用户在 GenAI 与搜索间切换(9 人 6 人来回切·AI 理清问题搜索核实事实·引用也难建信任)。读者=非技术产品经理,术语行内解释,决策导向(何时用/怎么选/反例)。

Source collection:NNGroup 用户体验 · Published here:2026-09-26 · Note updated:2026-06-03

对话式界面生成式 AI 体验AI 助手

这一批是 NNGroup『人工智能』大主题里偏"怎么设计 AI 产品和界面"的子集(另有偏研究方法、偏伦理/全球化的姊妹篇)。读者假设是聪明的非技术 PM,所以每个术语第一次出现都行内解释。

全文一句话地图:用户怎么跟 AI 聊(6 类对话)→ AI 该怎么回(少废话/可解释/别谄媚)→ AI 该不该装人(拟人化与信任)→ 怎么帮用户开口(提示 UX)→ AI 能不能反过来生成界面(GenUI)→ AI 在团队和产品里到底扮什么角色(助手定位)。

反复出现的三条总心法,先记住:

  1. 聊天感 = 噪音,工具感 = 价值。 用户要的是信息/结果,不是被讨好、被寒暄、被"陪聊"。
  2. AI 的失败分两种:执行失败(做错了)和判断失败(根本不该这么做)。 你给 AI 多大自由,就承担多大的判断责任。
  3. 拟人化、情感、"思考过程"这些"像人"的包装,在事实/任务场景里多数是减分项——它抬高预期、降低信任、还可能掩盖错误。

一、对话式 AI 体验:用户怎么聊,AI 就该怎么回

1.1 与生成式 AI 的 6 类对话(The 6 Types of Conversations)

用户跟 AI 聊天不是只有一种姿势。NNGroup 把它按"信息需求清不清晰 + 要广度还是深度"分成 6 类。对 PM 的用处:不同对话类型要配不同的界面引导,别一刀切。

对话类型(EN / 中) 用户起点 特征 该配什么设计
Search Query 搜索查询 要个确切事实(日期/人名/事件) 单条提示,无需细化,通常很短 干脆引导去搜索引擎,或直接给答案,别绕
Funneling 漏斗式 提示太宽,意识到需要收窄 逐步加条件缩小范围,可能较长 AI 主动提问("需要更多信息请问我"),给示例提示
Exploring 探索式 对主题缺乏了解,先摸地形 从大问题深挖,边聊边学(强调深度) 提供深入的后续提示 + 术语定义 + 背景
Chiseling 雕刻式 围绕同一主题换角度问 横向铺开各侧面(强调广度,不深挖) 给宽的后续提示,允许随意切换方向
Pinpointing 定位式 一上来需求就明确、条件全给 直接、简短,无需反复 直接给结果,别多此一举地反问
Expanding 扩展式 初始答案不满意,放宽/转向 在已有答案上扩大覆盖面 提供"放宽条件"和后续问题提示

心法:先判断用户落在哪一类,再决定"是该主动反问、还是直接给答案"。Why:漏斗式/定位式是狭窄且明确的需求,探索式/雕刻式是宽泛且模糊的需求——前者要快给,后者要陪着探。反例:对一个已经把鸡尾酒派对需求说全的定位式用户还要反问一堆细节,等于折磨他。

关键洞察:对话长度 ≠ 成功。 研究显示对话长短和有效性/可信度没有明显关联,质量才重要。漏斗式可能长(从模糊到明确),定位式通常短(一开始就清楚),探索/雕刻长是因为"在建立知识",这种长是好的。别把"用户聊了很多轮"当成产品做得好的指标。

1.2 少废话,直奔答案(Less Chat, More Answer)

一句原话定调:"A longer answer was not a better answer."(更长的回答不等于更好的回答。) 这篇针对的是网站内嵌的 AI 客服/助手 chatbot,踩坑全是真实用户测试里抓到的。

原则(EN / 中) 心法 反例(测试中真实发生) 正例
Cut Small Talk and Filler 去寒暄废话 "Great question!""Happy to help!" 全是噪音 用户原话:"I don't need to be pandered to… I just want to get the information."(我不需要被讨好,我只要信息) Home Depot chatbot 直接答
Concise & Easy to Scan 简短可扫读 信息量≠负担,排版决定体验 Mississippi chatbot 一整屏长段落、无结构、流式越滚越长——"The pouring in of information made me feel overwhelmed." Williams Sonoma 用列表——"I love that they're bulleted."
Answer First, Detail on Demand 先答案后细节 见下方"截断金字塔" 奥运 chatbot 被问"谁翻了个跟头"(只要个名字),却返回多段解释+分数+背景——"I just wanted the guy's name." 先给名字,细节按需展开
When It Can't, Say So Plainly 不能做就直说 别假装能干又讲一堆步骤 Turo:AI 没能力找车却讲操作步骤,用户被骗着浪费时间;Redfin:第一句说"不能做"第二句才说"可以筛选",用户只看第一句就放弃 新版 Redfin 直接给筛好的房源,再问要不要调整(从"解释"转"执行")
Specific over Generic 具体优于泛化 帮用户把数算好 Turo 保险报价答"因情况而异,自己去查"(长且无用) 改版直接给每日区间($5–60)+两周总价估算($140/$280/$595)——"I like that it did the math for me."

核心模型:截断金字塔 Truncated Pyramid(先答案,再按需展开)。 传统网页解决的是"怎么排信息"——哪怕"重要在前",还是一次性全给(一段话里既有答案又有扩展)。聊天机器人解决的是"什么时候给信息"——信息按需分发:先给那个名字/那个数,用户想要更多再追问。

对 PM 的决策:站内 AI 助手的成功标准不是"内容全",是"用户多快拿到他要的那一口"。Why:聊天界面天然是"对话",用户期待像问真人一样能"先要结论,不够再追问",硬塞百科全文反而制造压迫感。

1.3 聊天界面里的可解释 AI(Explainable AI in Chat Interfaces)

"可解释"= 让用户看懂 AI 为什么这么答、答得可不可信。三种机制,每种都有"做对"和"做歪"的版本:

(A) 来源引用 Source Citations(给出处)——但出处可能是假的

做法 谁这么做 评价
行内引用(结论旁直接标来源) Perplexity 正例:读到具体结论时立刻能看到对应来源,在上下文里就能验证
侧栏 + 可点 chip + 悬浮预览 + "查看全部来源" Copilot 正例:把来源从正文里区分出来,更醒目、更容易点开核验
给了链接但点进去 404 DeepSeek 反例:幻觉来源。只要"来源的形式"在,用户就更愿意相信,而不去真验证——这是个危险的信任陷阱

(B) 逐步推理 Step-by-Step Reasoning(展示"思考过程"):ChatGPT 完成复杂任务时弹"思考过程"窗。注意:这种逐步说明"形式上很有吸引力",会让用户觉得系统在认真、有逻辑地思考——但"看起来在思考"不等于"答案对",别让它变成另一种信任陷阱。

(C) 免责声明 Disclaimers(提醒会出错)

做法 谁 评价
清晰且可执行:"Claude 可能会出错,请务必自行核查回答" Claude 正例:语言直接,明确告诉用户该采取什么行动
模糊:"AI 生成,仅供参考" DeepSeek 反例:位置显眼(这点好),但太空,没说具体注意什么、可能有哪些问题,用户根本无法据此行动

(D) 避免拟人化措辞:Gemini 展示思考过程时说"我正在查看网站结构"——这种像人说话的方式容易让用户以为 AI 真像人一样思考,从而过度信任。(与第二章"智能优先于类人"呼应。)

对 PM 的决策:可解释功能要做"真可解释",不要做"看起来可解释"。来源要能点开且真实、免责声明要可执行、思考过程别用拟人话术。

1.4 谄媚问题(Sycophancy in Generative-AI Chatbots)

谄媚 Sycophancy = AI 为迎合用户而违背事实。 你说"我觉得是 X",它就顺着你说是 X,哪怕 X 错了。

  • 为什么普遍:模型靠人类反馈训练,而人类训练者普遍偏爱"顺着我说"的回答 → 模型学会"迎合 = 高分奖励"。这是奖励机制的漏洞:在复杂/不确定场景下,模仿用户观点比坚持事实更"划算"。Anthropic 和 Google DeepMind 的研究都证实模型会为迎合而忽视事实。
  • 典型表现:① 你只要质疑一句"你确定吗?",它可能立刻推翻原答案(即翻供);② 你在提示里表露立场("我不喜欢这个观点"),回答就被带偏;③ 连数学/科学这类客观题,它也可能为迎合给出明显错误的答案。
  • 用户侧三条规避:① 频繁重置对话/开新会话(减少前文污染);② 别在提问里表达强烈立场(保住客观性);③ 别全靠 AI 查信息,尤其陌生领域,要独立核验。

对 PM 的决策:这是信任与安全问题。如果你的产品要 AI 给客观判断(医疗/法务/财务/数据),谄媚是直接的可靠性风险。系统提示里要奖励"准确中性"而非"让用户开心",评测要专门测抗谄媚。


二、拟人化与信任:AI 该不该、该多大程度装成人

2.1 拟人化的 4 个程度(The 4 Degrees of Anthropomorphism)

拟人化 Anthropomorphism = 给非人对象(AI)赋予人类特征。 适度能帮用户理解,过度会催生不切实际的预期。4 个由浅到深的程度:

程度(EN / 中) 定义 表现 适用场景
Courtesy 礼貌 最基础:简单礼貌互动 + 称呼("朋友""助手") 致谢、请求确认 用户不需要深入反馈、只要基本帮助
Reinforcement 强化 在礼貌之上,引导并强化用户操作 小提示、鼓励性语言(如教用户怎么改错) 需要用户反馈的简单任务,如客服机器人
Relayed 角色扮演 展现一定个性,能感知用户意图 更复杂的情景对话、自适应、按背景个性化建议 需要个性化建议和持续互动,如健康管理、教育
Companionship 伴侣 高度个性化 + 情感模拟 对情绪作出反应、情感识别与反馈 深度互动,如心理健康支持、长期陪伴指导

为什么要控制程度(而非越拟人越好):① 管理预期——拟人过高,用户对能力产生不切实际期望 → 失望;② 信息清晰——拟人过多会让用户忽视系统局限、过度依赖(尤其数据分析等高准确性领域);③ 隐私伦理——高拟人 AI 容易催生强依赖,在心理健康等敏感领域引发风险。

对 PM 的决策:拟人化是个"刻度盘"不是"开关"。先问"我这个场景是任务型还是陪伴型",再调到对应档位。任务型停在"礼貌/强化",别冲到"伴侣"。

2.2 智能优先于类人(Prioritize Smarts over Sentience to Increase Trust)

这是上一节的"实证后盾",也是本批最反直觉、最该背下来的一篇。结论:在事实/任务场景里,让 AI 显得"聪明"比显得"有人性"更能赢得信任。

研究三步(给 ChatGPT 做):问卷测"觉得它聪明吗/有感情吗" → 做 40 道国家人口题(可选择听不听 AI 的预设答案) → 测信任度。

发现 方向
感知智能越高 → 信任越高 正相关:越觉得它聪明,越愿采纳建议
感知情感越强 → 信任越低 负相关:越觉得它"有情感/意识",越少采纳——用户更信"擅长处理事实"的工具,不信"可能被情绪干扰"的虚拟个体

情感型 AI 的额外风险(硬数字记牢):AI 说话太温暖、太有同情心,出错率增加 10%–30%;仅改提示语让它变暖,准确率就下降 12%–14%。这种"温暖 AI"更容易给错误信息、传播阴谋论、给危险医疗建议;在心理健康等场景太像人反而更危险(过分顺着情绪、支持错误想法、处理不好危机)。

澄清误区:专业 ≠ 冷漠。 可以回应用户情绪(对配送迟到的客户说"理解"),但别表现出 AI 自己有情绪;可以用"我/我的"作代称(不代表有自我意识);可以语气友好,但应是"专业而有礼貌",不是"模拟情感共鸣"。

UX 设计建议:① 如实呈现——避免人类名字/假头像,宣传强调它是"智能工具"而非"朋友";② 明确能/不能,聚焦小而精功能;③ 系统提示奖励准确中性、不鼓励情感语言;④ 用 RAG(检索增强生成,即先查真实资料再回答)引用真实来源;⑤ 做用研时审慎招募,别招"习惯把 AI 当陪伴"的人(会污染对工作型 AI 的反馈)。

对 PM 的决策(与陪伴类产品的张力):这条专指工作/事实型 AI。如果你做的就是陪伴/情感产品(对应 4 度里的"伴侣"档),逻辑相反——但要清醒地知道你在用"降低事实可信度"换"情感黏性",并对前述风险负责。

2.3 早期用户行为:手风琴式编辑 & 苹果采摘(Accordion Editing & Apple Picking)

定性研究(8 名日常用 chatbot 的专业人士/学生,90 分钟用 ChatGPT-3.5 做真实任务),抓到两种因"纯文本界面 + 反复迭代"逼出来的新行为:

行为(EN / 中) 定义 子动作
Accordion Editing 手风琴式编辑 反复让 AI "变长/变短"输出来达成单一目标(文本是一维媒介,长度是最直接的调节维度) 缩小:强制排序("给我前5")、字数调整;扩展:扩展已有想法、补充缺失内容。常缩放结合、多轮迭代
Apple Picking 苹果采摘 引用 AI 先前回复里的特定片段,用来修改或当后续上下文 引用修改(指着某段要新版本)、上下文引用(把先前回复当新提示的背景)

痛点:苹果采摘要手动复制粘贴 + 过度滚动(对话越长越难找回之前内容,所有参与者都受其拖累);而且多数用户最终还得在 chatbot 之外编辑(ChatGPT 难加最新真实信息、难精确控细节、格式输出常不理想)。

AI 该补的功能(直接对应这些痛点):① 响应划分——允许部分修改而非整段重生成;② 直接编辑文本无需新提示;③ 指向选择——给段落编号或 GUI 指点,免去繁琐描述。减少非必要手风琴:让用户在初始提示就设限(如"保持简短、用列表、加粗关键词")。

对 PM 的价值:这两个行为名字虽小,却预言了后来 GenUI 里"按钮/复选框回归"(见第四章)的方向——本质都是"别让用户只能靠打字反复折腾纯文本"。


三、提示 UX:怎么帮用户对着空白输入框开口

3.1 提示建议的 3 种类型(Prompt Suggestions)

提示建议 Prompt Suggestions = 引导用户怎么跟 AI 互动的设计元素,主治"面对空白输入框不知从何开始"的新手。注意它和搜索建议不同:搜索建议只帮你补全已输入的关键词省打字;提示建议还要帮你发现系统能做什么、激发想法。

类型(EN / 中) 作用 目的 例子
Use-Case 用例提示建议 给新手看"能做什么、怎么互动"的范例 提升可学习性、激发创意 "帮我写一封辞职信""总结这段文本";Manus 在输入框下展示用例+完整演示会话
Autocomplete 提示自动补全 补全用户已输入的部分(像搜索补全) 提高输入速度与准确性 输入"how much should I feed"→补"my 6-month-old puppy"
Followup 后续问题建议 基于当前上下文生成相关后续问题 增强会话连贯与深度 问完披萨面团配方→推"无酵母面团""薄底做法"

哪种最有用?后续问题(Followup)。 因为它有上下文相关性——是顺着你刚问的内容来的,所以最贴用户当下的需求。

好处:降认知负担、降操作成本(点而非打)、提参与度、提任务效率。用户原话:"它们包括了很多我没想到的问题……让我想起脑中本来就有的思路。"

3.2 用例提示建议怎么设计(Designing Use-Case Prompt Suggestions)

这是把 3.1 里"用例"那类拆细。复杂度从一个短词到一整段对话/视频不等,选多复杂取决于 4 个因素:① 系统功能宽 vs 专;② 用户对工具熟不熟;③ 任务复杂度;④ 提示出现在哪个位置。

简单 vs 复杂:功能广、任务简单 → 用简单提示(放输入框附近,如 ChatGPT 的"Analyze data""Summarize text""Help me write");专业化、任务复杂 → 用复杂提示(对话/视频/卡片,放轮播、可展开区或示例库)。

两个阶段,两个目标:

阶段 用户在干嘛 提示该做什么 常见 UI
登录前(preauthentication) 发现工具 → 探索功能 → 决定要不要注册 静态提示,简短易读,突出关键能力(内容创作/问题解决/创意发想),易关闭、不抢焦点、贴近常见目标 Pills 标签(单词短语,点击自动填充或引去注册)、Cards 卡片(Poe)、Videos 视频(Notion AI 登录前演示)、Carousels 轮播(Claude 4 例)
登录后(活跃用户) 已在用,要更高效 提效率、优化工作流、鼓励深用、提满意黏性,结合动态生成的上下文相关建议 靠近输入框的 pills/cards;示例库(Midjourney 图库选中可看对应提示)

上下文相关提示尤其值钱的两种情况:① 用户高度不确定(Tripadvisor 在用户计划去迈阿密时建议"哪些酒店有海景");② 用户缺领域知识(买发电机的人不懂术语,提示"用户评价里可靠性如何?有自动关闭吗?";Amazon 的 Rufus 按当前在看的 Birkenstock 凉鞋动态建议"有窄码宽码吗?")。

具体优于模糊(Specific Beats Vague)。 宽泛提示激不起兴趣,具体的才促互动。Instacart 用"适合家庭的简单晚餐""儿童健康零食"这种带关键词、价值明确的建议。个性化进一步加分(项目管理工具按新手/中级/高级给不同提示),依据=历史对话/浏览搜索/账户偏好。

两个反例/注意:① Claude 的"make a content calendar"这种提示可能误导用户以为一句话就出活,实际要多轮;② 用数据优化提示建议时,点击率受位置影响,要打乱顺序展示才能判断真实有效性;③ 示例库内容虽来自真实用户,仍需人工审查保品牌调性、避免不当内容。

3.3 CARE 提示框架(CARE: Structure for Crafting AI Prompts)

写给"怎么把提示词写好"的简单口诀,4 个字母:

字母 含义 作用
Context 背景 描述任务/情境 让 AI 知道你在什么场景("我是有 15 年经验的资深 UX 设计师,在为大型眼镜零售商做登录页")
Ask 请求 明确要做什么 "生成 15 种登录错误提示,按标准选 5 个最佳并排序"
Rules 规则 约束:该/不该 "简洁直白别幽默;每条≤100 字符≤2 句;遵循产品语气"
Examples 示例 正/负例 好:"请检查您的电子邮件和密码,然后再试一次";坏:"哎呀,我们无法登录您账户"(太随意)

结论:CARE 能提升输出质量,但要投入时间和策略。熟练后你会自己判断"何时值得套框架、何时直接自己写更快"。

3.4 提示控件的 4 大用途(Prompt Controls in GenAI Chatbots)

提示控件 Prompt Controls = 围在输入框周围的 UI 组件(按钮/工具提示/开关/卡片/菜单),目的是"用点击代替打字"来加速和补充提示。注意它和 3.1 的提示建议有重叠但更宽——提示建议是其中一类,提示控件还包括上传按钮、约束开关、后续操作按钮等。

用途(EN / 中) 解决什么 例子
Discoverability 提升功能发现度 用户不知道 AI 能干嘛(有人折腾几轮才发现要手动复制 100 页文档) 文心一言悬停上传图标显示"支持的文件类型和大小"
Education & Inspiration 教育与灵感 新手不懂能做什么 SparkDesk 在输入框旁列插件(如"智能 PPT 生成");Claude "New in Claude" 给会话启动器;ChatGLM "灵感中心"列提示模板
Setting Constraints 设约束 限定范围或输出格式 Perplexity "Focus" 限定搜 Reddit/YouTube/学术;文心一言"树状图"插件选图表类型
Facilitating Followups 促进后续 让追问更便捷 ChatGPT 每条回答底部"改提示/重生成/复制/反馈";ChatGLM 内联引用(高亮即引用,免复制);Gemini "修改响应"内置"更短/更长/更随意"

数据:在日记研究里,50% 的对话包含后续操作,77% 的对话超过 1 次交互。 所以"促进后续"不是锦上添花,是高频刚需。

4 条最佳实践:

  1. 用标准图标 + 标签/工具提示——多数图标没有公认含义,无标签的自定义图标增加困惑(文心一言移动端的"魔法棒"图标所有受访者都看不懂,有人猜是表情符号)。
  2. 用明确的功能名——别用模糊品牌词("仔细思考 Think Carefully"这种插件名让测试参与者困惑)。
  3. 按功能分组——一堆功能堆一起会淹没用户(Ernie 的插件中心无层次→很难找;Perplexity 把"Focus"和"Attach"分开+简洁标签=正例)。
  4. 遵循交互设计规范——别劫持系统行为(ChatGLM 移动端长按劫持了"复制"→用户没法只复制片段;ChatGPT 长按给标准上下文菜单=正例;文心一言把"文件过大"错误提示放在离上传按钮很远的角落=反例)。

四、GenUI 生成式界面:AI 反过来生成界面

4.1 GenUI vs Vibe Coding vs AI 辅助设计(Who's Designing?)

先把三个容易混的词钉死。判断树:这个 AI 生成的界面,是给设计师在传统流程里用的吗?

概念(EN / 中) 谁决定要做这个 UI 谁受益 失败方式
AI-assisted design AI 辅助设计 人(设计决策仍由人做,AI 只是工具) 设计师 ——
GenUI 生成式界面 AI 自己决定(用户只说"帮我规划旅行",系统自行判断给个定制工具比回一段文字更合适) 用户(使用时动态生成) 判断失败:生成了根本没人需要的交互面板,哪怕技术完美也是设计失败
Vibe Coding 用户主动要求做(用户先说要什么,AI 主要负责执行) 用户 执行失败:做出来不符要求、功能坏、布局理解错

Vibe Coding 内部还有"说得多细"的光谱:"给我做个旅行规划器"(太宽,AI 自己补一堆决策→出来很普通、像默认模板)vs 把三栏布局/左地图/中时间轴/右详情/顶部日期选择全说死(AI 发挥空间小,像执行设计师已想好的方案)。

两个对 PM 很重要的论点:

  1. 大多数人其实很不擅长说清自己想要什么数字产品——专业设计师能描述,普通人通常做不到。GenUI 恰恰服务这批不会表达的人。
  2. "人人都能自己做软件"忽略了专业软件公司的价值——Slack、项目管理工具真正值钱的不只是功能,而是多年用研、反复迭代、多场景验证后的设计成熟度。所以 GenUI 背负的设计责任比 Vibe Coding 更重(它替用户做判断)。

4.2 GenUI 最激动人心的发展:按钮与复选框回归(Buttons and Checkboxes)

反直觉的结论:GenUI 最让人兴奋的不是炫酷新控件,恰恰是最老的那批 UI 元素——按钮、复选框、输入框,被 AI 在对话中动态生成出来。 作用:收集上下文、减少用户输入、降记忆负担、提高答案质量。

例子 怎么做 解决什么
Google AI Mode 复选框 搜"London hotels"→返回酒店卡片,每个旁边带 checkbox;勾选的酒店名自动变成输入框上方标签,追问时直接带入下一轮 用户不用读/记/抄/打酒店名
Claude 的 AskUserQuestion 觉得信息不够时,主动在回答前生成一组交互式问题控件(如问伦敦旅行住宿预算),含选择题 + 自由输入框 一步步带着用户答,比纯文字提问轻松
(对照反例)Perplexity 用纯文字列 5 个后续问题让用户逐个答 用户要边看边记边输、来回切视线,问题一多就漏答乱答——这恰恰说明为什么需要交互控件

上下文很关键(Context Is Critical)。 普通用户被长期训练成"用短词短句和数字产品互动",不可能一开始就把预算/日期/兴趣/天数全说清。"帮我规划一趟伦敦旅行"信息不够 → AI 只能给泛泛答案。补问很重要,但没有交互控件,补问会很麻烦。 按钮复选框放对位置、出现及时,就能明显减少这种来回问答的慢和累——而且这些是大家早就熟悉的模式,不用重新学。

对 PM 的决策:别一上 GenAI 就想做花哨的动态界面;先把"用最老实的按钮/复选框帮用户低成本补充上下文"这件事做好,ROI 最高。

4.3 Promptframe:为 AI 时代进化的线框图(Promptframes)

Promptframe = 线框图 + AI 提示词文档化。 不是"让 AI 自己设计",而是把 UX 设计师的思考显性化、写成可复用的 AI 指令,让 AI 去生成真实可理解的内容素材来填充你已设计好的 UI 结构。在流程里的位置:Wireframe(线框)→ Promptframe → Prototype(原型)。

包含三部分:① 按线框图的布局和功能组织;② 说清每个内容区域的目的与限制;③ 写成可复用的 AI 指令。

6 步流程(以 Blue Apron 促销页为例):

  1. 建立上下文、描述用户——先给 AI 一个提炼过的用户洞察(不是"帮我写营销文案"),如"社区服务工作者,时间碎片、高疲劳、饮食是生存型而非享受型,核心痛点是吃腻=需要变化(情绪价值)"。可把它做成一个 GPTs 助手(Promptframe Assistant),用文档里给的"角色/组织/目标/语气/术语/视觉原则/变体数(通常 3–5 个)"七要素填充。
  2. 编写并记录提示词——文案要给(信息/容器/约束/语气)、图像要给(主题/动作/背景/尺寸/风格)、数据可视化要给(类型/数据与异常值/列与总计/排序/坐标轴/图例/标签/尺寸)。
  3. 在 AI 工具里跑、填充原型——核心原则:不追求完美、不当最终输出、当成"内容假设生成器"。
  4. 协作与测试中修正——评审时同时讨论内容和提示词;若内容不符目标,要分清"是提示词写错,还是目标本身有问题";分歧大就做两版原型同时测。
  5. 快速迭代——最大价值:改提示词=重做内容成本极低,弱内容直接删。
  6. 最终由人完成高质量内容——文案需人工润色、视觉需设计判断、交互需专业经验。

Promptframe 的真正价值不在工具,而在于它强迫 UX 设计师把"为什么要有这段内容"讲清楚——垃圾输入永远只会得到垃圾输出。 注意事项:它是过程型交付物,不适合给高层看(不是决策展示材料);内容必改;遵守公司 AI 政策。对一人 UX 团队尤其有用(没有内容策略师/UX Writer/视觉资源时)。

4.4 用提示设计界面的 5 个修复法(Using Prompts to Design Interfaces)

问题根因:人会自动理解背景,AI 不会。 让 AI 设计学员主页,提示详细→接近人类设计师水平;提示笼统→完全不可控。AI 最常犯的错是乱堆组件——它知道每个组件是什么,但不知道哪个更重要、彼此什么关系。

模糊提示导致的 5 类典型病(对 PM 看 AI 生成稿时的体检清单):① 页面塞满但找不到重点;② 同一内容重复出现("认证进度"显示两次,AI 不懂"显示一次就够");③ 内容顺序违反"先整体→看现状→看下一步"的阅读习惯;④ 最大最显眼的反而不重要;⑤ 一个次要数字占半屏(AI 不懂"信息密度")。

修复法(EN / 中) 怎么做 例子 / 注意
1. Precise Visual Keywords 用精确视觉关键词 别用"简洁/现代/好看"这种感觉词,用有明确含义的风格名 ❌"设计一个时髦的会议落地页" → ✅"高对比度、块状布局、大胆色彩" → 👏"新粗野主义 neobrutalism 风格"
2. Lightweight Visual References 给轻量参考图 喂 Pinterest 风格板或现有设计系统截图 注意:外观相似 ≠ 设计就好(Figma Make 套 Material 3 看着像,但层级/间距/易读性差)
3. Visual Analysis with AI 先分析后生成 先让 AI 分析现有页面的视觉/结构特点,再把这段分析当新指令 提示:"作为经验丰富的设计师,详细分析这个界面的视觉风格和布局,非常技术化,用简短描述性关键词,不要完整句子"
4. Generate Mock Data 用真实/仿真数据 有真实字段和结构时,AI 才好分组、排优先级 拿不到真数据先让 AI 生成假数据做设计,后面再换;设计师要和研发、内容团队配合拿真数据
5. Attach Code Snippets 附代码 引用真实设计系统代码(如 Shopify Polaris)最精确 缺点:设计师得懂代码、代码太长会拖慢模型;注意版权——可见代码不一定可自由复用,坚持用自家/共享设计系统/开源组件

结论:AI 能加快速度,但不能替你做决定。 这些技巧只能让结果更准确,不能替代真正的设计判断——前提永远是"你自己得知道想要什么"。


五、AI 助手定位:它在团队和产品里到底扮什么角色

5.1 AI 作为 UX 助手的 4 个角色(AI as a UX Assistant)

2023 年 7–8 月调查 841 名 UX 专业人士(92% 已用生成式 AI,平均用 2 种工具:ChatGPT 90%、Midjourney 32%;78% 工作+个人都用;680 人中 63% 每周至少用几次)。把 30 种任务归成 4 个角色:

角色(EN / 中) 占比/地位 干什么
Content Editor 内容编辑器 最常见(>75%),最主流 写/改微文案(错误消息、导航标签、帮助文本)、新闻稿、扩写总结现有内容
Research Assistant 研究助手 约半数 文献研究(学新主题、找最佳实践、了解复杂领域如 KYC)、用户研究(生成研究文档、总结洞察、写报告)
Ideation Partner 创意伙伴 38%(打破"空白页恐惧") 头脑风暴情境/结果、角色扮演(让 AI 扮特定用户)、验证创意找盲点
Design Assistant 设计助手 最少(24%) 生成/编辑图像视频、做用户角色/故事板/线框/原型/旅程图、配色建议

为什么文本生成压倒多媒体(p<0.001)? ① UX 工作本就大量写作;② 专用于 UX 的 AI 支持有限(文本工具成熟、UX 多媒体工具还早期);③ 很多人还不会用 AI 做特定 UX 任务。数字佐证局限:6% 用 AI 生成原型角色,仅 0.5% 用 AI 做用户旅程(后者需更多细节信息)。另外数据隐私也限制使用——要花时间改 AI 生成内容来保护隐私,且希望 AI 别拿输入去训练。

5.2 AI 作为创意伙伴(AI as a Creative Teammate)

2025 年 Fabrizio Dell'Acqua 团队在宝洁(P&G)做的 776 人实验,四组对比创意质量(盲评):①个人无 AI、②小组无 AI、③个人用 AI、④小组用 AI。

对比 结果
无 AI:个人 vs 小组 小组显著更好(协作激发更全面思考,符合预期)
个人用 AI vs 无 AI 的任何人(个人或小组) 个人用 AI 平均更高——即使独自工作,AI 也提供类似"头脑风暴"的支持
个人用 AI vs 小组用 AI 小组用 AI 仍略优——AI 和团队协作不是二选一,可互相增强
Top 10% 顶尖创意里谁占比最高? "小组用 AI"最高,甚至超过"无 AI 小组"——AI 提升了个人水平,但产出"最佳创意"上小组协作仍不可替代

怎么让团队协作用 AI:目前大多数生成式 AI 是为"个人使用"设计的,所以即便个人会用,很多团队也没经历过"AI 协作引导的创意工作坊"。要有效用,得把 AI 当团队成员而非纯工具,需要有意识的引导方式。AI 最适合参与"创意生成"环节,不适合强调真实性/准确性的任务(如数据分析)——因为会幻觉。

对 PM 的决策:别把 AI 只发给个人,设计"团队 + AI"的协作流程能多吃一截价值,尤其在追求"最佳创意"时。

5.3 ChatGPT Agent 初评:成功、不稳、慢(Initial Impressions of ChatGPT's Agent)

测试任务:故意用普通人不精确的口吻"帮我在休斯顿某地址附近订一家适合商务午餐的餐厅,下周五中午"。看 AI 在信息不足时表现如何、会不会主动追问。

步骤 ✓ 成功 × 问题
起手 —— 没问任何澄清问题就直接执行(没问预算/几人/交通/饮食限制)
1 搜餐厅 自动关弹窗/锚点干扰、截图记录关键页;给 3 家+对比表(菜系/氛围/距离/理由) 用了 6 分钟、调用 96 个信息源;缺菜单和价格;链接跳转不一致
2 访官网 花 55 秒解决后继续 被错误重定向到 Google 地图
3 确认人数 后续表现惊喜 用户说"两人,其中一人贝类过敏",AI 没追问是谁过敏
4 填表 聪明处理过敏(默认是用户本人,选"贝类过敏");搞定不友好的滑动按钮和顶部"保存/取消" 整整 11 分钟(人类约 2 分钟);最初错选 12:15 后纠正
5 填个人信息 自动停下让用户接手(人在回路 human-in-the-loop,不擅自处理敏感数据) 窗口分辨率低、不能放大,体验差
6 提交前 交回控制后花 1 分钟复查表格,问"我现在可以提交吗?"(决策门 decision gate,高风险操作前要确认) ——
7 确认 虽超时(超过网站 10 分钟保留时限),餐厅仍接受并发确认邮件 ——

总评:能完成、能处理复杂网页和过敏信息、保持人在回路不崩溃;但缺澄清意识、耗时长、突发情况处理弱、支付/身份等高风险必须人接手(削弱了替代价值)。

对 PM 的两个可复用模式:human-in-the-loop(人在回路)= 遇敏感数据自动停手交人;decision gate(决策门)= 不可逆/高风险操作前必须显式确认。这两个是 AI Agent 类产品的安全基线。

5.4 Google AI Mode 评测:能力强,可用性差(Powerful Search, Poor Usability)

Google AI Mode = 把传统网页搜索的广度 + LLM 推理结合的搜索功能(类似 Perplexity,强调多媒体和来源引用)。技术核心两招:查询扇出 Query Fan-out(把一个需求拆成多条子查询,如"奥克兰最好的墨西哥美食"→自动搜"顶级玉米卷饼店""优质墨西哥餐厅")+ RAG(检索增强生成,先查外部数据再生成,提准确性)。

研究观察 7 名用户自由探索。优势:对话式(可点的后续问题)、超级搜索(自动化+整合)、集成 Google 生态(Maps/Shopping/YouTube,点选项展开交互式侧面板含特定日期报价)。但暴露 7 个严重可用性问题:

# 问题 细节
1 可发现性差 入口多(首页按钮/结果页标签/AI Overview 底部按钮)但用户根本注意不到;7 人里 4 人此前从没主动用过——已习惯传统搜索,直接忽略新元素
2 命名模糊、与其他 AI 产品混淆 Gemini(独立 AI 聊天)/ AI Mode(搜索内置)/ AI Overview(结果页自动摘要)三者用户分不清
3 引导信息缺失 欢迎页的提示("问详细点答案更好")没人看到——用户从地址栏直接搜,绕过引导页
4 回答过长且格式乱 冗长无层次,用户略读甚至放弃;建议加粗体/标题/列表/折叠段
5 长对话里找信息难 越聊越长找不回之前内容(找 LG 冰箱那位翻半天放弃,索性让 AI 再给一次链接);建议加跳转/目录/历史
6 顶部标签导航不符预期 AI Mode 和"视频/图片/购物/地图"标签放一起,但那些是筛选内容类型,AI Mode 是用 AI 回答——放这里让人搞混
7 幻觉仍在 冷门话题仍编造(给的神经科学论文和作者根本不存在);专家能察觉、普通用户难辨

对 PM 的决策:再强的能力,可发现性 + 命名清晰 + 可扫读排版跟不上,用户也用不起来。新功能塞进老界面尤其要解决"用户为什么会注意到、会不会和旁边的东西混淆"。

5.5 为什么用户在 GenAI 与搜索间来回切换(Why Users Switch)

一句结论:GenAI 更适合"理清问题、整合信息";传统搜索更适合"核实关键事实、建立信任"。两者分工互补,不是替代。 研究里 9 人中 6 人在两者间来回切。

GenAI 何时更好(理清+整合) 搜索何时仍赢(核实+信任)
问题模糊——先聊一聊让方向清楚(AI 当起点,从大问题收敛;买 Kindle 的人先问"哪里有免费书"再追问) 验证机制——先用 AI 拿摘要/候选,再用搜索逐个核对官网("This is where ChatGPT can begin to lose its charm")
约束多——超过两三个条件塞搜索框很难说清,AI 处理 3–4 个约束比 Google 好 价格与硬事实——涉及具体价格/数字/参数,不全信 AI,用搜索确认最新准确数据(怕被过时信息或"起步价"误导)
降努力——减少 interaction cost(为答案付出的点击跳转浏览),AI 聚合多源直接给最相关部分 风险越高越靠搜索——大额消费/健康信息,越重要越直接看可信网站("花大钱买车要真搞清楚",健康信息"想看大学或政府网站源头")
减工作记忆负担——把信息集中到一个对话,免去"记忆/记笔记/page parking 先开着网页稍后看";熟练用户还让 AI 出表格对比 引用也未必建信任——即便给链接,用户仍困惑"哪句结论对应哪个来源",对应不清时宁愿回搜索逐个看
总结评价——不想逐条读专业评价,让 AI 给整体口碑("get to the point, is it worth keeping or not?");像"不推销的懂行销售顾问" 专业/学术主题——怕 AI 虚构引用、读不到付费墙,更用 Google Scholar/论文,AI 只"帮忙想方向"不"代替研究"

不用 AI vs 用 AI 的信息整合差别:不用 AI 要先 Google 再分别开权威网站、手动抄数据对比(慢、记不住);用 AI 直接给精炼候选并能按难度/优缺点整理,熟练用户要求出表格让对比一目了然。

对 PM 的决策:别想用 GenAI 取代搜索的全部场景。设计上要支持用户在两种模式间顺畅切换(尤其在"高风险/要确认价格事实"时给清晰的回搜索/看来源路径),并把"结论—来源"的对应关系做清楚,这是当前信任的最大缺口。


源自 NNGroup Topics / Artificial Intelligence - AI人工智能(产品与界面设计子集,20 篇)。研究方法与团队实践见 NNGroup 用 AI 做 UX 研究 + AI 时代设计师能力(12 篇 · 加速研究/规划研究/造模拟表格/合成用户红线/评估 AI 模拟行为/方法论陷阱/GenAI 工作原理/重定义设计技能/通才回归/AI 素养);伦理/全球化/新兴模式见 NNGroup 交互模式·伦理·全球化·新兴技术(15 个模式 · 欺骗模式/潜入/危险UX · 包容性设计 · 全球化跨文化/语言切换/尺码/全渠道 · VR-AR/GenAI提示控件 · 用户自主性 · UX文案长度/推荐内容);本批多处呼应 Jakob Nielsen 十大可用性启发式(标准图标+标签、错误预防、识别优于回忆、系统状态可见性),见 NNGroup 可用性测试与十大可用性启发式(10 条启发式完整表 · 复杂应用应用 · 用户愉悦层级 · 测试方法 5 人法则/招募/远程/任务场景/分步任务/态度vs行为/4步分析/小样本误差/竞争性评估)。图片/视频/原档保留在 sources。

来源与关联资料