这篇回答一个做 AI 产品的 PM 经常卡住的问题:没有美术功底,能不能靠 AI 出像样的视觉素材? 答案是:大部分"工程化"的视觉活(图标、状态插图、把模糊图修清、把丑 IP 救活、做主视觉头图)能,但纯造型/配色的独特审美仍要人——这是天赋 + 长期手眼并用堆出来的,AI 短期替代不了。
全篇的元方法只有一句:参考图 > 提示词。现在的图像模型对"3D 质感、材质、光影、风格"的识别已经极强,你与其堆形容词,不如喂一张品味好的参考图让它对齐。Will 反复给的时间分配是 50% 找参考图 + 50% 生成调试。提示词的作用是"框定哪些维度跟参考、哪些维度你自定义",而不是凭空描述。
六节,每节给可复用提示词骨架 + Why + 示例:
一、图像增强(模糊变高清 / 通用变清晰——最高频、最稳的活) 二、3D 图标 & IP 设计(等距图标 / 盲盒软胶 / 拟物图标 / 风格化头像) 三、KV 主视觉(换皮路线 + 原创手绘路线) 四、风格化插图 & 状态图(一套风格统一的 onboarding 插图) 五、视觉重构 Remix(多图各取一维,融合成定制视觉) 六、视觉参考维度(把一张参考图拆成可描述的关键词——前五节的底层弹药)
与 Refactoring UI 给非设计师的 UI 实战手册(层级·留白与间距·配色系统·字体排印·深度与阴影·图片处理·收尾打磨·实战拆解) 互补:那篇讲"界面怎么排得好看"(像素级规则),这篇讲"界面里的图怎么用 AI 生出来"。配色/质感的判断力可借 Google Material Design 3 设计系统(动态色彩/Type Scale/Tonal Elevation/形状/自适应/动效/无障碍 核心主张与规则) 的系统观。
一、图像增强:模糊变高清 / 通用变清晰
做什么素材:把一张糊的、低清的图(老照片、压缩坏的截图、小尺寸 IP 图)重建成 4K 高清、边缘锐利的版本。PM 高频场景:运营给的素材太糊不能用、自己截的参考图想放大、AI 生成图细节软。
用什么工具:Gemini 的"Create image + thinking"模式(图生图,即喂一张图让它在原图基础上重画,而非纯文字生图)。
1.1 核心心法:锁死身份与构图,只补细节,严禁新增
放大不是"重新画一张",是"把现有的修清楚"。所有放大提示词的灵魂是一串否定约束:不许改身份/五官/表情/姿势/服装/背景/构图,不许替换或新增任何视觉元素——只在"微观细节"层面重建(毛孔、发丝、边缘、纹理)。Why:不加这串约束,模型会"自由发挥",越修越不像本人、背景悄悄变样、多出莫名物件;PM 拿去用会被发现"换了张脸"。
1.2 人像变高清(可复用骨架)
人像放大额外两招:用相机参数逼真实感 + 强调"identity 绝对忠实"。
提示词骨架(EN): Upgrade the uploaded image into a pristine, ultra-high-definition cinematic version while preserving the subject with absolute fidelity. The person's identity, facial anatomy, expression, body posture, clothing, accessories, environment, framing and overall composition must remain completely unchanged. Do not modify, reinterpret, replace, or introduce any new visual elements. Reconstruct and refine micro-level details including precise facial contours, authentic skin texture with naturally visible pores, individually defined hair strands, sharp and lifelike eyes, and clean, well-resolved edges. Enhance dynamic range, contrast, and dimensional depth using balanced, studio-quality cinematic lighting.
相机参数版(逼真实摄影感): Enhance the portrait while strictly preserving the subject's identity with accurate facial geometry. Do not change their expression or face shape. Keep the exact same background. No replacements, no new objects, no layout shifts. The image must be recreated as if shot on a Sony A1, 85mm f1.4 lens, at f1.6, ISO 100, 1/200 shutter speed.
为什么塞相机参数:85mm f1.4 / f1.6 这种组合 = 人像镜头的浅景深(背景虚化、主体立体),是模型学过的"高级人像照片"特征锚点。给它一个具体的相机/镜头/光圈,等于告诉它"往这种照片的质感长",比"高清一点"有效得多。
1.3 通用图像变清晰(风景/建筑/产品/插画都能用)
通用版不锁人脸,改成锁色彩 + 构图,靠"上下文推断"补回模糊的纹理(树叶、布料纹理、建筑线条、材质表面)。关键否定项:不许加 halo(边缘发光的过锐假象)、不许引入压缩噪点、不许改风格或加元素。
通用无损放大骨架(EN): Upscale this image to high resolution without any artifacts or blurriness. Preserve all original colors, composition, and subject accurately. Reconstruct fine details that appear unclear or soft — textures, edges, facial features, and patterns — based on contextual inference. Do not alter the style or add new elements. Output: sharp, photorealistic, high-fidelity version of the original.
风景 / 建筑 / 产品图变体:把要补的细节具体点名——
foliage, fabric weaves, architectural lines, or material surfaces,并加Sharpen edges without introducing halos or compression artifacts。
快速版(懒人三行): Upscale to high resolution. Preserve all original colors and composition. Reconstruct unclear details through contextual inference. Do not add new elements. Output: sharp, artifact-free, high-fidelity.
Why 分三档:细节点名越具体,模型重建越准。但日常素材没那么讲究时,"快速版"三行就够——先用快版,不满意再换点名版。
二、3D 图标 & IP 设计
做什么素材:App 里的 3D 拟物图标、产品图标组、品牌吉祥物/IP 角色、盲盒手办风的角色、风格化 3D 头像。
心法:这是"参考图 > 提示词"最成立的领域。模型对 3D 质感/材质的理解极强,找一张对的参考图,效果远超堆形容词。但造型与配色的独特审美 AI 给不了,要独特价值还得靠自己的造诣。
2.1 线稿 2D → 3D(最基础)
输入一张线稿(图1)+ 一张质感参考(图2),让 AI 把线稿按参考的材质 3D 化。
骨架:Convert the line drawing in image 1 into 3D with the material of image 2. / 将图1线稿按图2质感进行 3D 化。
2.2 Airbnb 风等距图标(可复用模板)
做一组风格统一的产品图标(等距/isometric = 像搭积木那样有立体感但没有真实透视的斜俯视角)。填空式骨架:
Create a simple 3D isometric icon, top view, minimal details, of [INPUT OBJECT], using style reference [STYLE REFERENCE], with [MATERIAL / STRUCTURE DETAILS], [LIGHTING / EFFECT], as shown in reference, white background.
示例:Create simple 3D isometric icon, top view, minimal details, of references Lamp 1 and 2, brass base, fluted glass lamp, tungsten bulb, glow, as shown in reference, white background.(黄铜底座 / 竖纹玻璃灯罩 / 钨丝灯泡 / 带发光)
2.3 一次生成一整套图标(图生图,保证成套感)
PM 常要的不是一个图标,是一组看起来像同一套设计系统的图标。诀窍:喂一张"风格基准图(图1)"+ 一张"要被改造的物品图(图2)",强制所有图标统一透视角度(3/4 view)、统一朝向、统一缩放、统一视觉重量,2×2 排布,纯白背景。
骨架:Reference the visual style of Image 1 and regenerate the items in Image 2 into a unified set of high-quality 3D object icons. Style must match Image 1: clean isometric 3D illustration, soft realistic lighting, premium product-icon aesthetic, subtle soft shadows, smooth material rendering. All objects must share the same perspective angle (3/4 view), same orientation, consistent scale, and consistent visual weight, so they look like one icon design system. Each object displayed separately — no people, no scene, no extra decoration. Pure white background (#FFFFFF). Arrange in a 2×2 layout.
Why 强调"统一"那串词:不写,AI 会把每个图标按自己理解画,角度大小各异,拼一起一眼出戏。"统一透视/朝向/缩放/视觉重量"是把它钉死在"成套"上。
2.4 盲盒软胶 IP(Kakao Friends 风)
把任意物体/角色改造成胖嘟嘟、哑光、点状眼睛的软胶玩具(盲盒手办那种)。三个变体:
通用化骨架:redesigned as a chubby 3D soft vinyl toy figure, matte surface, simple dot eyes, smooth solid color, rounded minimal body, blind box collectible style, studio white background, Kakao Friends aesthetic.
精细化(指定角色 + 动作):在通用骨架前面加一句自然语言的角色描述,如 "A chubby orange monster with small teeth waving one arm, next to a small yellow tulip character squinting..."。
不加身体款(只改物体不长四肢):...soft vinyl toy object, keep the original object shape, no body no limbs, matte surface...
2.5 Apple 拟物图标(两步走)
Step1 先把物体变成极简低多边形 3D 玩具模型(几何简化、移除表面细节、胖圆轮廓、物理准确材质、棚拍 HDRI 光、Blender Cycles PBR 质量);Step2 再针对性改材质("点亮车灯 / 车窗改高反射 / 轮毂改金属,造型不变只调材质")。
Step1 骨架(EN):redesigned as a minimal 3D toy model, simplified geometric form, all surface details removed, chubby rounded silhouette, clean low-poly shape, physically accurate material for this object, natural surface texture and color of the original, subtle specular highlight, soft shadow underneath, white background, isometric view, studio HDRI lighting, Blender Cycles PBR quality.
Why 两步:一次性给太多约束(造型 + 材质 + 光)容易顾此失彼。先定造型,锁住满意的形,再单独迭代材质——分而治之,可控性高得多。这个"先定形再调质感"的两步法在 2.6 的质感优化里也复用。
2.6 质感优化 / 超风格化 3D 头像
- 质感不够:第一步只说 "Improve the material quality"(优化质感),第二步在结果上给针对性词("星星更鼓一些、像充气气球漂浮在空中")。Why:让 AI 先大改一版,再小步微调,比一次写满更容易收敛。
- 超风格化 3D 头像(把人变成高光塑料感的"mean girl"潮玩头):靠堆一长串质感词——glossy vinyl finish、holographic iridescent eyeshadow、subsurface scattering、85mm lens close-up、ultra-smooth high-gloss cartoon-style plastic。这类是"形容词密度换风格强度",参考图 + 长 prompt 一起上。
2.7 手绘草图 → 完整概念
输入手绘草图 + 视觉参考 + 一句定义内容的提示词,产出视觉概念设计。骨架:Redraw Figure 1 in the visual style and feel of Figure 2, no text in the image.(把图1造型用图2的风格重画,不出现文字)——并在 prompt 里解释图1的语义(如"上下两个对话气泡,上=AI 下=用户"),帮 AI 理解你画的是什么。
2.8 IP 设计参考站(找参考图用)
Will 给的三个高品味 IP 设计参考:koto.com/projects/yazio (品牌 IP) 、design.duolingo.com/illustration (多邻国插画与形状语言体系) 、stickymonsterlab.com (角色设计工作室)。找参考时优先扒专业团队,别在 AI 生成结果里循环找灵感。
三、KV 主视觉设计
做什么素材:活动头图、Banner、主视觉大图(KV = Key Visual,一个项目/活动的核心画面)。两条路线。
3.1 路线 A:换皮(在成熟参考图上替换 IP)
最快的法子:找一张构图/氛围都成熟的参考图,把里面的角色换成你的 IP,再微调细节。怕被说抄袭,就把动作、环境改大一点。
示例 prompt:将图2里的小狗换成图1的恐龙,动作参考小狗,让恐龙去冲浪,海上出现小鱼,尺寸 9:16,这是主视觉头图,画面要精致,风格参考图2,图中不出现文字(必须出现则只用英文)。
逐步加细节的技巧:加物体不要一次堆,一步加一个(先加青蛙、再加泳镜、再加城堡),每步单独描述。加生物体(动物/人)最好找设计好的参考贴进去,纯靠文字描述容易畸形。
3.2 路线 B:原创(手绘线稿 → AI 上风格)
更有原创性的法子:自己用 iPad(Procreate 等)手绘 IP 或场景的线稿/上色稿,再让 AI只上风格、不改造型。
示例 prompt:图1是我手绘的宙斯卡通形象,请在不改变造型的前提下参考图2的质感,提升光感、质感和 3D 感,打磨得更精致;让后面的光被前面的形象遮挡,做出丁达尔光(空气中可见的光柱)效果。注意:不要写实人物,只要这种极简几何的 IP 造型。
3.3 三个坑(Why 这些约束)
- 头身比要明确强调 1:1。Why:AI 默认会把 Q 版 IP 的比例往真人比例拉(身子变长),做萌系 KV 必须每次写死"身体明显小于头,头身比约 1:1"。
- 改动作要单独点名要改的那个 IP。画面里多个角色时,不指名 AI 会乱改(Will 吐槽过"没想到连青蛙也被弄睡着了")。
- 连续生成会"结果污染":同一会话里反复生成,前面的结果会影响后面。解法:在提示词前加一句"请忘记之前的结果,开启新的对话"。
四、风格化插图 & 状态图
做什么素材:产品 UI 里的风格统一插图——onboarding 引导页、空状态图、各功能模块的配图。PM 高频痛点:这种图找设计师排期慢,自己拼又不成套。
心法:锁风格、放造型。喂一张艺术家风格参考图,让 AI 照搬配色/笔触/纹理,但形状和创意由它根据主题自定义,一次出一整套。
骨架(EN):Create 6 stylistically consistent illustrations for the website onboarding flow. The visual style should reference the artist's color palette, brushwork, and texture in the images, but the shapes and creative concepts should be defined by you based on the themes. The themes include: Sign-up, dashboard analytics, data import, notifications, collaboration, and subscription upgrade.
Why 这么分工:你要的是"一套看起来出自同一人之手"的图,所以风格(配色/笔触/纹理)必须锁死、抄参考;但每张图的内容(注册、数据导入、协作……)各不相同,造型让 AI 自由发挥反而更自然。一次给 6 个主题 = 一次出 6 张成套图,比逐张生再对齐效率高。
五、视觉重构 Remix(多图融合)
做什么素材:把多张参考图各取一个维度,融合成一张定制视觉——3D logo、车载 HMI 界面、超现实概念图。这是上面所有技法的"高阶组合拳"。
心法:造型自定义,其余交给 AI。建议你自己定造型(logo / IP 角色 / 产品形态),把色彩、材质渲染、光影、使用场景这些"可被参考"的维度分给不同参考图。每张参考图只负责一个维度。
5.1 基础:多图各取一维
示例 prompt:参考图1的造型,参考图2的质感与渲染,参考图3的自发光角度与效果,做一张 1:1 的 3D logo 设计。
把"造型 / 质感 / 光"拆给三张图,各管一段——这就是"视觉参考维度"(第六节)在实战里的用法:你得先知道一张图能被拆成哪些维度,才能精准地"只取这一维"。
5.2 进阶:车载 HMI 4 步迭代(完整工作流示范)
一个真实的多步迭代例子,展示 Remix 怎么从乱拼到成品:
- Step1 立骨架:让 AI 先帮你把需求写成中英双语提示词(图1的配色质感渲染 + 图2的视角/马路/城市造型,融成长条状车载地图)。先让 AI 帮你写 prompt 是个好习惯——你描述需求,它产出结构化提示词。
- Step2 改局部:保持画面不变,只把左侧信息换成天气/温度/音乐卡片,卡片用透明磨砂玻璃(frosted glass)效果,所有文字英文、宽度一致。
- Step3 加过渡:把界面一半改成真实环境照片表现"切换过渡态";需要某种色调时,单独开一个对话让 AI 把参考图的色调提炼成英文关键词,再拿回来用。
- Step4 当线框图重做:把 PS 里粗暴拖进去、融合很差的拼图,当作线框图(wireframe)喂给 AI,让它根据现有功能和信息层级重新生成一张完整、风格统一的 HMI。
Why 把拼图当线框图:你不必要求 AI"修好这张烂拼图",而是告诉它"这只是个示意,按这个信息结构重画一张干净的"——把烂图的价值降级为"功能/布局参考",AI 就不会被它的烂质感带偏。最后若要可编辑文件,可接 Codex + Figma 在底图上生成界面初稿。
六、视觉参考维度(把一张参考图拆成关键词)
这一节是前五节的底层弹药库。前面反复说"参考图 > 提示词""图1取造型、图2取质感",但前提是:你得有能力把一张参考图拆解成可描述的维度。否则你说不清"这张图好在哪、我要取它哪一维"。
Will 给了 6 张"拆图清单",每张把一类视觉物料拆成十几个可勾选的维度。用法:看到一张喜欢的参考图,对照清单逐项问自己"它在这一维上是什么",抽出你要的维度写进提示词。这也直接解决了"如何把模糊的审美感受翻译成精确提示词"。
| 清单 | 拆什么 | 几个最有用的维度举例 |
|---|---|---|
| 摄影 Photography | 真实照片质感 | 光的时刻/方向/硬度/颜色 · 焦段(广角/标准/长焦)· 景深 · 胶片风格(柯达暖/富士青/CineStill 红光晕)· 情绪基调 |
| 插画 Illustration | 插画风格 | 风格流派(扁平/复古/Y2K/等距/像素)· 有没有线 + 线条粗细手感 · 平涂 vs 渐变 · 半色调网点(漫画感)· 做旧感 |
| 3D 立体渲染 | 3D 质感 | 材质类型 + 反射/透明/折射/SSS(次表面散射)· 自发光 · 光的方向/硬度/体积光 · 运动类型(飘浮/流淌/爆炸/生长)· 后期(辉光 bloom / 色散) |
| 品牌 Brand | 全套品牌物料 | 品牌主色 + logo 系统 · 载体类型(微型贴纸→巨型户外大牌 11 档)· 工艺(烫金/刺绣/激光雕刻)· 呈现方式(平铺俯拍 flat lay / 单品 hero) |
| 角色设计 Character | IP 角色 | 头身比(1:1 极萌→1:5+)· 眼睛形态/大小/位置 · 标志性符号(耳朵/角/配饰)· 表情可变性(决定能不能做表情包)· 延展性(表情包/手办/动画潜力) |
| 产品摄影 Product | 产品图 | 呈现类型(单品 hero / 加手 / 加道具 / 加成分演示)· 景别(全景→微距)· 光(高调 vs 低调 · 轮廓光)· 物理状态(悬浮/倾倒/切开/飞溅) |
几个对 PM 特别实用的拆解点:
- 摄影里"用胶片风格命名":想要某种"高级照片味",与其说"好看一点",不如指定
CineStill 夜景红光晕或柯达暖调——这些是模型学过的具体锚点(和 §1.2 塞相机参数同理)。 - 角色设计里"表情可变性 / 延展性":做产品 IP 时这是商业判断点——能不能做出 16 张以上表情(表情包潜力)、造型会不会复杂到动不起来(动画潜力)。造型太复杂 = 后续做衍生和动画都受限。
- 品牌载体的 11 档分级(微型贴纸 / 小型印刷 / 包装 / 服饰 / 日用 / 户外器材 / 数字端 / 空间标识 / 车辆展示 / 户外巨型……):做品牌周边/VI 落地时,照着这个 checklist 数,不会漏物料。
Why 这节最值得反复看:工具会换、模型会升级,但"把一张参考图拆成维度"的能力是迁移的。掌握这 6 张清单 ≈ 掌握了"看图说话"的词汇表——这才是你能持续、精准地驱动任何图像模型的根本,而不是背某个具体 prompt。
一页速查
| 我要做什么 | 去哪节 | 一句话心法 |
|---|---|---|
| 把糊图修清 / 放大 | §1 | 锁身份与构图,只补细节,严禁新增;人像塞相机参数 |
| 做 App 3D 图标(成套) | §2.2-2.3 | 喂风格基准图,强制统一透视/朝向/缩放 |
| 做盲盒/软胶 IP | §2.4 | chubby + matte + dot eyes + Kakao Friends aesthetic |
| 做拟物图标 | §2.5 | 先定形(低多边形)再单独调材质 |
| 做活动主视觉 KV | §3 | 换皮(改参考图的 IP)或原创(手绘+AI上风格);头身比写死 1:1 |
| 做 UI 状态插图(成套) | §4 | 锁配色笔触、放开造型,一次出 6 张 |
| 多图融合成定制视觉 | §5 | 造型自定义,色彩/质感/光各取一张参考图;烂拼图当线框图重做 |
| 不知道怎么描述一张参考图 | §6 | 对照 6 张拆图清单逐维抽词 |
贯穿全篇的三条铁律:① 参考图 > 提示词(50% 时间找图)。② 图生图时锁死不变的、只改要改的(身份/造型/构图按需锁,否定约束写满)。③ 分步迭代(先定形再调质感、一步加一个元素、换会话防污染)。审美天花板仍靠人,AI 只是把"工程化的视觉活"做快做稳。