← Knowledge Notes
Content Creation / Knowledge note · Chinese

AI 视频生成 SOP(跨作者主题综合)

4 视角的 AI 视频生成 SOP 融合。鱼子酱机构(AI 漫剧 5 步流程 + 分镜表 9 列 + 6 大运镜 + 红果剧场 5 倍分账)/ 小红书 vibecoding(AI 穿搭 1-1 复刻 5 步 + 画布化操作 + AI 网页电影感 6 步)/ 王凯(SillyTavern 视频 Phase 1-7 工程化范本 + Components/Compositions 分层 + 即梦 CLI 高级会员)/ 老 D(L05 文生图→图生视频→对口型 + L10 HeyGen 数字人 5 工具组合 + 30 国语言)。覆盖即梦 / Vidu / 通义万相 / HeyGen / ElevenLabs / 剪映工具栈对照

Source collection:跨来源主题整理 · Published here:2026-09-26 · Note updated:2026-07-02

AI 视频视频制作创作流程

何时打开:你要做 AI 漫剧 / AI 穿搭 / 数字人 / SillyTavern 角色视频 / AI 网页配套视频。本 wiki 把 4 派 SOP 抽出来对照。

一句话核心:4 派 SOP 共识 = "脚本/分镜 → 资产库 → 生图 → 生视频 → 拼接";分歧在于工具栈选择 + 角色一致性策略 + 工程化分层粒度。AI 视频生成已从"个人玩具"升级到"机构小组制(漫剧 5 倍分账)+ Skill 批量生产(Vibe Marketing)+ 平台 4 亿融资(Astro Kid)"。

0. 4 派的"AI 视频"

视角 来源 核心模式
机构小组制派 鱼子酱 AI 漫剧制作课 / 第 1 节直播教学完整方法论 AI 漫剧 5 步流程 + 红果剧场 5 倍分账 + 100 分钟 1 月周期
画布化创作派 小红书 / AI 视频 1-1 复刻完整工作流 / 小红书 / AI 网页 + 3D 交互 + Pretext 设计合集 AI 穿搭 1-1 复刻 5 步 / 电影感网页 6 步 / 反推提示词 + 图生图融合
工程化分层派 王凯 SillyTavern 视频生产 SOP(Skill 落地范例) Phase 1-7 / Components + Compositions 分层 / 即梦 CLI 高级会员 + Skill 体系
数字人翻译派 dontbesilent AI 自媒体课程 / 13 节系统化方法论 §L05 + §L10 5 工具组合 + 30 国语言一键翻译 / 抖音 200 万播放

1. 跨作者共识(5 条)

1.1 核心流程一致:脚本/分镜 → 资产库 → 生图 → 生视频 → 拼接

派 流程
鱼子酱漫剧 小说 → AI 动态漫剧本 → 分镜表 → 资产库(角色/场景)→ 即梦融图分镜图 → 即梦/Vidu 图生视频 → 剪映拼接
小红书穿搭 原视频 → 反推提示词 → 图生图融合(服装×模特)→ 动作迁移 → 批量节点 → 剪辑
王凯 SillyTavern 目录骨架 → 参考分析 → 资产抓取 → Skill 体系 → 第一条 → 三类视频 → 规模化
老 D 数字人 豆包白底图 → 真人录视频 → wan2.2 animate 换脸 → ElevenLabs 换音色 → 剪映合成 → HeyGen 翻译

1.2 "导演思维"是核心(鱼子酱独家但全派认同)

鱼子酱 AI 漫剧制作课 / 第 1 节直播教学完整方法论:

"本质上漫剧是不同分镜拼凑而成,你作为做剧人本质是导演,AI 只是辅助。"

关键心法 — 画面先行:

"不要看一段写一段,先把所有分镜全部用心罗列写完之后,带着画面感再去生图。"

Why:AI 是素材库,描述越详细,留给 AI 的选择项越低,抽卡命中率越高。

1.3 角色一致性是最大挑战

派 一致性策略
鱼子酱 三视图人物锁定(发型是关键区分维度)/ 资产库存储角色 / 即梦融图
小红书穿搭 图生图融合(服装 × 指定模特图片)/ 动作迁移
王凯 SillyTavern Components(可复用单元)/ 即梦 image2image 锚定
老 D 数字人 白底图 ★ 关键(避免背景识别错乱)/ wan2.2 animate 换脸

详见 wiki-content-replication(memory)和 jimeng-multishot-replicate skill —— "即梦多分镜必须 image2image 锚定"。

1.4 即梦 + Vidu 是主流工具栈

工具 用途
即梦 文生图 + 图生视频 + 角色融合 / 高级会员效率高
Vidu 视频生成补充
HeyGen 对口型 / 数字人 / 30 国语言翻译
通义万相 wan2.2 animate 角色替换换脸
ElevenLabs 配音 / Voice Changer 29 国语言
剪映 关键帧合成 / 字幕 / 响度统一

1.5 提示词细节决定成败

鱼子酱 AI 漫剧制作课 / 第 1 节直播教学完整方法论 提示词速查清单:

  • 体型(身高 / 体重 / 身材描述)
  • 发型(关键区分维度)
  • 服饰(颜色 / 款式 / 材质)
  • 配饰(眼镜 / 项链 / 包)
  • 绘画风格(动漫 / 写实 / 复古)

2. 显式分歧(3 条 —— 不抹平)

2.1 分歧 1:个人起号 vs 机构小组制?

视角 立场
鱼子酱(机构小组制) "不建议个人起号" —— 起号周期太长,做剧时间长,两头难;加入机构小组制:几个人共同做一部剧,分账 + 制作费
小红书 vibecoding 个人创作者主导 —— 1-1 复刻 / 30 天 ARPG 挑战 / buildinpublic
王凯 SillyTavern 个人工程化 = 可平移到任何产品 —— Phase 1-7 / Skill 体系 / 一个 SillyTavern 视频量产
老 D 个人数字人 + 多语言 —— 抖音单视频 200 万播放

真分歧:是否需要团队:

  • 漫剧 100 分钟 × 1 个月 → 必须机构小组制
  • AI 穿搭 / 数字人 → 个人完全可行
  • SillyTavern 量产 → 个人工程化(Skill)足够

2.2 分歧 2:手工流程 vs Skill 化批量?

| 视角 | 立场 | |---|---| | 鱼子酱(手工流程) | 9 列分镜表 + 6 大运镜手工填 | 漫剧需要导演的画面感 | | 小红书 1-1 复刻 | 画布节点 + 批量节点 | 工作流可视化,批量节点跑多组 | | 王凯 SillyTavern | Skill 体系 + Components/Compositions | 可平移到任何产品视频量产 | | 小红书 Vibe Marketing | Claude Code Skill + FFmpeg 本地拼接 | "一类视频套路非常明确再批量" | | 老 D 数字人 | 5 工具组合手动串 | 抖音播放 200 万但仍手工 |

真分歧:Skill 化 vs 手工的边界:

  • 套路明确 + 重复多次 → Skill 化
  • 创意主导 + 一次性 → 手工
  • 创意 + 复制 → Components(可复用单元)+ Compositions(组合)

2.3 分歧 3:即梦还是 Sora 还是其他?

视角 选择
鱼子酱(漫剧) 即梦(三视图)+ Vidu(补充)+ 可加首尾帧
小红书 1-1 复刻 画布化操作 + 即梦工作流
小红书 AI 网页(妍妍) Higgsfield + Seedance(电影感网页人物视频)+ Google AI Studio
王凯(即梦 CLI) 即梦高级会员 + CC 装即梦 CLI 多窗口自动运行 "每个 YouTube 账号一天最少 10 条以上素材"
老 D 数字人 豆包生图 + wan2.2 animate(角色替换)+ ElevenLabs(换音色)
Sora(OpenAI) (lenny 提到 Sora Android 18 天 ship,但未成为主流工具)

真分歧:赛道决定工具:

  • 漫剧 → 即梦 + Vidu(国内可用 / 红果剧场友好)
  • 穿搭 → 画布化 + 反推提示词
  • 电影感网页 → Higgsfield + Seedance + Google AI Studio
  • 数字人 → 豆包 + wan2.2 + HeyGen 翻译

3. 鱼子酱 AI 漫剧 5 步流程(独家完整)

鱼子酱 AI 漫剧制作课 / 第 1 节直播教学完整方法论:

3.1 5 步制作流程

小说 / 文章
    ↓ 1. AI 生成 → 动态漫剧本(标准格式)
    ↓ 2. AI 转换 → 分镜表(9 列)+ 资产库提炼
    ↓ 3. 即梦生图(三视图)→ 角色 / 场景 / 物品资产库
    ↓ 4. 即梦融图 + 文生图 → 分镜图(单帧)
    ↓ 5. 即梦/Vidu 图生视频(可加首尾帧)→ 分镜视频
    ↓ 6. 剪映拼接 → 成片

3.2 分镜表 9 列结构(独家)

列 内容
1 镜头号(如 2-1 / 2-2 / 2-3,同分镜内特写用子编号)
2 场景(日/夜 + 内/外 + 地点)
3 人物(出场角色列表)
4 动作描述(剧本动作 → 给 AI 的画面叙述)
5 AI 文生图逻辑提示词(直接复制给即梦)
6 运镜(推/拉/摇/移/跟/环绕 + 组合)
7 v.0.1 对白
8 运镜对应的对白(详细对应远/全/中/近/特写)
9 备注(导演手稿草图 / 抽到的图链接 / 生成视频链接)

3.3 6 大基础运镜 + 1 主观视角

运镜 适用
推 拉近聚焦细节(主角面部表情 / 物件特写)
拉 拉远显示环境(从近景突到远景,常用于结尾)
摇 横向扫场景(展示空间感)
移 镜头水平/垂直移动
跟 跟随人物
环绕 360 度展示
主观视角 第一人称

3.4 红果剧场变现

  • 2026 红果大力推 AI 漫剧
  • 2026-12 出新分账模式:5 倍分账系数
  • 整集需 ~100 分钟 / 单人制作周期 ~1 个月
  • 不建议个人起号,加入机构小组制

4. 小红书 AI 穿搭 1-1 复刻 SOP(独家)

小红书 / AI 视频 1-1 复刻完整工作流:

4.1 完整工作流(画布化操作)

[原视频] → [文生图反推] → [图生图融合(服装×模特)] → [动作迁移裁剪]
       → [批量节点生成视频] → [剪辑打关键帧] → [成品]

4.2 5 步详解

Step 1: 文生图反推 — 生成同款场景

1. 将需要复刻的同款视频拖入画布
2. 在视频节点选择一帧满意的图片
3. 点击上方"截帧"
4. 在文本生成节点贴入提示词 — 通过"反推提示词"得到同样风格的全新图片

Step 2: 图生图融合 — 指定模特上身

1. 上传服装图片
2. 上传指定模特图片
3. 通过图生图融合 → 得到指定模特的服装上身图片
4. 重复 1-3 → 各种风格穿搭图片

Step 3: 动作迁移裁剪

  • 参考原始视频做动作迁移
  • 对某个动作片段进行裁剪(每套服装都裁一遍)

Step 4: 批量节点生成视频

  • 把裁剪好的视频片段 + 服装上身图分别传入批量节点
  • 工作流选择"动作表情,姿态迁移"
  • 一致词简约:"女人在摆姿势"
  • 点击批量运行 → 后台批量处理 → 4 组不同动态视频

Step 5: 剪辑

  • 导入剪辑软件 → 打上关键帧 → 完成

5. 王凯 SillyTavern 视频工程化(Phase 1-7 独家范本)

王凯 SillyTavern 视频生产 SOP(Skill 落地范例) —— 可平移到任何产品视频量产:

Phase 内容
1. 目录骨架 视频项目结构 / 素材 / Components / Compositions 分层
2. 参考视频分析 8 维度 选题 / 镜头 / 节奏 / 情绪 / 主题 / 风格 / BGM / 转场
3. 真实资产抓取 5 类 截图 / 角色 / 场景 / 物件 / Voice
4. Skill 体系 / Components / Compositions 分层 可复用单元 → 组合
5. 第一条视频 MVP 验证
6. 三类视频 + 即梦混剪 内容矩阵化
7. 规模化 复制 + Skill 优化

5.1 即梦 CLI 多窗口自动运行(王凯独家)

"结合即梦高级会员 + CC 中安装即梦 CLI,多个窗口自动运行,每个 YouTube 账号一天最少 10 条以上素材。"

成本观察:"Claude Code 做视频的成本要比即梦等低很多" —— Remotion AI Skill 程序化做视频。


6. 老 D 数字人 5 工具组合(独家)

dontbesilent AI 自媒体课程 / 13 节系统化方法论 §L10:

6.1 完整工作流

1. 豆包生图(白底图 ★ 关键)
   → 提示词:让豆包反推一段 prompt 给你
   → 生成数字人图片(白底,方便后续抠人)

2. 真人录视频(你自己拍)

3. 阿里通义万相 wan2.2 animate(角色替换)
   → 视频 → 数字人替代脸
   → 但声音还是你的男声 ← 问题

4. ElevenLabs Voice Changer
   → 用女声换音色(支持 29 国语言)
   → 选中文女声(如安娜苏)
   → 输出 MP3

5. 剪映合成
   → 音频替换 + 响度统一 + 字幕

6. (可选)HeyGen 翻译视频
   → 一键翻译成日 / 法 / 韩 / 西班牙 / 俄等 30 国语言
   → 抖音覆盖海外市场

6.2 关键约定

坑 解决
视频图片必须白底图 否则背景识别错乱(墙面紊乱)
通义万相必须开会员 标准版排队卡顿
不同工具时长不一致 剪映对齐最短的剪
HeyGen 翻译选目标语言 不选会自动检测但易错

6.3 实战收益

"老 D 在抖音昨天发的视频快 200 万播放,数字人覆盖 30 国语言后单视频流量翻倍。"


7. 工具栈对照表(4 派)

任务 鱼子酱漫剧 小红书穿搭 王凯 SillyTavern 老 D 数字人
脚本 豆包 / DeepSeek / Gemini (用爆款视频做蓝本) 8 维度参考分析 AI 写口播稿
分镜 9 列分镜表 + 6 大运镜 画布节点 Components / Compositions 不强需求
生图 即梦三视图 反推提示词 + 图生图融合 即梦 image2image 锚定 豆包白底图
生视频 即梦 / Vidu + 首尾帧 即梦批量节点 + 动作迁移 即梦 CLI 高级会员 / Remotion 真人录 + wan2.2 换脸
配音 不强需求 不强需求 ElevenLabs ElevenLabs 29 国
多语言 不强需求 不强需求 不强需求 HeyGen 30 国一键
拼接 剪映 剪映 + 关键帧 FFmpeg + Skill 剪映
变现 红果 5 倍分账 小红书 / 个人 IP YouTube 多账号 抖音 200 万播放
国内可用 ✅ ✅ ❌(YouTube) ✅

8. 怎么选 —— 按身份的 AI 视频路径

你是谁 主用方法 起点
想加入机构做漫剧 鱼子酱 5 步流程 9 列分镜表 + 6 大运镜 + 红果 5 倍分账
做 AI 穿搭 / 1-1 复刻 小红书画布化 反推提示词 + 图生图融合 + 动作迁移 + 批量节点
做产品宣传视频 王凯 SillyTavern Phase 1-7 目录骨架 + Components + Compositions + Skill 体系
做数字人 + 多语言 老 D 5 工具组合 豆包白底 + wan2.2 + ElevenLabs + 剪映 + HeyGen 翻译
做电影感网页配套视频 小红书 AI 网页 6 步 Higgsfield + Seedance + Google AI Studio + Landingbook
批量生产广告创意 Vibe Marketing Skill Claude Code Skill + FFmpeg 本地拼接

通用纪律:

  1. 本质是导演,AI 是辅助(鱼子酱)
  2. 画面先行(全部分镜罗列完再去生图)
  3. 角色一致性:三视图锁定 / image2image 锚定 / 白底图
  4. 描述越详细,AI 抽卡命中率越高
  5. 套路明确才批量,创意主导手工
  6. 多语言翻译 = 流量翻倍(老 D 实证)

9. 引用清单

主要原始 author wiki:

相关主题 wiki(本系列):

相关 skill(已用户操作化):

  • jimeng-multishot-replicate —— 即梦多分镜复刻 / image2image 锚定 / 9 类分镜模板 / 8 大踩坑
  • ai-mandrama-pipeline —— AI 漫剧 pipeline
  • ffmpeg-reels-pipeline —— FFmpeg 视频拼接
  • ins-reels-pick-and-score —— ins Reels 选片
  • ins-reels-launch-sop —— ins Reels 上线 SOP
  • ins-content-paraphrase-strategy —— 字幕 paraphrase 策略
  • ins-account-highlights —— ins 账号 Highlights

History

  • 2026-05-18:Topic-dimension wiki 首发。从 6 份 author wiki 综合改写。显式标注 3 条分歧:个人 vs 机构 / 手工 vs Skill 化 / 即梦 vs Sora vs Higgsfield

来源与关联资料