AI 视频学习手册
AI Video Field Guide · 2026

从一个镜头
稳定成片

真正值得学习的不是某个模型的“咒语”,而是把创意变成分镜、把分镜变成可控镜头、再用剪辑与声音建立叙事的一整套能力。

4 周从零到独立制作
3 支15–60 秒完整作品
6 项作品质量评估维度
1 套可复用生产工作流
01 · Mental model

先建立正确的
学习对象

AI 视频不是“输入一句话,得到一部电影”。生成模型负责提供镜头素材;创作者仍然要决定看什么、何时切换、为什么产生情绪。

创意

一句话描述主角、目标、阻碍与变化,避免只有氛围没有事件。

分镜

把故事拆成信息功能不同的镜头,为每个镜头规定景别和时长。

参考

用角色、场景、服装与色板锁定视觉世界,降低随机漂移。

生成

逐镜头控制主体动作和相机运动,选择可剪辑的版本。

后期

通过剪辑、声音、字幕和调色,把离散素材变成连续体验。

核心原则:纯文生视频适合探索意外;参考图、首尾帧和动作参考适合稳定生产。初学者应先学会“从关键帧出发”,再追求一句话生成完整影片。
02 · Creator case

DiDi_OK:
先表达,再生成

《牌子》的经验提醒我们:AI 可以压缩执行成本,却不能替创作者产生真实感受、判断什么值得说,以及决定什么才算“好”。

一套比“提示词技巧”更上游的创作闭环

EXPRESSION LOOP
找到不吐不快的感受

从生活中的愤怒、怀念、困惑或期待开始,而不是先找热门风格。

审核表达的价值

它是否值得传递?能否给别人带来新的理解、感受或乐趣?

选择观众能进入的形式

形式像请客吃饭:先降低理解门槛,再把最独特的表达端出来。

检查技术、成本与周期

个人创作者必须在情绪消散前做完;无法控制的酷创意可以主动放弃。

回到最初表达

生成、剪辑和视觉奇观完成后,再问一次:成片有没有偏离真正想说的事?

01 · AI 的位置

执行杠杆,不是创意主体

AI 擅长资料辅助、视觉实现和快速试错;细腻的人类情绪、幽默与表达仍需创作者做决定。

02 · 真正的差异化

没有人比你更会做自己

经历、城市、性格、审美和跨媒介“通感”共同构成个人底色。模型越趋同,这些变量越重要。

03 · 最重要的训练

尽快做完前十个失败作品

AI 最大的学习价值是降低试错代价。不要把第一部作品当代表作,把它当作获得反馈的实验。

1.5 个月报道所述《牌子》剧本构思时间:最难压缩的是表达和故事。
3 天报道所述 AI 制作时间:执行环节被显著压缩。
10 个快速完成早期作品,用真实反馈替代无限准备。
把它加入你的工作流:每个项目开工前先写四句话——“我现在最强烈的感受是什么?”“我真正想让观众感到什么?”“哪种形式最容易进入?”“在当前周期内能否完成?”

来源:DiDi_OK 现场分享 · 分享全文整理与补充采访

03 · Choose a path

四种目标,
四条不同路线

共同基础都是镜头语言与剪辑,但作品形式、评价标准和技术深度不同。没有明确目标时,先走“内容创作”路线。

C

内容创作

短视频、知识内容、故事账号。优先训练信息密度、前三秒吸引力、字幕和稳定周更能力。

9:1615–60 秒高频迭代
B

品牌与广告

产品视觉、概念片、社交广告。优先训练品牌一致性、产品真实性和商业可用性。

品牌规范产品镜头版权意识
F

叙事与电影

剧情短片、MV、视觉实验。重点是角色弧线、场面调度、连续性和声音叙事。

16:9 / 2.39:1角色一致镜头覆盖
R

模型与研发

本地工作流、模型机制与可控生成。先具备创作判断,再进入节点系统、条件控制与评测。

ComfyUIVideo DiT评测
04 · Tool stack

只选一个主模型,
先完成作品

工具会快速变化,能力结构不会。最小工具栈是“一个生成平台 + 一个剪辑软件”;不要同时学习五套界面。

即梦
生成

适合中文创作和国内入门,覆盖文/图生视频、首尾帧及多模态参考。

  • 优势:中文理解、链路完整
  • 练习:首帧 → 动作 → 尾帧
查看官方平台 ↗
可灵
生成

适合角色与元素参考、镜头覆盖和叙事镜头实验。

  • 优势:主体绑定与多镜头能力
  • 练习:同一角色跨三个场景
阅读官方指南 ↗
剪映
后期

承担剪辑、字幕、配音、音效、调色、补帧和画质增强。

  • 优势:国内工作流顺畅
  • 练习:让六个独立镜头产生节奏
查看官方能力 ↗
Runway
生成 / 学习

适合系统学习镜头运动、参考素材和生成式视频工作流。

  • 优势:创作者教程体系完整
  • 练习:同一画面的五种运镜
进入官方 Academy ↗
Google Flow
电影工作流

围绕 Veo 构建,强调场景素材复用、角色一致性和相机控制。

  • 优势:面向分镜和场景组织
  • 练习:一个场景的正反打覆盖
阅读官方介绍 ↗
Adobe Firefly
生成 / 后期

适合已经使用 Premiere 的创作者,便于把生成素材接入专业剪辑。

  • 优势:Adobe 生态与商业工作流
  • 练习:为实拍时间线补一组 B-roll
阅读官方教程 ↗
ComfyUI + Wan
本地节点

适合进入可复现节点流程、参数控制、批量实验和模型研究。

  • 优势:流程透明、可保存与复用
  • 前提:显存、环境配置和调试耐心
查看官方工作流 ↗
05 · Platform map

先选工作流,
再选模型

平台会不断换模型、换积分和换套餐。真正需要比较的是:谁最适合你的镜头类型、资产管理方式、地区可用性与单位可用镜头成本。

给国内个人创作者的默认答案

用即梦 Seedance 2.0 做主平台,用可灵 3.0 补固定角色、多人对白和声线镜头;动作与微表情交给海螺 2.3,动漫和低成本批量交给 Vidu。剪映或达芬奇负责剪辑、字幕、声音与最终输出。

主平台:Seedance 2.0补镜头:Kling 3.0后期:剪映 / 达芬奇
MAIN导演式生成多图、视频、音频参考;中文叙事与原生音画。
FIX一致性补救角色、声线、多人对白和镜头文字。
EDIT成片交付把离散镜头变成有节奏、有声音的作品。
平台 / 模型最强场景主要限制价格口径(官方公开信息)官方资料
即梦
国内首选
多素材导演式参考、中文叙事、原生音画、15 秒多镜头。多主体一致性、画面文字和复杂局部编辑仍可能失败。消费者月费与单次扣分未公开稳定价,需登录购买页;火山方舟活动包 ¥196/1400 万 tokens 起,具体视频数量随规格变化。Seedance 2.0 发布
API 活动包
可灵 3.0
角色与对白
固定角色、声线、多角色对白、自定义多镜头、镜头内文字。人民币套餐和积分兑换关系需在登录结算页确认。5 秒:720p 静音 30 credits、有声 45;1080p 静音 40、有声 60;声线控制再加 10 credits。官方指南与计费
海螺 2.3
动作专项
复杂身体动作、物理性、微表情、写实人物与风格化短镜头。不属于原生音画联合工作流,声音通常后期完成。Standard $14.99/月 1000 credits;Pro $54.99/月 4500 credits。API:768p 6 秒 $0.28,1080p 6 秒 $0.49。会员政策
API 价格
Vidu Q3
批量与动漫
最多 7 张主体参考图;动漫、道具、场景一致性和成本敏感批量。错峰任务可能等待最长 48 小时;消费者套餐价格动态。API 1 credit=¥0.03125;Q3 Turbo 1080p 约 ¥2.03/5 秒,错峰约 ¥1.09/5 秒;注册有体验积分和每日登录积分。API 价格
参考生视频
Runway
国际工作台
Gen-4.5、Seedance、Kling、Veo 等多模型切换与生成式视频编辑。积分不结转;高频生成成本高;中国大陆可用性需自行确认。Free $0/一次性 125 credits;Standard $15/月(年付 $12/月)625;Pro $35(年付 $28)2250;Max $95(年付 $76)9500。官方套餐
模型列表
Google Flow / Veo
地区限制
Scenebuilder、首尾帧、Ingredients、场景延展,适合多场景叙事。中国大陆不在支持范围;Free、Plus、Pro 通常有可见水印。AI Plus $7.99/200 credits;Pro $19.99/1000;Ultra $100/10000。Veo Fast 约 20 credits/次,Quality 100/次。Google AI 套餐
Flow 积分规则
Adobe Firefly
地区限制
Adobe 生态、Premiere 衔接、商业素材治理与参考控制。中国大陆不可用;1080p 生成消耗高。Standard $9.99/2000 credits;Pro $19.99/4000;Pro Plus $49.99/10000。1080p 为 100 credits/秒,Standard 约 4 条 5 秒 1080p。官方套餐
积分消耗
ComfyUI + Wan2.2
本地研发
可复现、隐私、批量队列、节点控制和模型研究。配置、显存、存储和维护成本高;不适合零基础第一站。软件与模型 $0;Wan2.2 官方 720p 基准建议至少 24GB 显存。8GB 优化版可装载,不代表能高效生产。Wan2.2 仓库
ComfyUI 教程
成本别看单次生成价

真正要记录的是 订阅费 + 加购积分 + 算力成本 ÷ 最终采用镜头数。同一镜头五次才采用,单位可用成本就是标价的五倍。

免费不等于可商用

免费额度、可见品牌水印、依法保留的 AI 标识和商业授权是四件不同的事。付款也不自动意味着可以删除全部标识。

一次只买一个月

先用同一组 10–12 个测试镜头比较采用率、人物一致性、声音、等待时间和后期工作量,再决定是否续费。

01固定测试集

对白、动作、双人互动、文字、运镜、首尾帧各做 1–2 个镜头。

02先试主平台

先用 Seedance 2.0 完成整组,不要一开始同时注册八个平台。

03只补失败类型

角色/声线失败找可灵,动作失败找海螺,动漫与批量找 Vidu。

04冻结工作流

保留提示词、参考图、模型、版本、生成次数和最终采用结果。

我的建议:先买一个月的即梦或最小积分包,配合可灵免费额度完成 12 镜头基准测试;如果你更看重成本透明度,再把 Vidu API 或海螺 API 作为补充。海外平台暂时不适合作为中国大陆个人创作者的核心依赖。
06 · Asset workflow

《丧尸清道夫》:
先冻结资产,再做镜头

Mx-Shell 的核心方法是把生图当作“美术资产生产”,而不是为每个镜头临时抽卡。优质参考图先定义人物、场景和视觉基调,再把稳定资产交给视频模型。

A

角色资产包

先完成角色母版,再逐层添加表情、服装与装备。主角高精度,次要角色按实际镜头需求降级。

  • 基础全身母版hero_base
  • 表情变化组hero_expr_*
  • 服装与做旧hero_costume
  • 独立道具图prop_revolver
  • 三视图与特写hero_sheet
B

场景资产包

先生成同一场景的构图候选,选中母版后再拆内部空间、细节和空镜,保持空间关系一致。

  • 场景母版set_master
  • 四宫格候选set_variants
  • 无人物空镜set_cleanplate
  • 关键局部set_detail_*
  • 固定光影尾缀style_tail
C

调度资产包

把场景母版转成低成本草图,再标注人物位置、行动轨迹和镜头方向,降低视频模型的理解负担。

  • 黑白场景草图set_sketch
  • 人物初始位置blocking_start
  • 角色行动轨迹blocking_path
  • 摄影机方向camera_plan
  • 单镜头参考图shot_ref_*
01文字设定

颜色、结构、材质、时代和最强记忆点。

02基础母版

纯色背景、全身、结构清晰,暂不加复杂装备。

03逐层变体

表情、衣服、做旧依次生成,每层单独验收。

04道具分离

武器和复杂配件独立生成,再引用合成。

05设定图

生成三视图、关节和关键部位特写。

06镜头引用

按镜头只加载必要资产,减少条件冲突。

PRINCIPLE 01

真实来自受控缺陷

适量加入灰尘、污渍、划痕和磨损。过度光洁、过度华丽反而容易显出 AI 感。

PRINCIPLE 02

给角色一个记忆锚点

例如独特的 LED 面部或轮廓特征。强识别点能稳定角色,也会让轻微穿帮不那么显眼。

PRINCIPLE 03

逐层搭建,不求一步到位

基础结构通过后再加表情、服装和道具。失败时能明确回退到哪一层,而不是全部重做。

PRINCIPLE 04

分辨率也要分阶段

草图与构图探索用低成本规格,正式参考使用中等规格,只在最终关键资产上使用高分辨率。

建议文件命名

CHAR_hero_base_v03.png CHAR_hero_expr_angry_v02.png PROP_revolver_clean_v01.png SET_villa_master_night_v04.png BLOCK_S03_path_v02.png SHOT_S03_ref_final.png

进入视频生成前的四道门

IDENTITY主角正面、侧面和全身是否仍像同一个角色?
GEOMETRY服装、关节、武器和空间结构是否能支持预定动作?
STYLE场景、人物是否共享同一色板、光线和材质语言?
BLOCKING首帧位置、行动轨迹、镜头方向和尾帧状态是否明确?
关键技巧:不要直接在最终写实图上画箭头和文字;先转成黑白草图再标注人物位置与轨迹,避免模型把标注本身生成进画面。视频中的平台和模型会变化,但“资产分层、单层验收、按需引用”是可迁移的方法。

来源:Mx-Shell 图片资产工作流分享 · 公开 AI 文稿页面

07 · Credible case library

七个值得拆解的案例,
不只看成片

案例的价值不在“像不像电影”,而在是否披露目标、素材、流程、取舍和限制。下面优先选择主创一手复盘或官方幕后资料,并明确平台自述的偏差。

A可复现一手资料

官方文档或主创原始复盘,能看到输入、步骤与输出。

B具体幕后资料

流程较清楚,但由平台发布,需留意选择性呈现。

C仅作灵感索引

二手解说或作品展示;不能据此断言成本、效率和方法。

先看这两段一手分享

封面即图片素材;点击后在当前页面载入 B 站播放器。离开“案例与视频”页时播放器会自动卸载,避免后台继续播放。

CREATOR MINDSET

DiDi_OK:从真实感受到表达

重点看创意起点、观众体验、表达形式与完成周期,而不是某个模型按钮。

ASSET WORKFLOW

Mx-Shell:角色、场景与调度资产

重点看母版、变体、道具、草图调度和按镜头引用如何减少一致性失败。

HYBRID FILMB · 官方幕后

《ANCESTRA》

Eliza McNitt 用实拍承载人物表演,用 Veo 处理传统拍摄难以完成的记忆与想象段落。

  • 先写剧本、分镜,再判断哪些镜头真正需要生成。
  • AI 是镜头部门之一,不等于整条生产线。
  • 适合学习实拍、VFX 与生成素材的边界划分。
局限:大型专业团队案例,不能类推为个人低成本生产。
阅读官方幕后 ↗
CHINA · FULL PIPELINEA− · 作者白皮书

《带你去玩球!》

大羽玩AI 的完整技术复盘,从角色/场景资产包、分镜、多模型图生视频一路进入动画与剪辑,并讨论场景一致性与模型路由。

  • 按镜头难度选择模型,不为“全片同模型”付额外成本。
  • 资产包先于生成,分镜先于参数调试。
  • 适合映射到自己的 30–60 秒个人项目。
局限:白皮书可能要求飞书登录;工具版本会漂移,学习结构而非按钮。
阅读创作者白皮书 ↗
HYBRID ANIMATIONA · 导演幕后

《Migration》

Jeremy Higgins 先用两周做 storyboards,再并行制作手绘角色 rough animation 与 AI 背景,最后补接触阴影和互动细节。

  • 每场固定色板与视觉主题,优先解决场景连续性。
  • AI 负责环境与微动,角色表演仍由动画控制。
  • 失败时改变制作分工,而不是无限重抽。
局限:多人专业团队、约两个月制作;价值在混合流程,不是速度神话。
查看逐步幕后 ↗
MODEL-AWARE STORYA− · 创作者直访

《air head / Deflated》

shy kids 围绕模型容易保持的“气球头”角色写故事,并用筛选、剪辑、调色、rotoscope、VFX 与声音把离散镜头变成成片。

  • 让角色设计与模型能力匹配,而不是硬压缺陷。
  • 生成只是素材获取,统一质感主要发生在后期。
  • 公开成片必须和 BTS 一起看。
局限:使用早期 Sora 私测版;平台首发宣传弱化了大量后期劳动。
阅读创作者直访 ↗
MV · GENERATIVE DRIFTA− · 导演数据

《The Hardest Part》

Paul Trillo 把模型的连续变形匹配到“人生记忆不断前推”的 MV 形式;其复盘披露了大量生成、低采用率与后期补接。

  • 先选与模型特性一致的形式,再写镜头。
  • 把采用率纳入预算,而不是只统计单次价格。
  • 声音和连续运动掩护了跨镜头身份漂移。
局限:内测模型与特殊权限不可复制;公开数据说明筛选劳动非常高。
查看导演过程数据 ↗
CHINA · MUSIC VIDEOB+ · 作品方流程

《500 Winters》

围绕 LilWuKong 虚拟音乐人,把歌词情绪拆成视觉母题,以固定人物资产、段落节奏和镜头复用组织完整 MV。

  • 从歌曲结构反推场景数量与重复镜头。
  • 把角色 IP 做成可复用资产,而非逐镜头重新描述。
  • 流程画布适合检查素材依赖关系。
局限:平台邀约案例且流程需登录;影视/IP/肖像参考有版权边界。
看作品与工作流说明 ↗
CHINA · SOLO AI ANIMATIONA− · 作者直访

梦游牛油果:从分镜到成片

《刻板印象宇宙》的核心不是一键生成,而是“剧本 / 分镜 → 图片转视频 → 剪辑”。公开采访称约 80% 的精力放在剧本和分镜,后 20% 才是动态化与拼接。

  • GPT-4o、Flux 等生成角色和场景,Photoshop 合成分镜;关键动作会用手绘或 3D 辅助。
  • 海螺负责物理运动和打斗,即梦负责首尾帧等控制;按镜头能力切换模型。
  • FineVoice 做声音克隆,Suno 做配乐,最后用剪映完成声音与剪辑。
局限:采访披露的是《刻板印象宇宙》及个人工作流,不代表后续 TapNow / LibTV 作品的每个内部节点;模型、平台和价格会变化。
阅读 AI新榜采访 ↗ 阅读品玩采访 ↗
案例拆解作业:任选一支作品,只交付一页:一句话意图、6–12 镜头功能表、资产清单、AI / 实拍 / 后期分工、三个可复刻方法、两个无法由公开资料确认的未知项。想复刻梦游牛油果,可先用 ChatGPT 做剧本与分镜,再用关键帧 + 图生视频逐镜头生成,最后进入声音与剪辑。
08 · Verified tutorials

教程按生产顺序学,
不要按平台收藏

这条路径覆盖预演、生成、剪辑、声音与修补。A 级表示来源可靠且可照做,不代表功能永远不变;涉及模型版本、地区、套餐和显存的数据,使用前仍要复查官方页面。

Runway:入门 + 提示词

A · 官方学院

先完成 Creative Training,再读当前 Gen-4.5 Prompting Guide。重点掌握文生视频写“画面 + 运动”,图生视频主要描述运动,并从简单指令逐步加约束。

复现任务
同一主体做固定、推近、横移三个 5 秒镜头
适合
零基础第一天
版本风险
低—中;跳过 Gen-3 旧教程

Google Flow:生成到场景

A · 官方帮助

学习文字、图片、Ingredients、首尾帧生成,再用版本历史、延长、保存关键帧与 Scenebuilder 把多个片段组织成场景。

复现任务
同一房间完成建立镜头、正打、反打和结尾空镜
适合
已完成三个单镜头
版本风险
中;地区、额度与模型会变化

可灵 VIDEO 3.0 用户指南

A · 官方指南

目前较完整的国产官方单篇指南:多镜头、自定义分镜、Element 绑定、角色声音、多角色对白和首尾帧都有完整示例。

复现任务
固定一个角色元素,做 3 镜头 15 秒对话场景
适合
中文工作流入门到进阶
版本风险
中;生成前重查界面与计费

Adobe Firefly:参考控制

A · 官方练习

用 5–10 秒参考视频迁移构图或摄影机运动,再把结果加入 Firefly Video Editor 时间线。适合练“参考什么、不要参考什么”。

复现任务
用同一参考分别迁移构图和运镜,对比差异
适合
已有 Premiere / Adobe 流程
版本风险
中;部分控制互斥且编辑器仍可能变化

Runway:AI for Advertising

A · 端到端项目课

从 moodboard、品牌宣言、storyboard、previs 进入产品镜头、选角、B-roll、VFX 和人物/商品植入;适合建立商业片生产顺序。

复现任务
为一个日常物品做 20 秒概念广告与制作清单
适合
完成第一支 30 秒短片后
版本风险
中;具体工具会变,阶段划分稳定

DaVinci Resolve 官方训练

A+ · 教材 + 素材

Beginner’s Guide 用配套素材覆盖导入、剪辑、基础调色、Fairlight、Fusion 与交付;再用 Editor、Fairlight、Colorist 指南分别深入。

复现任务
把 6–8 个生成镜头剪成 30 秒,完成四层声音
适合
所有创作者,优先级高于再学一个模型
版本风险
中;教材与软件界面可能存在版本漂移

Blender:故事板与预演

A · 官方手册

用 Grease Pencil 画关键姿势和镜头,再在 Video Sequencer 拼成 animatic。免费、离线,适合在生成之前验证节奏与调度。

复现任务
画 6 镜头分镜并输出带临时声音的 animatic
适合
想减少无效生成的人
版本风险
中;方法稳定,按钮位置可能变化

ComfyUI + Wan2.2

A+ · 官方工作流

从官方 TI2V 5B 工作流开始,下载模板和模型,保存 JSON、提示词、随机种子与输出;之后再进入轨迹、控制视频和音频驱动。

复现任务
固定输入与种子,只改变一个参数,导出三组对照
现实门槛
官方称 5B 配合 offloading 约 8GB VRAM 可运行
版本风险
高;节点、模板和不同发行通道更新不同步
TUTORIAL → LESSON

把教程读成一张生产卡

下面不是“工具介绍”,而是一套可以反复套用的拆解格式:先规定输入,再按步骤操作,最后用可见产物和检查标准判断是否真的学会。

01 · INPUT输入

命题、脚本、参考图、参考视频和声音素材。

02 · ACTION操作

只按教程解决一个控制问题,记录模型与版本。

03 · OUTPUT产物

镜头、分镜、粗剪、声音版或可复跑工作流。

04 · CHECK验收

叙事、主体、动作、剪辑、声音与成本六项检查。

05 · LOG复盘

保存提示词、输入、失败样本、采用率和未知项。

M0基础与安全:先定义能不能做术语、地区、版权、肖像、声音许可与预算边界
目标

知道文生视频、图生视频、首尾帧、参考视频、Element / Ingredients、原生音画分别解决什么问题;在生成前确认素材与发布用途。

操作
  1. 写一页项目卡:平台、画幅、时长、观众、截止日。
  2. 为人物、声音、音乐和参考作品标注来源与许可。
  3. 把订阅费、积分、等待时间和预计采用率写进预算。
验收 / 排错
  • 能说清每个输入是否有权使用。
  • 看到水印、地区限制、商用条款时暂停批量生成。
  • 不把“免费额度”当成“免费商用”。
交付物:一页合规与预算检查表;任何后续教程都先复制这张表。
M1故事与分镜:先冻结镜头功能把一句话故事变成 6–12 个可生成、可剪辑的镜头
输入

一句话命题、角色欲望、障碍、结局变化;参考梦游牛油果公开工作流,把最多精力放在剧本与分镜,而不是一开始反复抽卡。

操作
  1. 写出建立、行动、障碍、反应、转折、结果六类镜头。
  2. 每镜只保留一个主要动作和一个镜头运动。
  3. 用 Blender Grease Pencil 或纸笔画关键姿势,再在 VSE 拼 animatic。
验收 / 排错
  • 静音观看 animatic 仍能理解因果。
  • 如果一个镜头同时有三件大事,先拆镜。
  • 生成失败时回到镜头功能,不先换模型。
交付物:6–12 镜头表、粗分镜和带临时声音的 animatic。镜头表至少包含:进入状态、核心动作、退出状态、时长、主要控制。
M2图像资产:先做母版,再做变体角色、场景、道具、色板与命名规则形成可引用资产包
输入

角色设定、服装、道具、场景和参考风格;不要直接把一张复杂海报当作所有镜头的唯一参考。

操作
  1. 先生成角色正面、侧面、全身与表情母版。
  2. 分开生成服装、道具、场景和调度草图。
  3. 用 Photoshop / Photopea 合成分镜,并给每个资产命名、编号、版本。
验收 / 排错
  • 资产包能回答“谁、在哪里、拿什么、向哪走”。
  • 角色脸、服装、色板和光向跨镜头不漂移。
  • 漂移时只替换失败层,不整张重做。
交付物:资产包 + manifest(文件名、用途、版本、来源、许可)+ 6 张镜头关键帧。
M3单镜头生成:先练运动,再追风格文生、图生、镜头指令、首尾帧与单变量对照
输入

一张构图明确的关键帧、一项主要动作、一个景别和一个相机运动;首轮不要写长篇世界观。

操作
  1. 文生视频写“画面 + 运动”;图生视频优先写相机和主体如何动。
  2. 从固定机位开始,再加入推、拉、跟拍或转场。
  3. 同一输入只改一个变量,保留失败样本与采用原因。
验收 / 排错
  • 主体身份稳定,动作方向可读,镜头没有无意切换。
  • 动作混乱时删掉次要动作、缩短时长、固定镜头。
  • 同一镜头可用 Runway、即梦、Seedance、可灵或海螺做 A/B。
交付物:3 个 5 秒镜头(固定、推近、跟拍)+ prompt log + 失败对照;记录生成次数与最终采用率。
M4一致性与控制:记录模型能控制什么Ingredients、Element、参考视频、轨迹与首尾帧的控制矩阵
输入

同一角色参考包、同一场景关键帧、5–10 秒参考运动视频,以及需要保持的首帧与尾帧。

操作
  1. Flow 用 Ingredients / frames 和历史版本建立场景。
  2. 可灵用 Element、首帧 + 角色参考和多镜头分镜测试角色与对白。
  3. Firefly 分开做构图参考和运动参考;记录哪些选项互斥。
验收 / 排错
  • 同角色跨三场景,脸、服装、比例和光向可辨。
  • 参考视频只迁移构图或运动,不要同时要求完全换风格。
  • 控制失效时先检查输入画幅、时长、格式和功能地区。
交付物:同角色三镜头 + 控制矩阵(输入、控制项、有效/失效、版本、失败样本)。
M5剪辑叙事:把离散镜头变成因果粗剪、精剪、J/L cut、节奏与连续性
输入

6–12 个生成镜头、镜头表、临时声音和项目输出规格;先不追求每个镜头都漂亮。

操作
  1. 先做无声粗剪,检查建立—行动—反应—结果是否清楚。
  2. 精剪时删掉重复信息,保留进入与退出状态。
  3. 用 J/L cut、动作匹配和少量转场连接镜头,不用音乐掩盖结构问题。
验收 / 排错
  • 陌生人静音观看能复述主要变化。
  • 节奏拖沓时先删镜头,不先加特效。
  • 连续性断裂时用关键帧、声音或遮挡完成过渡。
交付物:30 秒粗剪、精剪版、时间线截图和镜头采用表(采用 / 淘汰 / 原因)。
M6声音:四层设计,不靠音乐遮丑对白 / 旁白、环境声、动作音效、音乐与混音
输入

粗剪画面、对白文本、环境声参考、动作音效和音乐草稿;声音克隆必须确认本人授权与平台条款。

操作
  1. 先铺环境声,建立空间和时间。
  2. 再对齐对白与动作音效,给关键动作留出听觉重点。
  3. 最后加入音乐、留白和响度自动化,导出字幕与音频 stem。
验收 / 排错
  • 关闭音乐仍能听出空间、动作和对白。
  • 对白被盖住时先降音乐,不先整体加音量。
  • 声音与画面错位时检查帧率、采样率和起始时间码。
交付物:四层声音版、混音清单、字幕文件和一份声音许可记录。
M7调色、修补与交付:统一观看体验色彩管理、局部修补、输出规格与平台版本
输入

精剪画面、声音 stem、字幕和发布平台要求;先确定主版本,再派生 16:9、9:16 或无字幕版本。

操作
  1. 统一曝光、白平衡、黑位和主色,不追求每镜都“更艳”。
  2. 修补穿帮、人物边缘、画面文字和明显噪点。
  3. 按平台检查画幅、码率、字幕、AI 标识与版权信息后导出。
验收 / 排错
  • 连续镜头色温与肤色不跳变。
  • 修补不改变主体身份和镜头意图。
  • 在手机和电脑各看一次,确认字幕安全区与声音峰值。
交付物:master、平台版、缩略图、字幕、AI 使用说明和版权记录。
M8本地可复现:ComfyUI + Wan2.2先复跑官方模板,再进入轨迹、首尾帧和音频驱动
输入

已更新的 ComfyUI、官方工作流 JSON、模型文件、同一张参考图和固定提示词;5B offloading 能启动不等于高效生产。

操作
  1. 在 Workflow → Browse Templates → Video 加载 Wan2.2 TI2V 5B。
  2. 核对 diffusion model、VAE、text encoder 的目录与节点。
  3. 固定输入和随机种子,只改变一个参数;再学习 14B T2V / I2V / FLF2V / S2V。
验收 / 排错
  • JSON 可重新打开,节点、模型、种子和输出都能追溯。
  • 缺节点先更新 ComfyUI、检查启动日志,不盲装节点包。
  • 显存不足时降分辨率、缩短帧数或使用 offloading,并记录速度。
交付物:可复跑 workflow JSON、run manifest、三组单变量对照和失败档案;把“能运行”与“可生产”分开记录。
M9端到端案例复刻:把教程变成作品DiDi_OK × Mx-Shell × 梦游牛油果:公开事实、推断与未知分开写
输入

任选一个案例,使用同一套 6 镜头脚本、角色资产包和测试表;不把访谈中未披露的工具或成本写成确定事实。

操作
  1. DiDi_OK:先写感受、观众体验、表达形式与周期。
  2. Mx-Shell:先冻结角色、场景、道具和调度资产。
  3. 梦游牛油果:剧本 / 分镜 → 图片转视频 → 声音与剪辑。
验收 / 排错
  • 完成 15–30 秒片,并附镜头表、提示词、资产清单。
  • 复盘中分三栏写:公开事实、合理推断、仍未知。
  • 下一轮只选择一个最低分项改善。
交付物:成片 + 一页 postmortem:三个有效控制、三个主要失败、单位可用镜头成本和下一轮唯一重点。
不推荐作为主线:标题承诺“7 天精通 / 学完变现”、只展示蒙太奇成片、没有原始输入与失败样本、靠资料包或私域引流的教程。二手技巧可以补充,但每个关键操作都应回到当前版本的官方文档核对。
09 · Four-week roadmap

四周训练,
每周都有成片

勾选状态会保存在当前浏览器。每项任务都以可见产物结束,避免陷入“看了很多教程,但没有作品”。

WEEK 01

镜头语言与运动

产物:15 秒镜头练习
WEEK 02

可控性与一致性

产物:同角色三镜头
WEEK 03

叙事、剪辑与声音

产物:30 秒完整短片
WEEK 04

稳定生产与作品集

产物:60 秒代表作
10 · Prompt lab

把提示词写成
镜头指令

好提示词不是形容词堆砌,而是一份清晰的“拍摄任务书”。先描述画面中发生什么,再描述摄影机如何观察。

11 · First project

第一支 30 秒短片
这样拆镜头

示例命题:“一个深夜加班的人,在离开办公室时发现城市停电,随后看见久违的星空。”每个镜头只承担一个叙事功能。

镜头叙事功能画面建议时长主要控制
S01建立环境空旷办公室,只剩一盏台灯和窗外城市灯光。3 秒全景、固定机位
S02介绍主角疲惫的人合上电脑,揉眼睛,收拾背包。4 秒中近景、单一动作
S03触发事件所有灯突然熄灭,人物停住,抬头。3 秒首尾状态、光线变化
S04制造悬念人物借手机微光走过黑暗走廊。5 秒背后跟拍、稳定步态
S05揭示变化推开天台门,黑暗城市上方出现密集星空。5 秒门作遮挡转场、缓慢推进
S06情绪反应人物面部特写,从惊讶逐渐露出微笑。4 秒特写、微表情、固定镜头
S07结束余韵人物背影面对星空,城市轮廓保持黑暗。6 秒大全景、缓慢拉远、标题空间
12 · Daily practice

每天一小时,
训练一个变量

不要把一小时全部花在生成等待上。观察、设计、生成与复盘缺一不可;只有最后一步能让经验累积。

10′拆镜头

分析一个广告或电影镜头的景别、运动与信息功能。

10′定变量

今天只比较一个变量,例如推镜速度或角色动作幅度。

30′生成

做四个版本;每轮只改一个控制条件。

10′复盘

保存最佳、最差版本,并写一句因果判断。

13 · Portfolio challenges

三次项目挑战,
建立作品集

每个项目都引入一个新的难点。完成顺序比规模更重要:先做短、做完、复盘,再扩大。

CHALLENGE 01 · 15S

无对白情绪片

用三个镜头表达“等待”“错过”或“释然”。全片只能有一个角色,禁止旁白解释。

验收:静音观看时,陌生人能说出主要情绪变化。
CHALLENGE 02 · 30S

产品概念广告

为一件真实产品设计六个镜头:问题、出现、细节、使用、结果、品牌收束。

验收:产品形态和标识稳定;观众能说出一个明确卖点。
CHALLENGE 03 · 60S

完整叙事短片

一个角色、一个地点、一次不可逆变化。加入环境声、动作音效、音乐与留白。

验收:角色和空间连续;故事具有开端、转折与结果。
14 · Quality review

不要只问“好不好看”,
用六项指标评估

拖动滑杆为当前作品评分。低分项比总分更重要:下一轮只集中解决最低的一个维度。

6
6
6
6
6
6
15 · Failure clinic

常见失败,
通常不是模型太差

展开查看诊断。越早学会缩小问题,越少浪费生成额度。

01一个镜头里安排太多事件
修复:把“走进房间、拿起杯子、回头说话、窗外爆炸”拆成四个镜头;每个镜头只保留一个主要动作和一个情绪变化。
02形容词很多,但摄影机不明确
修复:删除“震撼、史诗、顶级”等抽象词,补充景别、机位、运镜方向、速度、焦点和镜头时长。
03直接文生长片,角色不断变化
修复:先冻结角色参考包和场景关键帧,再逐镜头做图生视频;在后期而非模型内部建立长时间连续性。
04只生成漂亮镜头,不考虑剪辑点
修复:在生成前规定镜头的进入状态、核心动作和退出状态,并留出 0.5–1 秒可剪辑余量。
05每次同时改变所有参数
修复:建立实验表:保留同一参考图和基础提示词,每轮只改变相机运动、动作或光线中的一个。
06忽视声音,依赖背景音乐掩盖问题
修复:先完成环境声和动作音效,再加入音乐;为关键画面设计声音提前、延迟或突然留白。
16 · Technical track

如果你想进入
模型与本地工作流

技术学习应建立在创作判断之上,否则容易只会连接节点,却无法判断输出是否真正可用。

STAGE 01 · FOUNDATION

生成基础

  • 扩散模型与流匹配的直觉
  • VAE、潜空间与采样过程
  • Transformer / DiT 基础
  • 文本与视觉条件如何进入模型
STAGE 02 · VIDEO

时间建模

  • 空间注意力与时间注意力
  • 3D latent 与时空压缩
  • 长视频误差累积和身份漂移
  • 运动、物理与镜头一致性
STAGE 03 · CONTROL

可控生成

  • 首尾帧、参考图和主体绑定
  • Pose、Depth、轨迹与视频条件
  • Video-to-Video 与局部编辑
  • LoRA、风格与角色定制
STAGE 04 · WORKFLOW

节点系统

  • 从官方 ComfyUI 工作流开始
  • 记录模型、参数、随机种子
  • 批量队列、插帧、放大和输出
  • 避免一开始安装大量自定义节点
STAGE 05 · EVALUATION

评测体系

  • 提示遵循与镜头可控性
  • 时间一致性与身份保持
  • 运动合理性和物理错误
  • 人评、失败类型与使用成本
STAGE 06 · PROJECT

研究项目

  • 冻结一组测试提示和参考素材
  • 比较单一控制变量
  • 保存工作流、原始输出和评审
  • 从失败分布提出改进假设
技术进阶的完成标准:不是“成功运行某个工作流”,而是能对同一组输入稳定复现结果、解释关键变量,并用预先定义的指标比较两种方案。
已复制提示词