从 0 到 1:一个人怎么用 AI 做完一部片
好看的画面不等于好看的故事。把导演判断写成调度,把调度转成可执行的提示词,再把生成的素材剪成作品。这一课,从一个眼神、一束光、一次切镜开始,建立你自己的制作流程。
01课程介绍:你来决定怎么拍#
上一课,你已经尝试用 AI 整理剧本和分镜。这一课再向前一步:不要把“分镜表填满了”当成“这场戏成立了”。观众应该先看到谁,在哪句话之后看见反应,何时靠近、何时退开,这些决定需要你来检查和取舍。AI 可以提供候选、补充细节和转写指令,不能替你承担作品的判断。
本课由 Ksr 桑主讲,以短片《删除》和 Seko 雨夜便利店实操为例,走完“剧本 → 调度 → 提示词 → 生成 → 验收 → 剪辑”。准备一个核心场景、已确认的角色参考,以及你熟悉的剪辑软件;先完成一段不少于 15 秒的场景动画,不急着铺开整部片。
摄影机放在哪里、怎样移动、画面里有什么、人物做什么、声音何时发生——把这些提前写清,就是调度。它把“我要观众感受到什么”,翻译成“摄影机会拍到什么”。
画面缺少生活感,不一定换模型就能解决。人物说话前的吸气、手伸出又收回、路人的交错行走、窗帘随风摆动,都可能影响可信度。不要赌模型会自动补齐你最在意的细节;也不必把所有细节都塞进去。写清会影响本镜判断的动作,再用生成结果验证。
02视频课程与实操资料#
下面按本课 51:01 版本列出大致复习区间。观看时可以拖动视频进度条对照;主题链接只定位到本页正文,不会自动跳播。换用剪辑版本后,时间可能不同。
| 视频区间 · 约 | 带着问题回看 |
|---|---|
| 00:00—04:50 | 调度与生活感:哪些决定要在生成前写清? |
| 04:50—09:50 | 镜头语言:景别、机位、运镜、正反打分别控制什么? |
| 09:50—13:50 | 《删除》调度对照:同一段故事,怎样出现情绪递进? |
| 13:50—22:20 | 写调度:怎样交代动作、空间、台词、声音和时长? |
| 22:20—31:40 | 转写 CLIP:怎样分配参考图职责,减少相互矛盾的指令? |
| 31:40—36:20 | 场景与四宫格:怎样在画布里固定角色和世界的外观? |
| 36:20—44:10 | 五镜实操:手写调度怎样经过转写、补参考,进入视频生成? |
| 44:10—46:50 | 验收候选:人物出场、开罐、行走,哪些片段值得留下? |
| 46:50—49:40 | 剪辑成片:怎样从不同候选里挑镜头,而不是整条照收? |
| 49:40—51:01 | 创作练习:完成不少于 15 秒、角色与画风统一的核心场景。 |
把需要的工具带走
三个 Skill 包保存的是提示词编写规则与参考文档,不是软件安装包。可以先解压阅读;使用支持 Skill 的创作工具时,再按该工具的方式导入,保留包内文件结构。加载规则不会自动完成创作,仍要提供你的剧本、角色、调度和验收要求。
| 资料下载 | 适合什么时候用 |
|---|---|
| KSR 导演顾问 · ZIP | 讨论镜头方案,检查情绪、节拍、人物关系和每镜的设计理由。把结果当候选,不直接当定稿。 |
| KSR 电影机分镜提示词书写 · ZIP | 把确认后的调度转成 CLIP 提示词,参考格式、生成前检查和迭代修复方法。 |
| KSR 角色四宫格提示词书写 · ZIP | 编写角色四面板与场景参考图提示词,检查角色区分、材质与光线。 |
| 单图转换四宫格 · TXT | 已经选定角色原图时直接使用;下方也提供同一份提示词的复制入口。 |
包内有针对特定模型、写实风格与动作场景的经验规则。先取用适合当前镜头的部分:动画不必套写实胶片要求,平静对话也不必每镜换一种运镜。模型名称、时长、素材数量与费用,以你正在使用的界面为准。
03先分清四件事:拍多大、从哪看、怎么动、何时切#
景别:你想让观众看环境,还是看反应
景别描述主体在画面里占多大范围,并不只由摄影机的距离决定,焦距与裁切也会改变它。入门先掌握下面五档;不同教材的分界略有差异,实际写提示词时,把画面裁到哪里、什么必须看清一起写出来。
| 景别 | 画面范围与用途 |
|---|---|
| 远景 | 环境占主导,人只是其中一小部分。交代世界、处境、距离与孤独感。 |
| 全景 | 人物从头到脚进入画面。看清站位、身体动作与人物关系。 |
| 中景 | 常截取人物腰部或膝部以上,具体范围写明。兼顾对话、手部动作与周围环境。 |
| 近景 | 常到胸部以上,突出面部反应、视线与亲近感。 |
| 特写 | 集中看脸,或手、手机、眼泪等局部。让某一个信息获得强调。 |
“离得越近,情绪越紧”可以作为选择的起点,但不是必然结果。特写也能冷漠,全景也能令人难过。先问这一镜要让人理解什么,再决定靠近还是退远,不要整场都用特写消耗强调。
机位与运镜:位置和运动不是一回事
- 机位与角度:平视是接近眼睛高度看人;俯拍是从上向下;仰拍是从下向上。还要交代相机在人物正面、侧面、背面或某件道具后面。
- 推:摄影机靠近主体,逐渐集中注意力。与改变焦距的变焦区分开,不用一句“拉近”混写两种动作。
- 拉:摄影机远离主体,逐渐露出环境,让人重新看见人物的处境。
- 摇:机身位置基本不变,转动拍摄方向,像站在原地转头。
- 移:摄影机整体平移,前后景的相对位置也随之变化。
固定镜头也是选择。每一镜先设一个主要运动,别同时要求“机位不动、环绕一圈、迅速推近”。手持也不等于全程剧烈摇晃:动作的幅度要让观众仍能看清关键信息。
正反打:不只是轮流拍说话的人
两人对话中,镜头在双方之间交替,形成正反打;从一人的肩后看另一人,是过肩拍法。先画出两人的站位和相互视线,把摄影机放在两人连线的同一侧,帮助观众保持方向感。换角度时同时检查左右位置、目光方向和前景肩膀是否正确。
关键句落下后,不必一直拍说话者。切到听者握紧的手、迟来的抬眼或突然停住的呼吸,观众才能看见这句话产生了什么后果。
04《删除》:把“讲完故事”变成“经历一场戏”#
这场戏的故事事实很简单:男主看到妻子以 AI 的方式再次出现,随后被“主人”这个称呼刺痛。只把双方台词依次拍完,观众能知道事件,却未必能经历人物的情绪变化。
- 激动:熟悉的形象再次出现,他重新产生期待。
- 尝试靠近:他伸手触碰屏幕,暂时相信失去的人回来了。
- 希望被打断:“主人”暴露了这段关系与过去的不同。
- 崩溃、离场:动作和空间发生变化,让观众感到靠近之后的落空。
同一场戏的两种调度,先看画面如何分配注意力,再回看约 10:40—11:45 的连续片段,判断转折落在哪里。下面两张定格分别取自两版演示,用于观察构图,不把单帧当作完整表演的证明。


先判断:只把男主表情写得更夸张,能解决情绪递进吗?
不够。需要先安排“期待 → 靠近 → 被打断 → 退出”的变化,再选择镜头。把机位放到显示屏后侧,用屏幕、支架和键盘形成前景遮挡,可以压缩人物在画面中的空间;到触碰的时刻,窗光、桌面和猫的活动又让他置身于一个仍在继续的日常世界。表演、构图、环境共同起作用,不是只给脸增加形容词。
为自己的场景写一句镜头目的:“这一镜让观众第一次意识到什么?”如果只能答“看起来很高级”,继续推敲。分镜的设计理由应来自人物和情节,而不是凑满术语。
05写调度:把抽象情绪拆成可见、可听的事实#
从“他很紧张”到一条动作链
他非常紧张、忐忑,想说话又不敢开口。
他低头看着下方,抬眼望向对方,头微微抬起;抿嘴,嘴唇张开,吸一口气;话没出口,又合上嘴,把头低下。
这些动作把“想开口又退缩”拆成观众能看见的过程。不要把整条链强塞进一两秒:先按需要的表演速度试演,留下关键动作和停顿,再分配时间。一次只强调少数变化,避免从头到尾挤眉弄眼。
身体也要连起来:转头时肩膀怎样跟随,拿起东西时重心怎样调整,站定后是否还有自然呼吸。只写“右手举起”,可能得到一只在动的手和一具僵住的身体;但特写拍不到的脚步、背影拍不到的正面表情,也不必硬写进这个镜头。
六个维度,让调度能被检查
| 维度 | 怎样落到纸面 |
|---|---|
| 物理事实 | 把“犹豫片刻”改成“手指停在删除键上方,停留约 2 秒,再按下”。数字帮助表达意图,但不是模型精确执行的保证。 |
| 空间说明 | 写清谁在左、谁在右,朝向哪里,相机在哪一侧,以窗、门、桌子等固定物作参照。位置与朝向分别写。 |
| 台词进时间线 | 保留原句、断句、停顿与说话者,放到对应动作旁边。嘴形、节奏和反应才能一起验收。 |
| 微情绪链 | 用视线、嘴唇、呼吸、肩膀和手的变化表现情绪,而不是只加“极其悲伤”。 |
| 声画同拍 | “皮鞋缓步两三声,在空旷走廊里回响”同时交代动作、声音和空间。支持音画生成时一起检查,否则留作后期声音说明。 |
| 时长算账 | 先试读台词、试演动作,再算停顿与衔接。已有 14 秒对白的镜头,若还要留出反应,就不能只给 14 秒;16.5 秒可以是某次分配,不是通用公式。 |
估时可从“字数 ÷ 每秒字数”起步,最好直接试读。动作与台词同时发生时,不要把两者机械相加;必须先后发生的动作、呼吸和静默,则要真正留出时间。最后检查相邻段落既不重叠,也不无故留空。

场景与人物:[填写]
这一镜的目的:[观众得到什么新信息,人物关系发生什么变化]
起止时间:[起点—终点];与上一镜衔接的状态:[位置、朝向、手中道具、动作]
1. 前景有什么?清晰还是虚焦?对应的声音是什么?
2. 前景在画面哪一侧,占据哪部分空间?
3. 背景有什么?清晰还是虚焦?哪些环境变化与本镜有关?
4. 主体是谁或什么?焦点放在哪里?
5. 摄影机在哪里、从什么角度拍?
6. 景别是什么?画面裁到哪里?相机保持固定,还是执行一个主要运动?
7. 人物依次做什么?视线、呼吸、身体与道具如何配合?台词原句和关键音效落在哪一拍?
结束状态:[供下一镜接续]
验收重点:[本镜最不能丢失的一个动作或信息]
06从调度到 CLIP:五段式,让各类指令各司其职#
本课把一次生成得到的一小段视频称为 CLIP。它可以包含一个或多个镜头,不等于整场戏,也不等于机器学习中的同名模型。作品最终由经过筛选的素材剪辑而成。
调度写好之后,需要转写成生成工具能接收的输入。常见风险有三类:新片段没接住上一段的位置和动作;参考图的角度压过了文字要求;过长的禁令反而反复强调了不想要的东西。五段式的目的,是把这些职责分开,方便检查和修改,而不是靠格式本身保证成功。
| 五段结构 | 这一段负责什么 |
|---|---|
| STYLE LOCK 风格锁定 | 统一画幅、色调、材质、光源和主要质感。全片沿用同一个视觉基准,少写空泛的“史诗级、电影感”。 |
| 参考图锚定 | 每张图只声明它提供什么:角色身份与服装、场景结构与材质、道具外形等。编号与实际挂载顺序一致。 |
| 空间与站位 | 重述开场人物位置、朝向和手中道具,接住上一条的末态。不假设新一次生成会自动记住上一条。 |
| CLIP 主体 | 按镜头、按时间写起始状态、主体动作、拍法、对白与音效、结束状态。把主要篇幅留给真正发生的事情。 |
| NEGATIVE 必要限制 | 保留少量场景特定的限制,例如角色复制、道具变形或画面水印。可从 3—8 条起步,不整包堆贴。 |
先让镜头主体占主要篇幅;“六成以上”是检查提示词有没有被风格词挤空的一把尺,不是需要精确凑出的字数。正文尽量写正向可见事实,把必要的排除项收在末尾。负面提示词是否有效会随工具、模型和输入方式变化,不把“所有模型都不读否定词”当定律。
参考图负责外观,镜头文字负责当前拍法
如果参考图是仰拍,正文只写“中景”,机位仍可能沿用参考图。补充可见事实比反复喊“不要仰拍”更容易检查:相机贴近湿路面,画面下缘是积水,门槛位于中部,上方能看见门楣;或者相机位于人物眼睛高度,桌面横贯画面,右侧窗光照到脸上。
检查三个匹配:景别与可见范围匹配、相机位置与遮挡关系匹配、光源与人物表面匹配。窗光从右侧来,右肩和脸部相应受光,阴影方向也要一致。需要空气感时写有来源的水汽、尘粒或蒸汽,不为凑“环境动态数量”给每个房间都加雾。
请把我已经确认的调度转写为视频生成提示词,不替我重新决定剧情、镜头顺序和情绪转折。
调度:[粘贴]
角色设定:[粘贴]
实际挂载的参考素材及顺序:[逐项列出]
目标时长与画幅:[填写,以当前工具支持的选项为准]
上一条素材的结束状态:[填写;开场则写“无”]
先单独输出“导演分析与待确认问题”,检查镜头目的、时间、连续性与指令冲突。信息缺失或原方案放不下时先指出,不偷偷增加镜头、改台词或缩短动作。
再输出可复制给视频工具的五段内容:
[STYLE LOCK] 风格、色调、材质、物理光源。
[参考图锚定] 每个素材的职责,与实际编号逐一对应;不把参考图构图当成固定机位。
[空间与站位] 本条开场的位置、朝向、道具与动作状态。
[CLIP] 镜号、连续起止时间、起始状态、可见动作、机位与运镜、台词及音效、结束状态。
[NEGATIVE] 本场景真正需要的少量限制。
保留台词原语言与原句;抽象情绪转为可见动作;只写镜头能拍到的细节。
分析说明与生成提示词分开,最后列出你建议我确认的改动,不自动执行生成。
07固定资产:先有同一个世界,再让同一个人进入#
在画布里确定场景
进入 Seko,新建空白画布。先让 Agent 生成一个明确场景,而不是同时要求整部片。雨夜便利店练习把哥特建筑与近未来电子元素放在一起:尖拱、石材、霓虹、湿路面都服务于同一个视觉方向。
先只制作一张场景参考图,不生成视频。
世界观:[填写时代、建筑与技术特征]
地点:[填写一个具体地点及其叙事功能]
时间和天气:[填写]
主要材质:[填写墙面、地面、门窗等]
光源:[写明位置、颜色、照到的物体]
空间关系:[入口、人物活动区、前景参照物、街道延伸方向]
用于本课便利店练习时:以近未来哥特街区为方向,聚焦一间街边便利店。雨后湿石路面保留霓虹反射,店内光从门口落到街面。以平视角度看清门口和周围空间,先确认建筑、材质与配色,再扩展角色和其他角度。
输出后列出需要我确认的空间与视觉选择,不自行扩写整部故事。

确认方向后,把选定场景留在画布里。需要其他角度或时段时,从同一场景延展,核对门窗位置、建筑结构和材质,不让“换机位”顺便变成“换了一条街”。
角色四宫格:锁身份,不锁表演
先制作并选定角色原图,再将它转换为四宫格:正面脸、侧面脸、正面全身、背面全身。角色参考以便于辨认、光线清楚、表情中性为起点,不要让夸张情绪和复杂环境抢走身份信息。哥特妆容与冷灰棚拍是这个角色的选择,不是所有题材的统一审美。

下面是单图转换模板。先上传你有权使用的角色原图,把 【BG】 替换为背景描述,【LIGHT】 替换为光线色调。它要求保留原有设计,但生成后仍须检查面部、发型、体形、服装细节与鞋子是否一致;“要求完全保留”不等于结果一定完全一致。
IMAGE TASK: Convert the uploaded character reference image(s) into a 4-panel character sheet.
CRITICAL PRESERVATION OVERRIDE
The uploaded image(s) are the ONLY design source. Preserve EXACTLY: facial structure, eyes, nose, mouth shape, hairline and hairstyle, age, skin tone and skin texture (real pores, natural stubble), body proportion and weight, every garment detail (cut, fabric, seams, wear, hardware), footwear. NO beautification, NO redesign, NO style drift, NO "improving" the face. The same person, four times — one identity across all panels.
OUTPUT FORMAT: single image, 2x2 grid, four equal panels, thin gutters, small panel labels in corners: "FACE FRONT / FACE SIDE / BODY FRONT / BACK".
PANEL 1 — TOP LEFT, FACE FRONT: head-and-shoulders close-up, face directly toward camera, calm neutral expression, eyes engaged but relaxed.
PANEL 2 — TOP RIGHT, FACE SIDE: same head-and-shoulders scale, clean profile view, same expression, same hair behavior.
PANEL 3 — BOTTOM LEFT, BODY FRONT: full-body standing pose, front view, face left intentionally featureless and low-detail (reserved for later editing), weight natural, arms relaxed at sides.
PANEL 4 — BOTTOM RIGHT, BACK: full-body standing pose, rear view — hair from behind, garment back seams, heel height, same standing spot as PANEL 3.
STUDIO SETUP (all four panels identical): seamless【BG】studio background, single hard key light at 45° camera-left,【LIGHT】tone, NO fill light, no set dressing, no props. Only natural contact shadows on the floor.
QUALITY: photographic character sheet for film production, even exposure, accurate fabric weave, matte skin, real pores, no gloss. Clean, clinical, production-use.
AVOID:
- FACE: no beauty-filter skin, no glossy TV-drama complexion, no idol makeup, no plastic skin, no face slimming, no enlarged eyes, no skin smoothing
- BODY: no pose change between panels, no clothing redesign, no added accessories, no height change
- LIGHT: no ambient color spill, no rim-light drama, no color temperature jump between panels
- FORMAT: no text blocks beyond small panel labels, no watermark, no second person, no inconsistent identity across panels
“四宫格没有姿势变化”应理解为体态与比例保持一致,不是四格都朝同一方向。原模板有自己的棚拍要求,使用前先决定是否适合你的画风。继续制作时,沿用 Day 2 的角色资产库方法,别为每个镜头重新设计同一个人。
08Seko 实操:把便利店出场戏变成五个镜头#
先写人话调度,再转成生成指令
场景和角色确认后,把故事收缩成一件小事:莉莉丝从雨夜便利店走出来,开一罐汽水,再沿街离开。即使没有对白,也能用出场方式、停顿、对道具的反应和走路姿态介绍人物。
先在文档中逐镜写调度,画布里的场景图放在旁边作空间参照。转写方案中的五镜时间分配如下,合计 29 秒;这是本案例的计划,不是所有生成结果必定逐秒遵守的时间轴。
| 镜头与计划时段 | 拍什么,为什么这样拍 |
|---|---|
| 1 · 建立空间 00—04 秒 · 4 秒 | 贴近湿路面的低机位,前景老鼠、路人的脚步和积水进入画面,相机横移到便利店门口。先让观众知道人即将从哪里出现。 |
| 2 · 人物出场 04—11 秒 · 7 秒 | 接住推门动作,近景跟随人物走出、停步、吸气、睁眼。右手拿汽水,左手靠近拉环;背景路人和门内光继续活动,人物不是贴在静止背景上的立绘。 |
| 3 · 道具事件 11—15 秒 · 4 秒 | 从肩旁俯看易拉罐,左手开罐,声音与气泡溢出的时刻对应,人物随之作出短促反应。让一个小动作成为性格的入口。 |
| 4 · 反应与转身 15—21 秒 · 6 秒 | 侧面略低机位,前景带上门口告示牌。衔接手上沾到饮料后的反应、甩手与转身,将动作引向街道纵深。 |
| 5 · 行走收尾 21—29 秒 · 8 秒 | 相机在人物正面后拉,接住喝饮料、落手、继续前行的动作,保留有变化的视线和街道背景。人物已经进入这个世界,场景可以接下一段。 |

注意“朝左”与“在左边”是两项信息;人物转身之后,下一镜的相机位置、手持汽水的左右关系和前景肩膀都要重新核对。道具也要按实际结构设计动作,拉环不一定能从罐身拆下,别为了复刻一句文字牺牲物理可信度。
把分析、提示词和参考素材接起来
- 转写:将调度交给已加载相应 Skill 的助手,同时提供场景与角色信息。要求保留镜头顺序、逐镜分配时间,遇到放不下的内容先说明。
- 先看分析:检查它对镜头功能、节奏与站位的理解。分析不正确,后面格式再整齐也先退回修改。
- 连接参考:在 Seko 画布中把场景、角色节点连接到视频生成节点,核对输入框里真正出现的参考素材,而不是只看画布上有没有这张图。
- 设置生成:选择当前可用且支持所需参考方式的模型、画幅和时长。案例界面使用 Seedance 2.5 的 30 秒选项承载 29 秒计划;你的工具若只支持更短片段,就在动作能衔接的位置拆分。
- 只复制执行段:从风格锁定开始,到必要限制结束。不要把“导演推理”“这场戏象征什么”和助手的聊天解释一并贴进生成框。


生成前补漏:易拉罐也是主要演员
开罐要给特写,罐子就不能每次随机变化。在生成前,补做荧光绿色易拉罐的参考图,将它和场景、角色一起挂载。写明它控制罐子的外形、材质和设计,随后检查提示词里的素材编号是否仍与界面一一对应。

截图中的提示词正在继续编辑,不能把这一帧当作全部绑定已经检查完成。你点击生成前,还要确认新加的道具在锚定段里有说明,旧编号没有指错图。
只检查下面的调度和生成提示词,暂不重写,不发起生成。
原调度:[粘贴]
生成提示词:[粘贴]
实际参考素材顺序:[列出]
目标时长:[填写]
逐项核对:
1. 镜头目的、顺序、台词是否偏离原调度;
2. 各段起止时间是否连续,总时长是否正确,动作和对白是否装得下;
3. 上一镜末态与下一镜首态:位置、朝向、左右手、道具状态、动作是否接上;
4. 景别、机位、遮挡、焦点和运镜是否相互矛盾;
5. 参考编号和职责是否对应,出镜的关键道具是否缺参考;
6. 动作、环境、光照、声音是否清楚,是否出现镜头拍不到的描述;
7. 分析文字是否混进执行段,限制是否过多或相互冲突。
输出“问题位置|具体冲突|最小修改建议”。资料不足就标为待确认,不把文本检查通过当成视频生成一定成功。
09验收与返工:每次修改都回答一个具体问题#
生成完成后,先从头看一遍,再回到关键动作逐段检查。把“这条不行”换成“第几镜、哪个时刻、哪个要求没有做到”。如果角色、场景和前三镜都合格,只是开罐缺少手部反应,不要连整套角色设定一起推翻。
| 看到的问题 | 先检查,再选择最小返工 |
|---|---|
| 正反打方向混乱 | 核对相机在哪一侧,人物位置与朝向是否分开写,前景肩膀与对方视线是否对应。 |
| 人物僵硬或表情过度 | 删去重复的抽象情绪词,保留少量可见动作,检查呼吸、肩膀和重心是否自然配合。 |
| 重要动作被跳过 | 检查分配的时间与动作数量。保住叙事必需的动作,删减次要动作,必要时拆段,不只是继续加长提示词。 |
| 参考图机位被照搬 | 缩小参考图职责,补充当前镜头能看见的前后景和拍摄位置。 |
| 角色或道具复制、变样 | 核对实际出镜人数、素材编号、外形锚定与左右手。删除不出镜角色的多余描述。 |
| 人物像贴在背景上 | 核对光怎样落在皮肤和衣物上、脚是否接地、接触面与背景运动是否自然,不靠统一加雾解决。 |
| 声音与动作错位 | 检查开罐声、脚步、对白对应的时点;判断需要重做生成,还是在剪辑中修整声音。 |
先判断:脸和画风都对,只有开罐特写不清楚,要重做整条吗?
先定位原因。若调度没交代哪只手拿罐、哪只手开罐,先补清楚;若同一秒安排了太多动作,先减负或重新分配时间。已有合格的开罐候选,可以在剪辑中替换这一镜,并检查前后动作能否接上。只有问题仍无法通过指令与剪辑解决时,再决定是否重生成。
每轮只改一到两个关键变量,保留成功部分和上一版结果,再比较是否真的解决了问题。这是控制试错成本的方法,不承诺“一遍过”。遇到平台拒绝或审核问题,按提示检查内容与素材使用权限,不通过换词掩饰同一问题来绕过限制。
这一轮只解决一个问题,不重写全部方案。
原调度与提示词:[粘贴]
问题镜号和时段:[填写]
我实际看到或听到的结果:[客观描述]
我需要的结果:[可检查的动作、构图或声音]
已经合格、必须保持的部分:[列出]
先判断问题更可能来自调度、时间分配、参考绑定、指令冲突,还是需要再次生成验证。
提出最多两个关键变量的修改;逐项说明修改位置、保留内容和复验方法。
若可以用已有素材剪辑解决,说明替换的入点、出点与连续性检查;没有看过素材就不要编造时间点。
修改后再检查总时长、站位、道具和前后衔接。不要宣称尚未验证的改动已经成功。
10剪辑成片:从不同候选里拿到同一场戏#
一条候选可能出场漂亮、开罐一般,另一条可能手部特写更清楚。保留的是能进入作品的镜头,不是必须整条接受的生成文件。把素材导入剪辑软件,按原调度排出第一版,再进行挑选、裁切和替换。
- 建立粗剪:先按“空间 → 出场 → 开罐 → 反应 → 离开”的顺序放入素材,让这件事能从头看到尾。
- 确定入点与出点:裁去多余等待、重复动作和不稳定画面,给关键动作保留完整的发生与反应。
- 替换局部:从另一条候选取更合适的特写或表演,不因某一镜好看就保留整条不合格素材。
- 检查连续性:切镜前后是不是同一只手拿罐,罐子是否已经打开,视线、行走方向、背景光和动作阶段能否接上。
- 整理声音:保持环境底声连续,保留关键动作音效,避免在切口处突断、重复或被音乐盖住。生成工具不支持所需声音时,在这里补齐。
- 导出后再看:确认最终文件能正常播放、音画同步、开头结尾没有多余黑场,角色与画风保持统一,再交付作品。

声音可以先到、也可以延续:下一场的声音先于画面进入,叫 J-cut;上一场的声音延续到下一场画面,叫 L-cut。选择哪一种,取决于你想让观众怎样进入新空间,不必为使用术语而添加转场。

11本课练习:完成不少于 15 秒的核心场景#
从你的故事里选一个核心场景,制作不少于 15 秒的动画,保持角色和画风统一。可以从 3—4 个有效镜头起步,但不把镜头数量当硬指标:有人物行动、有可见变化、能自然接起来,比切得多更重要。
- 先写清这一场的人物目标、阻碍或变化,再给每镜一句设计理由。
- 完成调度,注明机位、景别、主要运镜、动作、声音与时间。
- 确认角色、场景和关键道具参考,检查五段式提示词与素材绑定。
- 生成后逐镜验收,记录一个具体问题及本轮修改,不只记录“又抽了一次”。
- 完成剪辑,检查动作与声音衔接;播放最终导出文件确认时长和一致性。
建议把调度、参考图、最终提示词和一次返工记录一起保存。以后继续制作时,你复用的是经过检验的方法,而不只是某次碰巧满意的结果。
交付前,做三个判断
三个判断都完成了。现在用同样的标准,检查并完成你自己的核心场景。
你负责决定故事怎样被看见,AI 协助把指令变成素材。先把一场戏做成立,再把这套流程扩展到下一场。
