摘要:画面单独看都不错,连起来却像素材轮播,问题通常出在生成之前。本文用一支真实的 15 秒角色 PV,拆解信息预算、四段叙事任务、六镜头表格和验收方法,并附可以直接套用的分镜模板与 Codex 提示词。

关键词:AI视频、短视频分镜、Codex、AIGC、动漫PV、提示词

很多 AI 视频都有一种很微妙的问题。

单独暂停任何一帧,人物、光影、场景都挺好看;完整播放一遍,却说不清刚才发生了什么。第一段是人物特写,第二段切到城市,第三段突然跑起来,最后再放一个标题。素材都在,故事没有连上。

遇到这种情况,人很容易继续改提示词:让运镜更电影感,让光影更高级,再多生成几版。但如果镜头之间没有因果关系,画面越精致,拼接感反而越明显。

我最近把一套角色设定资产做成了 15 秒动漫概念 PV。真正花时间的部分,并不是某一个镜头怎么动,而是决定这 15 秒只讲什么、先让观众知道什么,以及哪些不错的素材暂时不用。

这篇就把这套分镜方法单独拆开。它不依赖某一个视频模型:即梦、可灵、Runway、图生视频工具,或者 Codex + HyperFrames 的代码视频流程,都可以用。

一、先判断:你的成片是在讲故事,还是在展示库存

“像素材拼接”并不等于素材少,很多时候恰好相反,是素材太多。

角色正面、侧面、奔跑、蹲下、城市夜景、设备特写、粒子转场,每一项都舍不得删,于是只能给它们平均分时间。最后变成一张图出现两秒,再换下一张。

可以先做一个很简单的检查:把画面内容都遮住,只读每个镜头的文字说明。

如果得到的是下面这种清单:

镜头1:角色正面
镜头2:城市夜景
镜头3:动作展示
镜头4:设备特写
镜头5:标题出现

它描述的是“我有哪些素材”,没有说明这些镜头为什么按这个顺序出现。

能成立的分镜,读起来应该更接近一条变化:

城市突然断联
→ 异常信号比当前时间快了七分钟
→ 系统确认接收者身份
→ 角色从待命状态进入行动
→ 她在雨夜节点接通了任务

这里先不谈画面美不美,至少上一件事会推动下一件事。观众看到的是一次事件,而不是五份素材。

二、生成之前,先写出“一句话变化”

15 秒装不下完整世界观,但足够表现一次清楚的变化。

所以在列镜头之前,我会先写一句:

谁,在什么状态下,因为发生了什么,变成了什么状态?

例如这支角色 PV 的一句话变化是:

城市节点维护员林澈原本处于待命状态,收到一条来自未来七分钟的求救后,确认坐标并启动任务。

这句话同时给出了开头和结尾:开头是“待命与异常”,结尾是“行动与接通”。中间的镜头只需要负责把这次变化讲通。

如果一句话写成下面这样,就还不能直接分镜:

展示一名未来城市维护员的形象、能力和世界观。

“展示”没有方向,也没有结束条件。正面图能展示,三视图能展示,连续放十张场景图也算展示,最后自然会变成素材陈列。

可以把它再追问一步:

  • 她在 15 秒内具体遇到了什么?
  • 这件事迫使她做出什么动作?
  • 最后一秒和第一秒相比,状态发生了什么变化?

这三个问题能答出来,再开始生成会稳很多。

三、给 15 秒做“信息预算”

短视频不是把长故事加速播放。时间越短,越需要控制每一段承担的信息量。

我更习惯把 15 秒拆成四个信息阶段:钩子、识别、升级、兑现。注意,它们不是固定的四个镜头,一个阶段完全可以包含两个短镜头。

信息阶段参考时长要解决的问题观众看完应该知道什么
钩子0—2.5s为什么要继续看发生了一件不正常的事
识别2.5—5.5s谁在处理这件事主角身份和稳定识别点
升级5.5—11s事情如何向前发展角色开始判断、移动或行动
兑现11—15s前面的承诺有没有落地任务启动、结果出现或悬念成立

在这里插入图片描述

这组时长不是平台标准,只是适合这次概念 PV 的起点。产品演示、知识口播、剧情反转会有不同节奏。真正有用的是后面那一列:每一段必须完成一个观众能感受到的任务。

钩子不是先放最漂亮的画面

漂亮只能让人停一下,异常和问题才能让人想知道后面发生什么。

“一个好看的角色站在城市里”很难形成追问;“城市已经断联,但她收到一条来自未来七分钟的信号”,观众会自然想知道信号是谁发的、她准备怎么做。

识别阶段只留必要信息

15 秒里没必要交代完整姓名、年龄、经历、所属组织和所有装备。让观众记住名字、职业和两三个视觉锚点已经够用。

这支 PV 保留的是短发薄荷挑染、橙色通信器和深绿工具包。其余设定继续放在角色设定表里,不强行挤进视频。

升级必须出现动作或判断

从人物正面切到侧面,不一定算推进。镜头变了,人物状态没变,观众仍然会觉得在看展示页。

升级可以很小:角色抬头确认信号、终端坐标锁定、从站立切到奔跑。只要状态确实向前走了一步。

兑现要回答开头提出的问题

开头写“来自未来的求救”,结尾却只停在角色摆姿势,前面的钩子就没有落地。

这次结尾进入雨夜节点,屏幕从故障状态切换为通道建立。它没有讲完后续剧情,但至少证明角色真的接下了这次任务。

四、四个信息阶段,最后拆成六个镜头

有了信息预算,才开始写实际镜头。

这次 15 秒没有机械地做成四个等长镜头,而是拆成六个。钩子和升级阶段各需要两个视觉落点,识别和兑现各用一个相对完整的镜头。

镜头时间叙事任务画面主体动作与运镜声音如何接下一镜
010—1.1s建立异常黑暗城市节点、断联提示扫描线进入,节点轻微脉冲低频底噪扫描线擦出信号界面
021.1—2.5s抛出时间钩子+07:00 与求救文本时间码跳变,波形放大故障脉冲波形峰值触发身份扫描
032.5—5.5s确认接收者林澈半身、通信器、工具包角色轻推近,识别点依次锁定三次确认音最后一个识别框变成转面窗口
045.5—7.4s从设定进入空间正、侧、背转面三个平面错位切换节拍抬升侧面轮廓接动作方向
057.4—11s进入行动行走、奔跑、检修动作动作视窗按节奏切换三个短促冲击音奔跑方向匹配雨夜场景
0611—15s兑现任务雨夜节点检修镜头缓慢推进,节点由橙转绿雨声、通道确认音标题在动作完成后出现

这张表里最重要的不是“运镜”一列,而是“叙事任务”和“如何接下一镜”。前者防止镜头变成装饰,后者用来解决拼接感。

如果相邻两行之间说不清关系,就先不要急着为它们写提示词。

五、每个镜头只需要写清六件事

很多人写分镜提示词时,会把风格词堆得很满:电影感、史诗、超精细、动态运镜、氛围光、8K。真正到了生成阶段,最基础的动作方向和衔接方式反而没有写。

一张可执行的镜头卡,先写清下面六项:

  1. 时间:镜头从第几秒到第几秒;
  2. 任务:它负责钩住、解释、升级还是兑现;
  3. 主体:观众第一眼应该看谁或什么;
  4. 变化:镜头内部必须发生一次什么变化;
  5. 衔接:上一镜怎样进来,下一镜怎样出去;
  6. 声音:哪一个动作需要声音帮助观众感知。

在这里插入图片描述

例如第 2 镜可以写成:

时间:1.1—2.5秒
任务:让观众意识到信号来自未来七分钟
主体:画面中央的“+07:00”时间差,以及下方异常波形
变化:普通时间码跳变为+07:00,波形随后放大一次
衔接:承接上一镜扫描线;波形峰值扩展成下一镜身份扫描框
声音:时间跳变时一次电子故障音,波形峰值一次低频冲击

写到这个程度,才知道应该让图像模型生成什么、让视频模型动什么、后期又需要补什么。

六、不要强迫一个工具完成整支视频

分镜确定以后,还要给每个镜头选合适的执行方式。

镜头需求更适合的方式
人物转头、奔跑、抬手、环境运动图生视频或视频生成模型
准确中文、时间码、数据界面、字幕剪辑软件或代码后期
三视图、动作设定、产品界面展示可控的二维排版与动效
雨、烟、光线、轻微镜头运动视频模型或后期特效均可
首尾严格对齐、品牌版式、数据同步时间线工具或代码驱动视频

比如“人物在雨夜检修设备”适合先做动态画面;“+07:00”“身份确认”“通道建立”这些需要准确显示的内容,放到后期会更稳。

如果要求视频模型同时保证人物一致、动作准确、中文正确、界面不变和转场卡点,任何一个环节漂移都要整段重来。把任务拆开,并不意味着流程更复杂,很多时候反而省生成次数。

七、三个最容易造成拼接感的地方

1. 镜头顺序来自文件夹排序

先展示正面,再展示侧面,然后动作、场景、细节,看起来很完整,但这是角色资产的整理顺序,不是观众理解事件的顺序。

修正方法是先写“一句话变化”,再问每份素材能否帮助这次变化。暂时用不到的图就留在素材库,不必为了证明做过而放进成片。

2. 每个镜头都从零开始

上一镜人物向右跑,下一镜突然静止在画面左侧;上一镜还是橙色故障,下一镜无缘无故变成绿色完成。单镜头都没错,连接处却断了。

至少保留一种连续性:

  • 方向连续:向右跑,下一镜仍沿右侧进入;
  • 形状连续:圆形扫描框扩展成设备节点;
  • 颜色连续:故障橙先进入转场,再切换为确认绿;
  • 声音连续:上一镜的脉冲尾音延续到下一镜入口;
  • 动作连续:手伸向终端,下一镜接触屏幕。

不需要五种全部使用,一种明确的连接就比随机闪白和淡入淡出有效。

3. 每一秒都在抢注意力

短视频不等于所有元素都要高速运动。标题、人物、背景、粒子、镜头同时变化,观众反而抓不住主信息。

我会给每个镜头只设一个主动作。其他元素可以呼吸、漂移或保持静止,但不能与主动作争夺视线。

八、写完分镜后,先做一次“删除测试”

在真正生成之前,把每个镜头依次删掉一次。

删掉后故事仍然完全成立,这个镜头很可能只是装饰;删掉后观众不知道角色是谁、不明白为什么行动,或者看不到结果,它才承担了必要任务。

还可以顺手检查下面五件事:

  • 前 2 秒是否真的产生了一个问题,而不是只出现标题;
  • 相邻镜头之间是否至少保留一种连续性;
  • 同一时刻是否只有一个主要阅读对象;
  • 开头承诺的内容,结尾是否至少兑现一次;
  • 最后一个镜头是否留够时间让观众看清,而不是刚出现就结束。

这一步花十分钟,通常比生成五版再返工更划算。

九、让 Codex 先做分镜,不要直接让它生成视频

如果只是对 Codex 说“帮我做一条 15 秒 AI 视频”,它只能自己补全缺失的故事、素材和验收标准。结果可能看起来很完整,但未必是你真正想讲的东西。

可以先用下面这段,让它停在分镜阶段:

我要制作一条15秒竖屏短片。现在不要生成图片、视频或代码,先完成分镜设计。

短片主题:<填写>
目标观众:<填写>
一句话变化:<谁从什么状态,因为发生什么,变成什么状态>
已有素材:<角色、场景、产品界面、音频等>
必须出现:<填写>
明确不要出现:<填写>
发布平台与画幅:<填写>

请先输出:
1. 这条短片唯一需要讲清楚的事情;
2. 钩子、识别、升级、兑现四个信息阶段及时间预算;
3. 5—7个实际镜头,逐个写明时间、叙事任务、主体、镜头内变化、衔接方式和声音落点;
4. 哪些素材虽然好看,但这次建议不用;
5. 仍然缺失、会影响制作的素材。

约束:
- 不要把素材目录直接改写成镜头顺序;
- 一个镜头只设置一个主动作;
- 相邻镜头至少有一种方向、形状、颜色、声音或动作连续性;
- 开头提出的问题必须在结尾得到回应;
- 信息不足时标记问题,不要自行编造设定。

拿到第一版后,再让它做一次反向检查:

请暂时不要优化措辞,直接审查这版分镜。

逐镜头回答:
- 删除它以后,故事是否仍然成立?
- 它是在推进事件,还是只展示素材?
- 观众这一秒应该看哪里?
- 它与上一镜靠什么连接?
- 这个动作适合视频模型生成,还是更适合后期完成?

最后给出一版删减后的分镜表,并说明删掉了什么、为什么删。

第二段往往比“再帮我优化得更有电影感”有用。它逼着方案先过逻辑,再进入审美调整。

十、空白分镜模板:可以直接复制

下面这份表格可以放进 Markdown、飞书、Notion 或 Excel。实际镜头数不必固定为六个,够用就停。

## 短片基本信息

- 时长:15秒
- 画幅:9:16 / 16:9
- 一句话变化:
- 目标观众:
- 必须出现:
- 本次舍弃:

## 信息预算

| 阶段 | 时间 | 观众需要知道什么 |
|---|---|---|
| 钩子 | 0—__s | |
| 识别 | __—__s | |
| 升级 | __—__s | |
| 兑现 | __—15s | |

## 逐镜头表

| 镜头 | 时间 | 叙事任务 | 主体 | 镜头内变化 | 衔接方式 | 声音落点 | 执行工具 |
|---|---:|---|---|---|---|---|---|
| 01 | | | | | | | |
| 02 | | | | | | | |
| 03 | | | | | | | |
| 04 | | | | | | | |
| 05 | | | | | | | |
| 06 | | | | | | | |

## 生成前检查

- [ ] 前2秒出现了明确问题或变化
- [ ] 每个镜头只有一个主动作
- [ ] 相邻镜头至少保留一种连续性
- [ ] 准确文字和界面已安排到后期
- [ ] 开头承诺在结尾得到回应
- [ ] 每个镜头都通过删除测试

十一、什么情况下不适合套这套四段结构

这套方法适合角色先导、产品概念、事件预告、作品集短片,以及有明确“状态变化”的 15 秒内容。

下面几类视频要调整:

  • 纯氛围视频:重点可能是情绪延续,不一定需要身份识别;
  • 口播知识视频:核心是观点和证据,信息阶段更适合改成问题、解释、例子、结论;
  • 产品操作演示:应该围绕操作步骤和结果,不必硬加剧情悬念;
  • 复杂剧情短片:15 秒可能只够讲一个场景,需要先从长故事中截取一个完整片段。

方法的价值不是把所有短片变成同一种节奏,而是提醒我们:生成之前,先确定观众在每一秒为什么继续看。

十二、继续阅读:按你现在卡住的位置选下一篇

看到这里,不需要把所有文章从头读一遍。先判断自己卡在哪一步,再选一篇继续:

1. 角色形象不稳定,换个动作就像换了一个人

先把角色资产固定下来,再谈分镜和动画:

第一篇解决角色资产怎么做,第二篇完整展示角色设定表怎样进入时间线、动效、音效、转场排错和最终验收。

2. 想让 Codex 接手制作,但又怕它理解错、改得太多

可以沿着“先理解项目,再选对规则载体,最后把排错流程做成 Skill”的顺序继续:

这些方法不只适用于写代码。分镜规范、素材目录、渲染命令和验收条件,同样需要清晰的任务边界。

3. 渲染和检查还在电脑上运行,但人要离开

先比较几种常见方案,再决定是否需要把本地 Agent 会话延伸到手机端:

更多实战文章可以从 CSDN 作者主页 继续查看。

十三、关于 Linco Bridge

做 AI 视频时,素材分析、批量渲染和抽帧检查经常需要几分钟甚至更久,人不一定一直坐在电脑前。

Linco Bridge 是我们开源的本地 Agent 跨端连接项目,可以把电脑上的 Codex、Claude Code、Hermes 等会话延伸到手机端,方便离开电脑后继续查看进度、回复确认和处理下一步。

它不参与视频生成,也不会替你决定分镜。它解决的是任务已经在电脑上运行,人离开以后怎么继续跟进。


AI 视频的第一版分镜,不需要写得像专业电影脚本。先把一件事讲通,把每个镜头存在的理由写清楚,已经能避开很多无效生成。

画面当然重要。但当所有画面单独看都不错,成片仍然像拼起来的,下一步应该检查的往往不是模型,而是镜头之间到底有没有关系。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐