AI 视频总像素材拼接?先别急着生成:一套 15 秒短片分镜拆解法
摘要:画面单独看都不错,连起来却像素材轮播,问题通常出在生成之前。本文用一支真实的 15 秒角色 PV,拆解信息预算、四段叙事任务、六镜头表格和验收方法,并附可以直接套用的分镜模板与 Codex 提示词。
关键词:AI视频、短视频分镜、Codex、AIGC、动漫PV、提示词
很多 AI 视频都有一种很微妙的问题。
单独暂停任何一帧,人物、光影、场景都挺好看;完整播放一遍,却说不清刚才发生了什么。第一段是人物特写,第二段切到城市,第三段突然跑起来,最后再放一个标题。素材都在,故事没有连上。
遇到这种情况,人很容易继续改提示词:让运镜更电影感,让光影更高级,再多生成几版。但如果镜头之间没有因果关系,画面越精致,拼接感反而越明显。
我最近把一套角色设定资产做成了 15 秒动漫概念 PV。真正花时间的部分,并不是某一个镜头怎么动,而是决定这 15 秒只讲什么、先让观众知道什么,以及哪些不错的素材暂时不用。
这篇就把这套分镜方法单独拆开。它不依赖某一个视频模型:即梦、可灵、Runway、图生视频工具,或者 Codex + HyperFrames 的代码视频流程,都可以用。
一、先判断:你的成片是在讲故事,还是在展示库存
“像素材拼接”并不等于素材少,很多时候恰好相反,是素材太多。
角色正面、侧面、奔跑、蹲下、城市夜景、设备特写、粒子转场,每一项都舍不得删,于是只能给它们平均分时间。最后变成一张图出现两秒,再换下一张。
可以先做一个很简单的检查:把画面内容都遮住,只读每个镜头的文字说明。
如果得到的是下面这种清单:
镜头1:角色正面
镜头2:城市夜景
镜头3:动作展示
镜头4:设备特写
镜头5:标题出现
它描述的是“我有哪些素材”,没有说明这些镜头为什么按这个顺序出现。
能成立的分镜,读起来应该更接近一条变化:
城市突然断联
→ 异常信号比当前时间快了七分钟
→ 系统确认接收者身份
→ 角色从待命状态进入行动
→ 她在雨夜节点接通了任务
这里先不谈画面美不美,至少上一件事会推动下一件事。观众看到的是一次事件,而不是五份素材。
二、生成之前,先写出“一句话变化”
15 秒装不下完整世界观,但足够表现一次清楚的变化。
所以在列镜头之前,我会先写一句:
谁,在什么状态下,因为发生了什么,变成了什么状态?
例如这支角色 PV 的一句话变化是:
城市节点维护员林澈原本处于待命状态,收到一条来自未来七分钟的求救后,确认坐标并启动任务。
这句话同时给出了开头和结尾:开头是“待命与异常”,结尾是“行动与接通”。中间的镜头只需要负责把这次变化讲通。
如果一句话写成下面这样,就还不能直接分镜:
展示一名未来城市维护员的形象、能力和世界观。
“展示”没有方向,也没有结束条件。正面图能展示,三视图能展示,连续放十张场景图也算展示,最后自然会变成素材陈列。
可以把它再追问一步:
- 她在 15 秒内具体遇到了什么?
- 这件事迫使她做出什么动作?
- 最后一秒和第一秒相比,状态发生了什么变化?
这三个问题能答出来,再开始生成会稳很多。
三、给 15 秒做“信息预算”
短视频不是把长故事加速播放。时间越短,越需要控制每一段承担的信息量。
我更习惯把 15 秒拆成四个信息阶段:钩子、识别、升级、兑现。注意,它们不是固定的四个镜头,一个阶段完全可以包含两个短镜头。
| 信息阶段 | 参考时长 | 要解决的问题 | 观众看完应该知道什么 |
|---|---|---|---|
| 钩子 | 0—2.5s | 为什么要继续看 | 发生了一件不正常的事 |
| 识别 | 2.5—5.5s | 谁在处理这件事 | 主角身份和稳定识别点 |
| 升级 | 5.5—11s | 事情如何向前发展 | 角色开始判断、移动或行动 |
| 兑现 | 11—15s | 前面的承诺有没有落地 | 任务启动、结果出现或悬念成立 |

这组时长不是平台标准,只是适合这次概念 PV 的起点。产品演示、知识口播、剧情反转会有不同节奏。真正有用的是后面那一列:每一段必须完成一个观众能感受到的任务。
钩子不是先放最漂亮的画面
漂亮只能让人停一下,异常和问题才能让人想知道后面发生什么。
“一个好看的角色站在城市里”很难形成追问;“城市已经断联,但她收到一条来自未来七分钟的信号”,观众会自然想知道信号是谁发的、她准备怎么做。
识别阶段只留必要信息
15 秒里没必要交代完整姓名、年龄、经历、所属组织和所有装备。让观众记住名字、职业和两三个视觉锚点已经够用。
这支 PV 保留的是短发薄荷挑染、橙色通信器和深绿工具包。其余设定继续放在角色设定表里,不强行挤进视频。
升级必须出现动作或判断
从人物正面切到侧面,不一定算推进。镜头变了,人物状态没变,观众仍然会觉得在看展示页。
升级可以很小:角色抬头确认信号、终端坐标锁定、从站立切到奔跑。只要状态确实向前走了一步。
兑现要回答开头提出的问题
开头写“来自未来的求救”,结尾却只停在角色摆姿势,前面的钩子就没有落地。
这次结尾进入雨夜节点,屏幕从故障状态切换为通道建立。它没有讲完后续剧情,但至少证明角色真的接下了这次任务。
四、四个信息阶段,最后拆成六个镜头
有了信息预算,才开始写实际镜头。
这次 15 秒没有机械地做成四个等长镜头,而是拆成六个。钩子和升级阶段各需要两个视觉落点,识别和兑现各用一个相对完整的镜头。
| 镜头 | 时间 | 叙事任务 | 画面主体 | 动作与运镜 | 声音 | 如何接下一镜 |
|---|---|---|---|---|---|---|
| 01 | 0—1.1s | 建立异常 | 黑暗城市节点、断联提示 | 扫描线进入,节点轻微脉冲 | 低频底噪 | 扫描线擦出信号界面 |
| 02 | 1.1—2.5s | 抛出时间钩子 | +07:00 与求救文本 | 时间码跳变,波形放大 | 故障脉冲 | 波形峰值触发身份扫描 |
| 03 | 2.5—5.5s | 确认接收者 | 林澈半身、通信器、工具包 | 角色轻推近,识别点依次锁定 | 三次确认音 | 最后一个识别框变成转面窗口 |
| 04 | 5.5—7.4s | 从设定进入空间 | 正、侧、背转面 | 三个平面错位切换 | 节拍抬升 | 侧面轮廓接动作方向 |
| 05 | 7.4—11s | 进入行动 | 行走、奔跑、检修动作 | 动作视窗按节奏切换 | 三个短促冲击音 | 奔跑方向匹配雨夜场景 |
| 06 | 11—15s | 兑现任务 | 雨夜节点检修 | 镜头缓慢推进,节点由橙转绿 | 雨声、通道确认音 | 标题在动作完成后出现 |
这张表里最重要的不是“运镜”一列,而是“叙事任务”和“如何接下一镜”。前者防止镜头变成装饰,后者用来解决拼接感。
如果相邻两行之间说不清关系,就先不要急着为它们写提示词。
五、每个镜头只需要写清六件事
很多人写分镜提示词时,会把风格词堆得很满:电影感、史诗、超精细、动态运镜、氛围光、8K。真正到了生成阶段,最基础的动作方向和衔接方式反而没有写。
一张可执行的镜头卡,先写清下面六项:
- 时间:镜头从第几秒到第几秒;
- 任务:它负责钩住、解释、升级还是兑现;
- 主体:观众第一眼应该看谁或什么;
- 变化:镜头内部必须发生一次什么变化;
- 衔接:上一镜怎样进来,下一镜怎样出去;
- 声音:哪一个动作需要声音帮助观众感知。

例如第 2 镜可以写成:
时间:1.1—2.5秒
任务:让观众意识到信号来自未来七分钟
主体:画面中央的“+07:00”时间差,以及下方异常波形
变化:普通时间码跳变为+07:00,波形随后放大一次
衔接:承接上一镜扫描线;波形峰值扩展成下一镜身份扫描框
声音:时间跳变时一次电子故障音,波形峰值一次低频冲击
写到这个程度,才知道应该让图像模型生成什么、让视频模型动什么、后期又需要补什么。
六、不要强迫一个工具完成整支视频
分镜确定以后,还要给每个镜头选合适的执行方式。
| 镜头需求 | 更适合的方式 |
|---|---|
| 人物转头、奔跑、抬手、环境运动 | 图生视频或视频生成模型 |
| 准确中文、时间码、数据界面、字幕 | 剪辑软件或代码后期 |
| 三视图、动作设定、产品界面展示 | 可控的二维排版与动效 |
| 雨、烟、光线、轻微镜头运动 | 视频模型或后期特效均可 |
| 首尾严格对齐、品牌版式、数据同步 | 时间线工具或代码驱动视频 |
比如“人物在雨夜检修设备”适合先做动态画面;“+07:00”“身份确认”“通道建立”这些需要准确显示的内容,放到后期会更稳。
如果要求视频模型同时保证人物一致、动作准确、中文正确、界面不变和转场卡点,任何一个环节漂移都要整段重来。把任务拆开,并不意味着流程更复杂,很多时候反而省生成次数。
七、三个最容易造成拼接感的地方
1. 镜头顺序来自文件夹排序
先展示正面,再展示侧面,然后动作、场景、细节,看起来很完整,但这是角色资产的整理顺序,不是观众理解事件的顺序。
修正方法是先写“一句话变化”,再问每份素材能否帮助这次变化。暂时用不到的图就留在素材库,不必为了证明做过而放进成片。
2. 每个镜头都从零开始
上一镜人物向右跑,下一镜突然静止在画面左侧;上一镜还是橙色故障,下一镜无缘无故变成绿色完成。单镜头都没错,连接处却断了。
至少保留一种连续性:
- 方向连续:向右跑,下一镜仍沿右侧进入;
- 形状连续:圆形扫描框扩展成设备节点;
- 颜色连续:故障橙先进入转场,再切换为确认绿;
- 声音连续:上一镜的脉冲尾音延续到下一镜入口;
- 动作连续:手伸向终端,下一镜接触屏幕。
不需要五种全部使用,一种明确的连接就比随机闪白和淡入淡出有效。
3. 每一秒都在抢注意力
短视频不等于所有元素都要高速运动。标题、人物、背景、粒子、镜头同时变化,观众反而抓不住主信息。
我会给每个镜头只设一个主动作。其他元素可以呼吸、漂移或保持静止,但不能与主动作争夺视线。
八、写完分镜后,先做一次“删除测试”
在真正生成之前,把每个镜头依次删掉一次。
删掉后故事仍然完全成立,这个镜头很可能只是装饰;删掉后观众不知道角色是谁、不明白为什么行动,或者看不到结果,它才承担了必要任务。
还可以顺手检查下面五件事:
- 前 2 秒是否真的产生了一个问题,而不是只出现标题;
- 相邻镜头之间是否至少保留一种连续性;
- 同一时刻是否只有一个主要阅读对象;
- 开头承诺的内容,结尾是否至少兑现一次;
- 最后一个镜头是否留够时间让观众看清,而不是刚出现就结束。
这一步花十分钟,通常比生成五版再返工更划算。
九、让 Codex 先做分镜,不要直接让它生成视频
如果只是对 Codex 说“帮我做一条 15 秒 AI 视频”,它只能自己补全缺失的故事、素材和验收标准。结果可能看起来很完整,但未必是你真正想讲的东西。
可以先用下面这段,让它停在分镜阶段:
我要制作一条15秒竖屏短片。现在不要生成图片、视频或代码,先完成分镜设计。
短片主题:<填写>
目标观众:<填写>
一句话变化:<谁从什么状态,因为发生什么,变成什么状态>
已有素材:<角色、场景、产品界面、音频等>
必须出现:<填写>
明确不要出现:<填写>
发布平台与画幅:<填写>
请先输出:
1. 这条短片唯一需要讲清楚的事情;
2. 钩子、识别、升级、兑现四个信息阶段及时间预算;
3. 5—7个实际镜头,逐个写明时间、叙事任务、主体、镜头内变化、衔接方式和声音落点;
4. 哪些素材虽然好看,但这次建议不用;
5. 仍然缺失、会影响制作的素材。
约束:
- 不要把素材目录直接改写成镜头顺序;
- 一个镜头只设置一个主动作;
- 相邻镜头至少有一种方向、形状、颜色、声音或动作连续性;
- 开头提出的问题必须在结尾得到回应;
- 信息不足时标记问题,不要自行编造设定。
拿到第一版后,再让它做一次反向检查:
请暂时不要优化措辞,直接审查这版分镜。
逐镜头回答:
- 删除它以后,故事是否仍然成立?
- 它是在推进事件,还是只展示素材?
- 观众这一秒应该看哪里?
- 它与上一镜靠什么连接?
- 这个动作适合视频模型生成,还是更适合后期完成?
最后给出一版删减后的分镜表,并说明删掉了什么、为什么删。
第二段往往比“再帮我优化得更有电影感”有用。它逼着方案先过逻辑,再进入审美调整。
十、空白分镜模板:可以直接复制
下面这份表格可以放进 Markdown、飞书、Notion 或 Excel。实际镜头数不必固定为六个,够用就停。
## 短片基本信息
- 时长:15秒
- 画幅:9:16 / 16:9
- 一句话变化:
- 目标观众:
- 必须出现:
- 本次舍弃:
## 信息预算
| 阶段 | 时间 | 观众需要知道什么 |
|---|---|---|
| 钩子 | 0—__s | |
| 识别 | __—__s | |
| 升级 | __—__s | |
| 兑现 | __—15s | |
## 逐镜头表
| 镜头 | 时间 | 叙事任务 | 主体 | 镜头内变化 | 衔接方式 | 声音落点 | 执行工具 |
|---|---:|---|---|---|---|---|---|
| 01 | | | | | | | |
| 02 | | | | | | | |
| 03 | | | | | | | |
| 04 | | | | | | | |
| 05 | | | | | | | |
| 06 | | | | | | | |
## 生成前检查
- [ ] 前2秒出现了明确问题或变化
- [ ] 每个镜头只有一个主动作
- [ ] 相邻镜头至少保留一种连续性
- [ ] 准确文字和界面已安排到后期
- [ ] 开头承诺在结尾得到回应
- [ ] 每个镜头都通过删除测试
十一、什么情况下不适合套这套四段结构
这套方法适合角色先导、产品概念、事件预告、作品集短片,以及有明确“状态变化”的 15 秒内容。
下面几类视频要调整:
- 纯氛围视频:重点可能是情绪延续,不一定需要身份识别;
- 口播知识视频:核心是观点和证据,信息阶段更适合改成问题、解释、例子、结论;
- 产品操作演示:应该围绕操作步骤和结果,不必硬加剧情悬念;
- 复杂剧情短片:15 秒可能只够讲一个场景,需要先从长故事中截取一个完整片段。
方法的价值不是把所有短片变成同一种节奏,而是提醒我们:生成之前,先确定观众在每一秒为什么继续看。
十二、继续阅读:按你现在卡住的位置选下一篇
看到这里,不需要把所有文章从头读一遍。先判断自己卡在哪一步,再选一篇继续:
1. 角色形象不稳定,换个动作就像换了一个人
先把角色资产固定下来,再谈分镜和动画:
第一篇解决角色资产怎么做,第二篇完整展示角色设定表怎样进入时间线、动效、音效、转场排错和最终验收。
2. 想让 Codex 接手制作,但又怕它理解错、改得太多
可以沿着“先理解项目,再选对规则载体,最后把排错流程做成 Skill”的顺序继续:
- 第一次让 Codex 接手陌生项目,我不会先让它写代码:7 步完成项目接管
- Codex 每次都要重新教?Prompt、AGENTS.md、Skills、MCP 到底怎么选
- Codex 修 Bug 总是越改越多?把复现、定位、修复、回归测试做成一个 Skill
这些方法不只适用于写代码。分镜规范、素材目录、渲染命令和验收条件,同样需要清晰的任务边界。
3. 渲染和检查还在电脑上运行,但人要离开
先比较几种常见方案,再决定是否需要把本地 Agent 会话延伸到手机端:
更多实战文章可以从 CSDN 作者主页 继续查看。
十三、关于 Linco Bridge
做 AI 视频时,素材分析、批量渲染和抽帧检查经常需要几分钟甚至更久,人不一定一直坐在电脑前。
Linco Bridge 是我们开源的本地 Agent 跨端连接项目,可以把电脑上的 Codex、Claude Code、Hermes 等会话延伸到手机端,方便离开电脑后继续查看进度、回复确认和处理下一步。
- 项目介绍:Linco Bridge 开源:在手机端续接本地 AI Agent
- GitHub:lincotalk/linco-bridge
- 在线体验:bridge-demo.lincotalk.com
- 微信小程序:搜索 Agent桥接器
它不参与视频生成,也不会替你决定分镜。它解决的是任务已经在电脑上运行,人离开以后怎么继续跟进。
AI 视频的第一版分镜,不需要写得像专业电影脚本。先把一件事讲通,把每个镜头存在的理由写清楚,已经能避开很多无效生成。
画面当然重要。但当所有画面单独看都不错,成片仍然像拼起来的,下一步应该检查的往往不是模型,而是镜头之间到底有没有关系。
更多推荐


所有评论(0)