把Claude Code变成完整电影工作室 六阶段流水线与嵌套循环的实践拆解
专业短片制作曾经是一场昂贵的赌注:每一个镜头都要真金白银和真实天数,没人敢随便试,结果大家看起来都差不多。AI视频把试错成本砸到地板上——描述、生成、看、改三个词、再生成,几分钟一轮。可成本崩了之后,真正的问题才浮出来:五十轮试错乘以二十个镜头,就是上千次决策。人肉点生成按钮到最后只会累到出垃圾片。
我起初以为只要把模型换得更强、提示词写得更长,片子自然就会好。后来亲手把整套流水线在Claude Code里跑通,才看清:生成本身已经不再是瓶颈,瓶颈是谁在持续跑循环。人只负责品味——哪帧对、哪镜活、片子要往哪走;Agent负责吞吐量——写提示、提交任务、轮询结果、失败重试、拼成片。这套东西叫循环工程,也是今天这套系统的核心。
一台平台两扇门,把所有模型收进同一个终端
这套生产要碰图像模型、视频模型、音乐生成和4K放大。传统做法是五个订阅、五个标签页、五个渲染队列,文件到处丢。Higgsfield把它们压进一个登录、一个积分池,而且整个平台就是为Agent用的。
两扇门:
- Supercomputer是轻松门:平台自带Agent,自己规划、自己选模型、自己剪,描述需求就行。新人不烧积分就能把规划、测试、返工全跑完,只在最终渲染时付费。
- CLI是控制门:把每个模型变成Claude Code能直接调用的命令。三行安装:
npm install -g @higgsfield/cli
higgsfield auth login
npx skills add higgsfield-ai/skills
skills包教会Claude什么时候用哪个模型、怎么保持角色一致、怎么提交和轮询。一条命令就能跑任意模型:
# 图像到视频示例:Seedance 2.0,本地起始帧自动上传,阻塞等待结果
higgsfield generate create seedance_2_0 \
--prompt "slow dolly in as the sail tears loose" \
--start-image ./frame.png \
--duration 5 \
--resolution 1080p \
--wait
换模型名就能覆盖全流程:gpt_image_2出帧、nano_banana_2修角色、sonilo_music出配乐、upscaler出4K。所有路由规则写进项目的CLAUDE.md,子Agent自动继承。生成走bash,结果写进日志文件。从这一刻起,终端就是工作室。
阶段一:从真正电影里抽出风格合同,而不是凭空发明
最快把品味带进AI视频的方式,是停止用想象描述情绪,改从已经打动过千万人的镜头里提取参数。
书签这几个源:frameset.app、shotdeck.com、fancaps.net、savee.com、cosmos.so、eyecannndy.com。挑五到十个你真正想要的感觉的镜头,丢给视觉模型(Gemini 3.1 Pro一类),让它把镜头参数拆到极致——镜头感、光向与光源、色板、颗粒、对比、站位、气氛、时代标记。
输出就是风格合同:一段锁定的视觉语言,之后每一个图像和视频提示词都原封不动贴进去。你不再指望模型理解“cinematic”——这个词已经被十亿张图刷成了空话。你交的是已经验证过的配方:“motivated warm lighting, 35mm grain, shallow depth of field, lifted blacks”。这一段文字决定了下游所有东西的长相。
阶段二:永远先做帧,再谈运动
永远不要从想象直接出视频。帧便宜、秒级,探索全在便宜层完成。同一条分镜挂上风格合同,并排跑多个扩散模型,比选、再修。Nano Banana做手术级编辑和一致性,Soul Cinema出摄影感角色,GPT-Images-2扛密集美术指导。
必须锁死的东西单独成表:角色参考表(正面、四分之三、侧面,分图存,别用九宫格,视频模型会把格子当不同人)、服装/状态变化表、多角度场景表。
三条比工具选择更决定成败的规则:
物体比脸更能扛情绪——脸会漂,物体锁得住,能用撕破的帆或断桨落地的戏就交给物体。
一个不可能的东西放在一个正常的地方,是最能停住滑动的构图。
给角色一个代价:走路只是素材,一瘸一拐走向目标才是故事。
阶段三到四:Agent写剧本,运动语法杀死冻帧
剧本写作交给Fable 5 Medium:吃分镜表和风格合同,按固定模板输出每一镜的提示——场景上下文、参考、站位、机位、光、声、风格锁,顺序永远一样。一致性来自重复的参考图和重复的语言,不是种子也不是运气。
提示词铁律:
- 一镜一个动词:“他转身”能出,一串动作会塌。
- 五个小动作胜过一个形容词:“空白凝视、慢眨眼、抿咖啡、抬头”是人,“他看起来困惑”是库存图。
- 主体运动和摄影机运动必须分句,混在一起就是大家怪模型的抖。
- 纯文本提示120-280词,有参考图的压到80词以下,否则文字会和图像打架。
运动阶段用Seedance 2.0做图像到视频,每镜独立3-5秒。真实电影本来就是剪镜,不是一镜到底。身份漂通常出现在连续三十秒以后,独立节拍永远到不了那里。
我前两轮运动全挂在同一个地方:人物冻住,只有镜头在漂。修复语法只有三件,每条图像到视频提示都必须带:
命名的摄影机运动
场景内必须发生一件事
明确写出“no frozen figures”
同一张关键帧,两个提示:“slow dolly in, cinematic”给你一张会漂的静帧;“slow dolly in as the sail tears loose and the crew scrambles to catch it”才给你电影。
两个值得整段记住的技巧:链式镜头——第N镜的最后一帧直接当第N+1镜的起始参考,连续性自动往前走;时间码导演——在一个生成里写[0-4s]全景静、[4-8s]推近加压、[8-12s]特写顶点、[12-15s]揭示,直接在单镜里切。
阶段五:子Agent舰队,并发才是工作室的真正产能
一个编排会话握着整张分镜表,按家族生成子Agent——生物、水面、室内、动作。每个子Agent自己写提示、自己通过CLI提交、自己轮询、自己回报赢家。因为所有模型都在同一个终端,舰队可以跨模型并行覆盖整张表,你人去做别的事。
舰队生死线只有一条不起眼的规则:尊重并发上限。视频模型同时跑的任务有上限,Agent必须先查活跃任务,有空位再提交。会节流的Agent能跑一晚上;硬冲的循环一小时就会死在限速上。
迭代纪律:每镜3-4个候选,然后只改一个变量——机位、光或速度,绝不整段重写。改五个东西的失败什么都教不会你。每一代都记日志:提示、模型、结果、留还是杀。这一次生产变成下一次的数据库。
阶段六:剪辑就是文本文件,4K只做一次
配乐先做:按情绪弧分乐章(起、顶、静、收),一次生成,再把剪辑对齐到配乐。剪辑本身是一个文本文件,一行一个镜头名、保留秒数、音频开关。ffmpeg读这个文件直接出片——Claude Code本来就会驱动它。某镜生成的喊叫和弦乐打架,就在文件里把那一行音频标mute;海浪环境音卖场就留着。
放大只在最终成片做一次。探索用720p,留用1080p,4K只给母版。任何你会掏手机看的镜头,不管花了多少积分,直接删。
| 维度 | 人肉点生成 + 多平台切换 | Claude Code + Higgsfield嵌套循环系统 |
|---|---|---|
| 试错成本与速度 | 单次便宜,但人点到累,探索量被体力限制 | Agent整晚跑,人只挑最终赢家 |
| 一致性维护 | 角色/风格靠记忆和手动贴图,易漂 | 风格合同 + 参考表 + 链式帧,自动继承 |
| 并发与吞吐 | 单线程点按钮,易撞限速 | 子Agent舰队节流提交,预测性过夜跑完 |
| 可复现与迭代 | 文件散落,下一次从零开始 | 全量日志,下一次生产直接站在上一次肩膀上 |
| 最终产出形态 | 素材堆,剪辑靠外部软件 | 文本文件驱动ffmpeg,4K母版一次出 |
这套系统真正卖的不是某一部片子,而是流水线本身。同样六阶段可以直接出产品广告、批量UGC、品牌片、发布会视频——流水线不知道自己在做电影。当某个热点窗口只剩几小时,带着风格合同、锁定角色和生成舰队的人已经在发,别人还在开标签页。
跳过阶段一,后面所有阶段只会产出漂亮的空镜头。第一部片子从这套系统里出来只花了一个通宵。你的从安装CLI的那个晚上开始。
你现在手头的项目里,哪一个环节如果改成“人只做品味决策、Agent跑嵌套循环”,会立刻把交付速度拉开最大差距?直接聊。
我是紫微AI,在做一个「人格操作系统(ZPF)」。后面会持续分享AI Agent和系统实验。感兴趣可以关注,我们下期见。
更多推荐



所有评论(0)