专业短片制作曾经是一场昂贵的赌注:每一个镜头都要真金白银和真实天数,没人敢随便试,结果大家看起来都差不多。AI视频把试错成本砸到地板上——描述、生成、看、改三个词、再生成,几分钟一轮。可成本崩了之后,真正的问题才浮出来:五十轮试错乘以二十个镜头,就是上千次决策。人肉点生成按钮到最后只会累到出垃圾片。

我起初以为只要把模型换得更强、提示词写得更长,片子自然就会好。后来亲手把整套流水线在Claude Code里跑通,才看清:生成本身已经不再是瓶颈,瓶颈是谁在持续跑循环。人只负责品味——哪帧对、哪镜活、片子要往哪走;Agent负责吞吐量——写提示、提交任务、轮询结果、失败重试、拼成片。这套东西叫循环工程,也是今天这套系统的核心。

一台平台两扇门,把所有模型收进同一个终端

这套生产要碰图像模型、视频模型、音乐生成和4K放大。传统做法是五个订阅、五个标签页、五个渲染队列,文件到处丢。Higgsfield把它们压进一个登录、一个积分池,而且整个平台就是为Agent用的。

两扇门:

  • Supercomputer是轻松门:平台自带Agent,自己规划、自己选模型、自己剪,描述需求就行。新人不烧积分就能把规划、测试、返工全跑完,只在最终渲染时付费。
  • CLI是控制门:把每个模型变成Claude Code能直接调用的命令。三行安装:
npm install -g @higgsfield/cli
higgsfield auth login
npx skills add higgsfield-ai/skills

skills包教会Claude什么时候用哪个模型、怎么保持角色一致、怎么提交和轮询。一条命令就能跑任意模型:

# 图像到视频示例:Seedance 2.0,本地起始帧自动上传,阻塞等待结果
higgsfield generate create seedance_2_0 \
  --prompt "slow dolly in as the sail tears loose" \
  --start-image ./frame.png \
  --duration 5 \
  --resolution 1080p \
  --wait

换模型名就能覆盖全流程:gpt_image_2出帧、nano_banana_2修角色、sonilo_music出配乐、upscaler出4K。所有路由规则写进项目的CLAUDE.md,子Agent自动继承。生成走bash,结果写进日志文件。从这一刻起,终端就是工作室。

阶段一:从真正电影里抽出风格合同,而不是凭空发明

最快把品味带进AI视频的方式,是停止用想象描述情绪,改从已经打动过千万人的镜头里提取参数。

书签这几个源:frameset.app、shotdeck.com、fancaps.net、savee.com、cosmos.so、eyecannndy.com。挑五到十个你真正想要的感觉的镜头,丢给视觉模型(Gemini 3.1 Pro一类),让它把镜头参数拆到极致——镜头感、光向与光源、色板、颗粒、对比、站位、气氛、时代标记。

输出就是风格合同:一段锁定的视觉语言,之后每一个图像和视频提示词都原封不动贴进去。你不再指望模型理解“cinematic”——这个词已经被十亿张图刷成了空话。你交的是已经验证过的配方:“motivated warm lighting, 35mm grain, shallow depth of field, lifted blacks”。这一段文字决定了下游所有东西的长相。

阶段二:永远先做帧,再谈运动

永远不要从想象直接出视频。帧便宜、秒级,探索全在便宜层完成。同一条分镜挂上风格合同,并排跑多个扩散模型,比选、再修。Nano Banana做手术级编辑和一致性,Soul Cinema出摄影感角色,GPT-Images-2扛密集美术指导。

必须锁死的东西单独成表:角色参考表(正面、四分之三、侧面,分图存,别用九宫格,视频模型会把格子当不同人)、服装/状态变化表、多角度场景表。

三条比工具选择更决定成败的规则:

物体比脸更能扛情绪——脸会漂,物体锁得住,能用撕破的帆或断桨落地的戏就交给物体。
一个不可能的东西放在一个正常的地方,是最能停住滑动的构图。
给角色一个代价:走路只是素材,一瘸一拐走向目标才是故事。

阶段三到四:Agent写剧本,运动语法杀死冻帧

剧本写作交给Fable 5 Medium:吃分镜表和风格合同,按固定模板输出每一镜的提示——场景上下文、参考、站位、机位、光、声、风格锁,顺序永远一样。一致性来自重复的参考图和重复的语言,不是种子也不是运气。

提示词铁律:

  • 一镜一个动词:“他转身”能出,一串动作会塌。
  • 五个小动作胜过一个形容词:“空白凝视、慢眨眼、抿咖啡、抬头”是人,“他看起来困惑”是库存图。
  • 主体运动和摄影机运动必须分句,混在一起就是大家怪模型的抖。
  • 纯文本提示120-280词,有参考图的压到80词以下,否则文字会和图像打架。

运动阶段用Seedance 2.0做图像到视频,每镜独立3-5秒。真实电影本来就是剪镜,不是一镜到底。身份漂通常出现在连续三十秒以后,独立节拍永远到不了那里。

我前两轮运动全挂在同一个地方:人物冻住,只有镜头在漂。修复语法只有三件,每条图像到视频提示都必须带:

命名的摄影机运动
场景内必须发生一件事
明确写出“no frozen figures”

同一张关键帧,两个提示:“slow dolly in, cinematic”给你一张会漂的静帧;“slow dolly in as the sail tears loose and the crew scrambles to catch it”才给你电影。

两个值得整段记住的技巧:链式镜头——第N镜的最后一帧直接当第N+1镜的起始参考,连续性自动往前走;时间码导演——在一个生成里写[0-4s]全景静、[4-8s]推近加压、[8-12s]特写顶点、[12-15s]揭示,直接在单镜里切。

阶段五:子Agent舰队,并发才是工作室的真正产能

一个编排会话握着整张分镜表,按家族生成子Agent——生物、水面、室内、动作。每个子Agent自己写提示、自己通过CLI提交、自己轮询、自己回报赢家。因为所有模型都在同一个终端,舰队可以跨模型并行覆盖整张表,你人去做别的事。

舰队生死线只有一条不起眼的规则:尊重并发上限。视频模型同时跑的任务有上限,Agent必须先查活跃任务,有空位再提交。会节流的Agent能跑一晚上;硬冲的循环一小时就会死在限速上。

迭代纪律:每镜3-4个候选,然后只改一个变量——机位、光或速度,绝不整段重写。改五个东西的失败什么都教不会你。每一代都记日志:提示、模型、结果、留还是杀。这一次生产变成下一次的数据库。

阶段六:剪辑就是文本文件,4K只做一次

配乐先做:按情绪弧分乐章(起、顶、静、收),一次生成,再把剪辑对齐到配乐。剪辑本身是一个文本文件,一行一个镜头名、保留秒数、音频开关。ffmpeg读这个文件直接出片——Claude Code本来就会驱动它。某镜生成的喊叫和弦乐打架,就在文件里把那一行音频标mute;海浪环境音卖场就留着。

放大只在最终成片做一次。探索用720p,留用1080p,4K只给母版。任何你会掏手机看的镜头,不管花了多少积分,直接删。

维度 人肉点生成 + 多平台切换 Claude Code + Higgsfield嵌套循环系统
试错成本与速度 单次便宜,但人点到累,探索量被体力限制 Agent整晚跑,人只挑最终赢家
一致性维护 角色/风格靠记忆和手动贴图,易漂 风格合同 + 参考表 + 链式帧,自动继承
并发与吞吐 单线程点按钮,易撞限速 子Agent舰队节流提交,预测性过夜跑完
可复现与迭代 文件散落,下一次从零开始 全量日志,下一次生产直接站在上一次肩膀上
最终产出形态 素材堆,剪辑靠外部软件 文本文件驱动ffmpeg,4K母版一次出

这套系统真正卖的不是某一部片子,而是流水线本身。同样六阶段可以直接出产品广告、批量UGC、品牌片、发布会视频——流水线不知道自己在做电影。当某个热点窗口只剩几小时,带着风格合同、锁定角色和生成舰队的人已经在发,别人还在开标签页。

跳过阶段一,后面所有阶段只会产出漂亮的空镜头。第一部片子从这套系统里出来只花了一个通宵。你的从安装CLI的那个晚上开始。

你现在手头的项目里,哪一个环节如果改成“人只做品味决策、Agent跑嵌套循环”,会立刻把交付速度拉开最大差距?直接聊。

我是紫微AI,在做一个「人格操作系统(ZPF)」。后面会持续分享AI Agent和系统实验。感兴趣可以关注,我们下期见。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐