上一条 AI 动作短片以”技术上完整、目标上失败”归档之后,失败复盘留下了一个未验证的假设:问题不在平台,而在任务形状与资产纪律。本文是对这个假设的完整测试——同一个平台,同一批角色资产,但一切从零开始。这条路线由 Claude Fable 5 驱动,Flova 负责项目编排与模型路由,创作者掌握关键帧和最终审美判断。
结果先行:一条 14.2 秒的暗黑奇幻氛围短片《守夜 The Vigil》,三个镜头,零接触、零战斗因果,总消耗 838 credits。它没有复杂动作,但每一帧的角色身份、画风与氛围都通过了逐镜验收。
目标:把任务缩进能力圈
上一次失败的核心教训是:要求图生视频模型证明”剑刃与岩体的几何交叠”,等于要求一个外观采样器完成碰撞检测。这一次的目标被刻意收缩——
- 三个镜头,总长约 15 秒;
- 全部是微动:雾、披风、灰烬、火光、雷光;
- 零角色接触,零因果证明要求;
- 成功标准只有四条:身份稳定、画风贴合母版、微动不崩、镜间连续。
叙事结构同样简单:骑士在灰烬夜路上独行(镜1)→ 走向巨大的废墟(镜2)→ 雷光中,持超长刀的黑暗剑士在高塔间现身(镜3)。孤独行进,意识到未知,未知降临。
分工:人出关键帧,Claude Fable 5 跑流程
这条线最重要的结构决定,是把”关键帧”从生成平台的职责里拿出来,交还给人:
- 人(创作者):确认剧情与分镜;亲自在 Midjourney 中生成每一张关键帧并做审美裁决;对每一镜的产出拍板;
- Claude Fable 5:通过 Flova 官方 CLI 驱动全部流程——建项目、上传素材、发导演指令、逐镜下载抽帧、执行客观验收(身份/物件/连续性),并在每次失败后给出归因与修正指令;
- Flova:项目编排——分镜蓝图、项目记忆、镜间继承、素材替换、时间线与导出;
- Seedance 2.0 / Nano Banana:图生视频与平台侧图像生成。
关键帧交给人,不是效率考量,而是质量考量:Midjourney 生成的关键帧与既有角色定妆同源,身份与画风天然一致;而平台侧图像模型在同样的文字约束下反复漂移。后文的镜2 演化史就是这条分工的直接证据。
同日由 Codex 5.6 Sol 驱动的另一条《塞拉斯拦路》绿地实验提供了直接对照。那条线同样清空旧项目、建立阶段 Gate,却仍让平台生成场景化角色与逐镜关键资产;最终五镜中只有两个单主体克制镜头成立,整体评价仅 3–4/10。两者的差异说明:绿地隔离只能清除历史状态,不能替代人工关键帧提供的审美与身份权威。
工作规矩在项目开始前写死了七条,其中最重要的四条:
- 绿地:旧项目的任何素材、中间图、剧本零携带;
- 唯一视觉母版:全片画风与角色身份以一张图为唯一权威;
- 首帧 Gate:每个新机位先出静帧、通过身份验收,再进入视频生成;
- 验收外置:平台自检只作线索,每镜由代理下载抽帧、由人终审。
镜1:母版直出,一次通过
镜1 的首帧就是视觉母版本身——雾夜灰烬路上朝镜头走来的黑甲骑士。
以母版为首帧直接图生视频,一次通过:身份全程稳定,披风、雾、灰烬、背景火光四层微动全部到位。这一镜同时暴露了一个值得记录的平台特性:声明”以此图为首帧”时,平台实际把它当作构图锚而非逐像素起点——起始帧的骑士比母版更远。本片中这反而形成了完整的行进叙事,但依赖严格首帧续接的场景需要预先知道这一点。
镜2:一顶头盔的三个版本,以及最后的删除
镜2(骑士停步抬头)需要一个新机位,于是需要重绘首帧——这是全片唯一没有母版直出的镜头,也是问题最集中的地方。
平台图像模型的两版首帧,画风都贴,但头盔形制反复漂移;进入视频后问题更严重——抬头动作把盔顶完全暴露,模型把它脑补成了光滑反光的球形盔。文字约束连续两轮都锁不住,因为根因不在措辞:母版里头盔被兜帽罩着,首帧里根本不存在”这顶盔长什么样”的信息,动画只能自由发挥。
解法是回到分工原则:这张首帧改由人在 Midjourney 中生成——挂母版作为图像参考与画风参考,文字按已确认的形制写死。新首帧信息量充足,视频里头盔全程稳定,问题消失。
但这一镜的终局是被删除。终审时发现,即使头盔稳定,镜1(母版直出)与镜2(重绘首帧)之间仍存在可感知的角色漂移——能看出”不完全是同一个人”。最终决定:整镜移除,由镜1 直接切入大远景。这带来一条超出预期的剪辑经验:镜头越少更换机位重绘,角色越稳;而”走向你”直接切”背影走向远方”,叙事反而更干净。
镜3:纯文字剪影的翻车,与 impact 镜的重构
镜3 的原设计是:大远景中雷光一闪,废墟高处浮现持超长刀的黑色剪影。出于对画风统一的顾虑,最初决定不给剪影提供任何参考图,只用文字描述。
结果是一次干脆的翻车:剪影被生成为一个悬浮在塔间的小人,毫无威胁感——用创作者的原话说,“像个小丑闪现出来吓你一跳,结果自己才是搞笑的那个”。
修正复用了本片反复验证的同一条原则——凡重要视觉,一律图锚,文字只锁行为——并引入动作电影的剪辑语言:把”剪影”升级为独立的 impact 镜。黑暗剑士的既有定妆图作为图像参考,在 Midjourney 中生成低角度仰视的登场帧:焰冠、双目红光、缠绕电光的超长刀、身后劈落的巨型闪电。远景行进与近景登场之间用硬切衔接,切点正落在登场镜开场的雷光上。
动化阶段的三次收敛
登场镜的视频生成又经历了三轮修订,每一轮都是一条可复用的经验:
- 塑料化:厚涂质感的近景大特写经过图生视频后表面被”实化”,绘画感流失。对策有二:指令层面锁定材质与哑光;更根本的是后来发现 Midjourney 自家的 animate 功能动化自家厚涂图几乎零质感损耗——最终成片中的大远景行进段就使用了这条路线。氛围微动用 MJ animate,强指令动作用 Seedance,两个动化引擎各就各位。
- 静止的登场需要运镜:微动纪律适用于氛围镜,但登场镜完全固定机位会失去张力。加入极缓慢的推近后,压迫感立刻成立。
- 克制即压迫:双眼红光最初做成了摇曳的火焰,创作者裁决改为”两点静止的暗红光,像深渊里一动不动凝视你的目光”——并将刀身电光设为全画面唯一快速运动的元素。静与动的单点对比,胜过一切炫技。
声音与成片
声音设计遵循同一套克制逻辑:全片以低频轰鸣为声底(重力般的压迫感),雨声铺垫,雷声只作点缀;登场段低频显著加重,结尾随画面转暗一起收干净。配乐由平台内置引擎生成两版候选,创作者试听后不仅选定版本,还指定了曲内的具体段落——配乐比片长长是常态,取哪一段同样是创作决定。
最终时间线:骑士独行(5 秒)→ 大远景走向废墟(5.2 秒,MJ animate 动化)→ 黑暗剑士降临(4 秒)。
可复用的规则
这次测试沉淀的规则,按重要性排序:
- 任务形状先于一切:把目标缩进当前模型的能力圈(微动、零接触、零因果证明),失败率的下降不是渐进的,而是断崖式的;
- 关键帧是身份与质感的命脉——由人用最强的图像工具完成,不交给视频平台的附属图像模型;
- 首帧信息量决定动画上限:首帧里不存在的信息(被遮挡的结构),动画阶段必然被脑补;
- 凡重要视觉一律图锚,文字只锁行为与节奏;重要角色的登场值得单独一个 impact 镜;
- 动化引擎按镜分配:厚涂氛围微动用 MJ animate(质感无损),强指令动作用 Seedance(近景有塑料化代价);
- 克制即张力:静止的威压、单一的快速元素、收敛的光,胜过堆叠特效;
- 验收外置不可省:平台自检只作线索;逐镜抽帧、由人终审,是所有上述规则能被执行的前提。
并行失败记录《Codex 5.6 Sol 路线:塞拉斯五镜绿地实验失败复盘》的结论是:新项目、完整 Storyboard 和成功导出都不能代表作品成立。本片补充的是:创作判断同样不能交给平台——但只要人守住关键帧与终审两个环节,剩下的大量流程可以放心地交给 Claude Fable 5 与编排层。