Alias Archive档案更新中
档案更新中

Claude Fable 5 路线:《守夜》绿地重启与人工关键帧分工

由 Claude Fable 5 驱动的一次 Flova 绿地重启:人负责审美裁决与 Midjourney 关键帧,Agent 负责 CLI、逐镜验收与编排,产出一条 14.2 秒的氛围短片。

归档日期
归属板块
其他
语言版本
ZH / 阅读版本

上一条 AI 动作短片以”技术上完整、目标上失败”归档之后,失败复盘留下了一个未验证的假设:问题不在平台,而在任务形状资产纪律。本文是对这个假设的完整测试——同一个平台,同一批角色资产,但一切从零开始。这条路线由 Claude Fable 5 驱动,Flova 负责项目编排与模型路由,创作者掌握关键帧和最终审美判断。

结果先行:一条 14.2 秒的暗黑奇幻氛围短片《守夜 The Vigil》,三个镜头,零接触、零战斗因果,总消耗 838 credits。它没有复杂动作,但每一帧的角色身份、画风与氛围都通过了逐镜验收。

《守夜 The Vigil》· 14.2 秒 · 三镜氛围短片定稿

目标:把任务缩进能力圈

上一次失败的核心教训是:要求图生视频模型证明”剑刃与岩体的几何交叠”,等于要求一个外观采样器完成碰撞检测。这一次的目标被刻意收缩——

  • 三个镜头,总长约 15 秒;
  • 全部是微动:雾、披风、灰烬、火光、雷光;
  • 零角色接触,零因果证明要求;
  • 成功标准只有四条:身份稳定、画风贴合母版、微动不崩、镜间连续。

叙事结构同样简单:骑士在灰烬夜路上独行(镜1)→ 走向巨大的废墟(镜2)→ 雷光中,持超长刀的黑暗剑士在高塔间现身(镜3)。孤独行进,意识到未知,未知降临。

分工:人出关键帧,Claude Fable 5 跑流程

这条线最重要的结构决定,是把”关键帧”从生成平台的职责里拿出来,交还给人:

  • 人(创作者):确认剧情与分镜;亲自在 Midjourney 中生成每一张关键帧并做审美裁决;对每一镜的产出拍板;
  • Claude Fable 5:通过 Flova 官方 CLI 驱动全部流程——建项目、上传素材、发导演指令、逐镜下载抽帧、执行客观验收(身份/物件/连续性),并在每次失败后给出归因与修正指令;
  • Flova:项目编排——分镜蓝图、项目记忆、镜间继承、素材替换、时间线与导出;
  • Seedance 2.0 / Nano Banana:图生视频与平台侧图像生成。

关键帧交给人,不是效率考量,而是质量考量:Midjourney 生成的关键帧与既有角色定妆同源,身份与画风天然一致;而平台侧图像模型在同样的文字约束下反复漂移。后文的镜2 演化史就是这条分工的直接证据。

同日由 Codex 5.6 Sol 驱动的另一条《塞拉斯拦路》绿地实验提供了直接对照。那条线同样清空旧项目、建立阶段 Gate,却仍让平台生成场景化角色与逐镜关键资产;最终五镜中只有两个单主体克制镜头成立,整体评价仅 3–4/10。两者的差异说明:绿地隔离只能清除历史状态,不能替代人工关键帧提供的审美与身份权威。

工作规矩在项目开始前写死了七条,其中最重要的四条:

  1. 绿地:旧项目的任何素材、中间图、剧本零携带;
  2. 唯一视觉母版:全片画风与角色身份以一张图为唯一权威;
  3. 首帧 Gate:每个新机位先出静帧、通过身份验收,再进入视频生成;
  4. 验收外置:平台自检只作线索,每镜由代理下载抽帧、由人终审。

镜1:母版直出,一次通过

镜1 的首帧就是视觉母版本身——雾夜灰烬路上朝镜头走来的黑甲骑士。

雾夜灰烬路上朝镜头走来的黑甲骑士,胸口一点橙色十字,身后林间有微弱火光
全片唯一视觉母版。此后每一镜的画风与身份都以这张图为准。

以母版为首帧直接图生视频,一次通过:身份全程稳定,披风、雾、灰烬、背景火光四层微动全部到位。这一镜同时暴露了一个值得记录的平台特性:声明”以此图为首帧”时,平台实际把它当作构图锚而非逐像素起点——起始帧的骑士比母版更远。本片中这反而形成了完整的行进叙事,但依赖严格首帧续接的场景需要预先知道这一点。

镜2:一顶头盔的三个版本,以及最后的删除

镜2(骑士停步抬头)需要一个新机位,于是需要重绘首帧——这是全片唯一没有母版直出的镜头,也是问题最集中的地方。

三张并排对比:母版、平台第一版首帧(头盔变成大盔)、平台第二版首帧(尖顶回归)
左:母版;中:平台首版首帧,头盔变成了带面甲的大盔;右:文字修正后的第二版。真正的问题在于:母版里头盔被兜帽罩着,模型没有形制信息,只能脑补。

平台图像模型的两版首帧,画风都贴,但头盔形制反复漂移;进入视频后问题更严重——抬头动作把盔顶完全暴露,模型把它脑补成了光滑反光的球形盔。文字约束连续两轮都锁不住,因为根因不在措辞:母版里头盔被兜帽罩着,首帧里根本不存在”这顶盔长什么样”的信息,动画只能自由发挥。

解法是回到分工原则:这张首帧改由人在 Midjourney 中生成——挂母版作为图像参考与画风参考,文字按已确认的形制写死。新首帧信息量充足,视频里头盔全程稳定,问题消失。

但这一镜的终局是被删除。终审时发现,即使头盔稳定,镜1(母版直出)与镜2(重绘首帧)之间仍存在可感知的角色漂移——能看出”不完全是同一个人”。最终决定:整镜移除,由镜1 直接切入大远景。这带来一条超出预期的剪辑经验:镜头越少更换机位重绘,角色越稳;而”走向你”直接切”背影走向远方”,叙事反而更干净。

镜3:纯文字剪影的翻车,与 impact 镜的重构

镜3 的原设计是:大远景中雷光一闪,废墟高处浮现持超长刀的黑色剪影。出于对画风统一的顾虑,最初决定不给剪影提供任何参考图,只用文字描述。

结果是一次干脆的翻车:剪影被生成为一个悬浮在塔间的小人,毫无威胁感——用创作者的原话说,“像个小丑闪现出来吓你一跳,结果自己才是搞笑的那个”。

左:失败的纯文字剪影,小人悬浮在塔间;右:以角色定妆图为锚重构的仰视登场帧,雷光中黑暗剑士立于断塔之前
同一个登场,两种做法。左边只有文字描述;右边以角色定妆图为图像参考重构。

修正复用了本片反复验证的同一条原则——凡重要视觉,一律图锚,文字只锁行为——并引入动作电影的剪辑语言:把”剪影”升级为独立的 impact 镜。黑暗剑士的既有定妆图作为图像参考,在 Midjourney 中生成低角度仰视的登场帧:焰冠、双目红光、缠绕电光的超长刀、身后劈落的巨型闪电。远景行进与近景登场之间用硬切衔接,切点正落在登场镜开场的雷光上。

动化阶段的三次收敛

登场镜的视频生成又经历了三轮修订,每一轮都是一条可复用的经验:

  1. 塑料化:厚涂质感的近景大特写经过图生视频后表面被”实化”,绘画感流失。对策有二:指令层面锁定材质与哑光;更根本的是后来发现 Midjourney 自家的 animate 功能动化自家厚涂图几乎零质感损耗——最终成片中的大远景行进段就使用了这条路线。氛围微动用 MJ animate,强指令动作用 Seedance,两个动化引擎各就各位。
  2. 静止的登场需要运镜:微动纪律适用于氛围镜,但登场镜完全固定机位会失去张力。加入极缓慢的推近后,压迫感立刻成立。
  3. 克制即压迫:双眼红光最初做成了摇曳的火焰,创作者裁决改为”两点静止的暗红光,像深渊里一动不动凝视你的目光”——并将刀身电光设为全画面唯一快速运动的元素。静与动的单点对比,胜过一切炫技。
刀身电弧的四张连续帧放大,电弧形态逐帧变化;下方为两张全画面帧
定稿版的刀身电弧:0.1 秒间隔的四连拍中,电弧的缠绕形态逐帧不同——它是全画面唯一"快"的元素。

声音与成片

声音设计遵循同一套克制逻辑:全片以低频轰鸣为声底(重力般的压迫感),雨声铺垫,雷声只作点缀;登场段低频显著加重,结尾随画面转暗一起收干净。配乐由平台内置引擎生成两版候选,创作者试听后不仅选定版本,还指定了曲内的具体段落——配乐比片长长是常态,取哪一段同样是创作决定。

最终时间线:骑士独行(5 秒)→ 大远景走向废墟(5.2 秒,MJ animate 动化)→ 黑暗剑士降临(4 秒)。

成片六帧抽样:骑士雾中走来、走近、大远景废墟背影、远景深处、雷光中黑暗剑士、结尾转暗
定稿版全片抽帧:三段结构,两次硬切,第二切点落在登场镜的巨闪上。

可复用的规则

这次测试沉淀的规则,按重要性排序:

  1. 任务形状先于一切:把目标缩进当前模型的能力圈(微动、零接触、零因果证明),失败率的下降不是渐进的,而是断崖式的;
  2. 关键帧是身份与质感的命脉——由人用最强的图像工具完成,不交给视频平台的附属图像模型;
  3. 首帧信息量决定动画上限:首帧里不存在的信息(被遮挡的结构),动画阶段必然被脑补;
  4. 凡重要视觉一律图锚,文字只锁行为与节奏;重要角色的登场值得单独一个 impact 镜;
  5. 动化引擎按镜分配:厚涂氛围微动用 MJ animate(质感无损),强指令动作用 Seedance(近景有塑料化代价);
  6. 克制即张力:静止的威压、单一的快速元素、收敛的光,胜过堆叠特效;
  7. 验收外置不可省:平台自检只作线索;逐镜抽帧、由人终审,是所有上述规则能被执行的前提。

并行失败记录《Codex 5.6 Sol 路线:塞拉斯五镜绿地实验失败复盘》的结论是:新项目、完整 Storyboard 和成功导出都不能代表作品成立。本片补充的是:创作判断同样不能交给平台——但只要人守住关键帧与终审两个环节,剩下的大量流程可以放心地交给 Claude Fable 5 与编排层。

关联阅读

02 / LINKS
C01

Codex 5.6 Sol 路线:塞拉斯五镜绿地实验失败复盘

由 Codex 5.6 Sol 驱动的一次 Flova 五镜实验:Storyboard、逐镜生成、声音和导出均告完成,成片仍只获得 3–4/10。

阅读全文 ↗
C02

Flova 全流程实测:项目跑通,影片仍未通过

承接逐镜生成失败后,将同一动作片交给 Flova 完成导演审计、故事板、关键帧、四镜生成、声音与导出。系统交付了 38.24 秒影片,但角色污染、风格漂移、接触逻辑和自检误判使整条工作流仍被判定为失败。

阅读全文 ↗