上一篇记录停在一个转折点:逐镜调用 Dreamina、Seedance 与 Kling,能偶尔得到漂亮的五秒,却无法稳定组成一段空间可信的动作。于是同一个目标被交给 Flova,测试一个项目级平台能否把导演、故事板、素材、模型、声音、时间线和导出整合起来。
它确实跑通了全部环节,也交付了一条 38.24 秒影片。但按原始目标验收,这条 Flova 工作流仍然失败。
这里的失败不是“文件损坏”或“没有生成”。相反,它能播放、有声音、有四个镜头、有完整时间线。失败发生在更难的一层:画面没有始终证明提示词声称的动作,角色身份没有始终锁定,修正操作会破坏已经批准的画风,而平台自己的导演审查又没有可靠发现这些问题。
目标不是导出,而是连续成立
故事被限制为四个镜头:
- 骑士穿过石头巨人的最后一次攻击弧,进入近腿位置;
- 骑士真实命中膝部岩缝,Boss 因结构失稳单膝跪地;
- 骑士处决胸部核心,Boss 崩落,骑士力竭;
- 战斗完全结束后,Vera 才提灯进入。
总时长允许维持在 37 至 40 秒,不为了节省 credits 强行压缩。画面必须保持同一个雨夜遗迹、同一名 Phase 1 骑士、同一只纯岩石 Boss,以及 Vera 已确认的脸、服装和提灯设定。
因此,以下任意一项发生,影片都不能算通过:
- 角色在尚未到达的距离上命中;
- 剑没有与目标部位产生可见交叠;
- Boss 突然变成盔甲巨人;
- 武器或提灯增殖;
- Vera 的身份、服装或持灯手改变;
- Niji 衍生画风变成塑料 CG、扁平卡通或高频数字噪点;
- 平台只依据提示词自称“命中”,但画面没有提供证据。
这套标准比“生成成功”严格,也正因为如此,后面的失败才有分析价值。
分工:Flova 是项目导演,不是单个模型
本轮没有把 Flova 当成另一个文生视频接口。分工如下:
| 层级 | 责任 |
|---|---|
| 人类任务方 | 确认剧情、角色资产、可接受成本和最终审美 |
| Codex | 全局策划、素材组织、提示边界、逐帧 QA、成本记录与交付 |
| Flova | 导演审计、Storyboard、镜头拆分、模型路由、项目资源、时间线、声音和导出 |
| Seedance 2.0 | 四段图生视频与原生动作/环境声 |
| 图像模型 | Gate B 关键元素与空间预演,以及失败后的修正尝试 |
这一区分很重要。Flova 的价值不在于“它自己有一个更强的视频模型”,而在于它能够围绕一个持续存在的项目组织多个模型和中间产物。测试的问题是:这种组织能力能否同时承担导演判断和质量验收。
第一阶段:零媒体导演审计是正确的
Flova 的第一轮只读项目素材和此前失败记录,不生成媒体,也没有新增媒体消耗。它正确指出了早期续接视频的核心问题:骑士与 Boss 在画面里仍隔着明显距离,却能原地起身直接砍中;这不是动作不够酷,而是三维空间关系已经断裂。
第二轮同样保持文本与 Storyboard 层面。Flova 没有机械接受外部提出的六镜拆法,而是坚持四镜和 37 至 40 秒:
- Shot 1 解决最后一次向内闪避;
- Shot 2 只解决近身破势与 Boss 落膝;
- Shot 3 保留处决、死亡和力竭的连续心理时间;
- Shot 4 才让 Vera 入场。
它还提出用上一镜末尾一至两秒作为下一镜 video reference,并把“命中”定义为剑刃与岩体的几何交叠,而不是离体火花。
这一阶段是 Flova 工作流里最可靠的部分:它把含糊的动作愿望转成了可检查的镜头职责。
Gate B:静帧自检第一次失效
进入媒体阶段后,Flova 先生成三张关键元素图和六张空间预演图,初始消耗 42 credits。它将 Shot 2 跪地帧判为通过,但人工检查马上发现两个严重问题。
第一,Boss 的头部被生成成放大版骑士头盔,出现了清楚的面甲与金属轮廓。第二,骑士的剑已经碰到胸口亮点,并形成十字爆光,相当于在 Shot 2 结尾提前完成了 Shot 3 的处决。
第一次定点修正消耗 28 credits。头盔和提前接触得到修正,但整张画面被重新生成,原来的高细节暗黑质感变成扁平概念插画;另一个 Shot 4 修正版还同时出现两件剑形武器。
第二次修正再生成三个候选,消耗 42 credits。物件数量终于大致正确,但画风继续漂移。至此 Gate B 共记录 112 credits 的图片消耗,却没有得到一套既符合设定、又保持母版画风的正式关键帧。
后续尝试把原图交给 Image2 做局部修补,虽然去掉了头盔并拉开剑尖距离,却引入了熟悉的高频砂砾与数字锐化感。边缘保护降噪只能减轻颗粒,无法把已经被重画的材质恢复成 Niji 笔触。
最终决定不是继续修,而是撤销这些中间图的视觉权威:重新回到最初批准的 Niji 合成图,把它设为 Shot 1 唯一的画风与身份母版。
Gate C:唯一视觉母版改善了第一镜
Shot 1 使用批准母版生成 6.06 秒 Seedance 2.0 视频,带 AAC 双声道原生声音。骑士不再向外逃离,而是在巨臂形成威胁时向内移动,镜头通过前景巨臂和跟拍建立压迫,最后停在 Boss 近腿侧。
这一镜可以通过,但不是 Flova 自评所说的“无停顿”。开头蓄势与结尾蹲伏都略长。区别在于,这些停留尚未破坏空间因果,可以在时间线里温和处理,而不是硬剪掉人物呼吸。
从 Shot 1 开始,后续每一镜优先继承上一镜末段,终于形成一条连续的近身链条。
四镜成片:两镜通过,两镜条件失败
Shot 2 长 8.06 秒。它从近腿位置开始,Boss 最终也确实落膝;但胸口核心在膝部破势阶段提前强烈发光,剑与膝部岩缝的几何接触证据又不够清楚。画面能证明“Boss 跪下了”,却没有充分证明“骑士命中膝部,所以 Boss 跪下”。
Shot 3 长 13.07 秒,是全片执行最好的一镜。骑士从近身状态直接处决胸部核心;Boss 以岩体失去支撑的方式沉重崩落,没有消失、漂浮或变成另一个盔甲巨人;骑士随后扶剑跪地,力竭过程保留了连续时间。
Shot 4 长 11.05 秒。骑士先从跪地自然侧倒,Vera 随后从背景进入,Boss 保持为无生命岩石残骸;叙事顺序正确,冷雨与暖灯也形成了收束。
问题是,Vera 的脸、年龄感与服装已经偏离权威角色包,提灯也更像位于她自己的左手侧,而不是设定中的右手。新角色首次入镜时没有从上一镜获得身份继承,Flova 只凭角色参考图仍未稳定锁住她。
最终结果是:
| 镜头 | 外部验收 |
|---|---|
| Shot 1:向内闪避 | 通过,有节奏保留意见 |
| Shot 2:膝部破势 | 条件失败:接触证据不足,胸口提前发光 |
| Shot 3:处决与力竭 | 通过 |
| Shot 4:Vera 入场 | 条件失败:身份与提灯手漂移 |
平台自检为什么是本轮最大风险
Flova 在最终报告里把四镜全部标记为通过,并明确写下:
- Shot 2 的剑刃几何接触通过;
- Shot 4 的 Vera 右手提灯通过;
- 全片没有画风漂移或身份问题。
逐帧证据并不支持这些结论。更早的 Gate B 中,它也曾把带有巨型骑士头盔的 Boss 判为通过。
这说明平台的“导演自审”很可能受自己先前的文字意图影响:提示词写了右手提灯,它就倾向于在总结里报告右手提灯;提示词写了攻击膝部,它就报告膝部接触。它没有始终把最终像素重新当作独立证据。
这不是措辞问题,而是自动化风险。如果上层代理直接相信下层平台的自评,错误会穿过每一道 Gate,最后带着“全部通过”的标签进入导出。
因此,本轮最重要的结论不是“Flova 也会生成坏视频”,而是:
项目编排可以交给平台,最终事实判断不能交给生成同一结果的平台。
技术上完整,目标上失败
Flova 成功建立完整时间线并导出 38.24 秒视频:
- 1280 × 720;
- 30fps;
- H.264 视频;
- AAC 44.1kHz 双声道;
- 未检测到异常黑帧;
- 片尾约 1.25 秒静音,对应计划内淡出。
技术通过与内容通过必须分开。编码、音轨、时长、黑帧检测和导出任务都成功,只能证明交付物完整;原始目标要求四镜同时成立,而其中两镜没有通过,所以整条工作流仍判失败。
成本:减少了编排劳动,没有消除返工
Gate B 的可观测图片消耗为:
- 初始九张图:42 credits;
- 第一轮两张修正:28 credits;
- 第二轮三张修正:42 credits;
- 合计:112 credits。
进入视频阶段前,账户余额被观察为 6558 credits;完成 Shot 1、Shot 2–4、时间线与导出后为 5484 credits,可观测媒体执行消耗约 1074 credits。其中 Shot 1 约 144 credits,后续三镜、时间线与导出合并差额约 930 credits。
Gate B 与视频阶段之间曾出现一次无法由项目日志解释的 50 credits 余额增加,因此这里不把所有数字伪装成一份精确逐项账单。可以确认的是:项目级整合没有让媒体成本消失,而错误的关键帧修正还会在进入视频前持续消耗。
Flova 节省的是组织成本:同一个项目里保留 Storyboard、资源、上一镜参考、声音和时间线,不再需要手工搬运每个模型结果。它没有节省最终验收,也没有避免重做错误镜头。
这条失败工作流留下的可复用原则
只允许一个权威视觉母版
角色、Boss、尺度和画风必须有明确优先级。修正版不能因为“更新”就自动覆盖已经批准的母版。
video reference 比重复描述更可靠
Shot 1 到 Shot 4 的空间连续性明显优于早期逐镜手搓,主要收益来自继承上一镜末段,而不是写出更长的提示词。
接触必须由像素证明
动作提示词、离体火花和结果状态都不能替代接触证据。剑刃与目标部位必须在正确时刻发生可见遮挡或交叠。
新角色入镜前先做身份 Gate
Vera 不应直接进入长视频生成。更稳妥的做法是先生成一张通过脸、服装、比例、提灯和左右手检查的入场首帧,再把它用于图生视频。
修局部错误不能整张重生成
Boss 头盔、提灯手或重复武器都应使用局部编辑。整张重生成会把已经通过的画风和身份重新放回随机过程。
下层自检只能作为线索
Flova 可以提出审查项、整理报告和发现部分问题,但它不能成为自己的最终验收者。上层代理仍需抽帧、核对物件、检查声音并对照原始目标。
结论
这次 Flova 测试比此前的逐镜手搓更接近真正的生产系统:它能先分析、再规划、生成镜头、继承参考、组织声音、建立时间线并导出成片。Shot 1 与 Shot 3 也证明,这套结构能够产生实际改善。
但目标不是证明平台能工作,而是得到一段角色、动作和剧情都可靠的影片。Shot 2 的接触因果与 Shot 4 的 Vera 身份仍然失败,平台自检又将它们报告为通过。因此这条完整 Flova 工作流必须按失败案例归档。
下一版不需要推翻全部结果。保留 Shot 1 与 Shot 3,只重做 Shot 2 和 Shot 4:前者锁定膝部接触,后者先建立经过身份审查的 Vera 入场首帧。真正需要保留的不是这条 V1,而是已经验证有效的项目结构和失败判定标准。