Alias Archive档案更新中
档案更新中

Flova 全流程实测:项目跑通,影片仍未通过

承接逐镜生成失败后,将同一动作片交给 Flova 完成导演审计、故事板、关键帧、四镜生成、声音与导出。系统交付了 38.24 秒影片,但角色污染、风格漂移、接触逻辑和自检误判使整条工作流仍被判定为失败。

归档日期
归属板块
其他
语言版本
ZH / 阅读版本
雨夜遗迹中,Phase 1 骑士持剑面对纯岩石构成的石头巨人
正式生成前唯一批准的视觉母版:角色、Boss、尺度、舞台和 Niji 衍生画风都已明确。

上一篇记录停在一个转折点:逐镜调用 Dreamina、Seedance 与 Kling,能偶尔得到漂亮的五秒,却无法稳定组成一段空间可信的动作。于是同一个目标被交给 Flova,测试一个项目级平台能否把导演、故事板、素材、模型、声音、时间线和导出整合起来。

它确实跑通了全部环节,也交付了一条 38.24 秒影片。但按原始目标验收,这条 Flova 工作流仍然失败。

这里的失败不是“文件损坏”或“没有生成”。相反,它能播放、有声音、有四个镜头、有完整时间线。失败发生在更难的一层:画面没有始终证明提示词声称的动作,角色身份没有始终锁定,修正操作会破坏已经批准的画风,而平台自己的导演审查又没有可靠发现这些问题。

目标不是导出,而是连续成立

故事被限制为四个镜头:

  1. 骑士穿过石头巨人的最后一次攻击弧,进入近腿位置;
  2. 骑士真实命中膝部岩缝,Boss 因结构失稳单膝跪地;
  3. 骑士处决胸部核心,Boss 崩落,骑士力竭;
  4. 战斗完全结束后,Vera 才提灯进入。

总时长允许维持在 37 至 40 秒,不为了节省 credits 强行压缩。画面必须保持同一个雨夜遗迹、同一名 Phase 1 骑士、同一只纯岩石 Boss,以及 Vera 已确认的脸、服装和提灯设定。

因此,以下任意一项发生,影片都不能算通过:

  • 角色在尚未到达的距离上命中;
  • 剑没有与目标部位产生可见交叠;
  • Boss 突然变成盔甲巨人;
  • 武器或提灯增殖;
  • Vera 的身份、服装或持灯手改变;
  • Niji 衍生画风变成塑料 CG、扁平卡通或高频数字噪点;
  • 平台只依据提示词自称“命中”,但画面没有提供证据。

这套标准比“生成成功”严格,也正因为如此,后面的失败才有分析价值。

分工:Flova 是项目导演,不是单个模型

本轮没有把 Flova 当成另一个文生视频接口。分工如下:

层级责任
人类任务方确认剧情、角色资产、可接受成本和最终审美
Codex全局策划、素材组织、提示边界、逐帧 QA、成本记录与交付
Flova导演审计、Storyboard、镜头拆分、模型路由、项目资源、时间线、声音和导出
Seedance 2.0四段图生视频与原生动作/环境声
图像模型Gate B 关键元素与空间预演,以及失败后的修正尝试

这一区分很重要。Flova 的价值不在于“它自己有一个更强的视频模型”,而在于它能够围绕一个持续存在的项目组织多个模型和中间产物。测试的问题是:这种组织能力能否同时承担导演判断和质量验收。

第一阶段:零媒体导演审计是正确的

Flova 的第一轮只读项目素材和此前失败记录,不生成媒体,也没有新增媒体消耗。它正确指出了早期续接视频的核心问题:骑士与 Boss 在画面里仍隔着明显距离,却能原地起身直接砍中;这不是动作不够酷,而是三维空间关系已经断裂。

第二轮同样保持文本与 Storyboard 层面。Flova 没有机械接受外部提出的六镜拆法,而是坚持四镜和 37 至 40 秒:

  • Shot 1 解决最后一次向内闪避;
  • Shot 2 只解决近身破势与 Boss 落膝;
  • Shot 3 保留处决、死亡和力竭的连续心理时间;
  • Shot 4 才让 Vera 入场。

它还提出用上一镜末尾一至两秒作为下一镜 video reference,并把“命中”定义为剑刃与岩体的几何交叠,而不是离体火花。

这一阶段是 Flova 工作流里最可靠的部分:它把含糊的动作愿望转成了可检查的镜头职责。

Gate B:静帧自检第一次失效

进入媒体阶段后,Flova 先生成三张关键元素图和六张空间预演图,初始消耗 42 credits。它将 Shot 2 跪地帧判为通过,但人工检查马上发现两个严重问题。

第一,Boss 的头部被生成成放大版骑士头盔,出现了清楚的面甲与金属轮廓。第二,骑士的剑已经碰到胸口亮点,并形成十字爆光,相当于在 Shot 2 结尾提前完成了 Shot 3 的处决。

骑士站在石头巨人面前,Boss 头部错误地呈现巨型骑士头盔,剑尖已经碰到胸口亮点
Flova 判定通过的预演帧:Boss 身份被骑士特征污染,处决动作也被提前。

第一次定点修正消耗 28 credits。头盔和提前接触得到修正,但整张画面被重新生成,原来的高细节暗黑质感变成扁平概念插画;另一个 Shot 4 修正版还同时出现两件剑形武器。

画风明显扁平化的石头巨人与骑士修正版
物件错误减少了,已经批准的画风也一起消失了。局部问题被错误地当作整张重生成任务。
倒下骑士、Vera 与岩石残骸构图中出现重复剑形武器
另一张“已修正”预演:提灯手得到调整,却引入了武器增殖。

第二次修正再生成三个候选,消耗 42 credits。物件数量终于大致正确,但画风继续漂移。至此 Gate B 共记录 112 credits 的图片消耗,却没有得到一套既符合设定、又保持母版画风的正式关键帧。

后续尝试把原图交给 Image2 做局部修补,虽然去掉了头盔并拉开剑尖距离,却引入了熟悉的高频砂砾与数字锐化感。边缘保护降噪只能减轻颗粒,无法把已经被重画的材质恢复成 Niji 笔触。

最终决定不是继续修,而是撤销这些中间图的视觉权威:重新回到最初批准的 Niji 合成图,把它设为 Shot 1 唯一的画风与身份母版。

Gate C:唯一视觉母版改善了第一镜

Shot 1 使用批准母版生成 6.06 秒 Seedance 2.0 视频,带 AAC 双声道原生声音。骑士不再向外逃离,而是在巨臂形成威胁时向内移动,镜头通过前景巨臂和跟拍建立压迫,最后停在 Boss 近腿侧。

Shot 1 抽帧:石头巨人挥臂,骑士从远位穿过攻击弧并到达近腿侧
第一镜证明了两个有效方法:只保留一个视觉母版,以及让动作目标服从首帧真实几何。

这一镜可以通过,但不是 Flova 自评所说的“无停顿”。开头蓄势与结尾蹲伏都略长。区别在于,这些停留尚未破坏空间因果,可以在时间线里温和处理,而不是硬剪掉人物呼吸。

从 Shot 1 开始,后续每一镜优先继承上一镜末段,终于形成一条连续的近身链条。

四镜成片:两镜通过,两镜条件失败

Shot 2 长 8.06 秒。它从近腿位置开始,Boss 最终也确实落膝;但胸口核心在膝部破势阶段提前强烈发光,剑与膝部岩缝的几何接触证据又不够清楚。画面能证明“Boss 跪下了”,却没有充分证明“骑士命中膝部,所以 Boss 跪下”。

Shot 2 抽帧:骑士靠近石头巨人腿部,Boss 胸口提前强烈发光并最终跪下
结果出现了,因果证据不足:胸口过早成为视觉中心,膝部命中没有被清楚证明。

Shot 3 长 13.07 秒,是全片执行最好的一镜。骑士从近身状态直接处决胸部核心;Boss 以岩体失去支撑的方式沉重崩落,没有消失、漂浮或变成另一个盔甲巨人;骑士随后扶剑跪地,力竭过程保留了连续时间。

Shot 3 抽帧:骑士刺入胸部核心,石头巨人崩落,骑士最后扶剑跪下
处决、材料反应、Boss 死亡和骑士力竭构成了完整动作链。

Shot 4 长 11.05 秒。骑士先从跪地自然侧倒,Vera 随后从背景进入,Boss 保持为无生命岩石残骸;叙事顺序正确,冷雨与暖灯也形成了收束。

问题是,Vera 的脸、年龄感与服装已经偏离权威角色包,提灯也更像位于她自己的左手侧,而不是设定中的右手。新角色首次入镜时没有从上一镜获得身份继承,Flova 只凭角色参考图仍未稳定锁住她。

Shot 4 抽帧:骑士倒下后,身份有所漂移的 Vera 提灯走近
剧情完成了,角色连续性没有完成。Vera 的身份与提灯手仍不可靠。

最终结果是:

镜头外部验收
Shot 1:向内闪避通过,有节奏保留意见
Shot 2:膝部破势条件失败:接触证据不足,胸口提前发光
Shot 3:处决与力竭通过
Shot 4:Vera 入场条件失败:身份与提灯手漂移

平台自检为什么是本轮最大风险

Flova 在最终报告里把四镜全部标记为通过,并明确写下:

  • Shot 2 的剑刃几何接触通过;
  • Shot 4 的 Vera 右手提灯通过;
  • 全片没有画风漂移或身份问题。

逐帧证据并不支持这些结论。更早的 Gate B 中,它也曾把带有巨型骑士头盔的 Boss 判为通过。

这说明平台的“导演自审”很可能受自己先前的文字意图影响:提示词写了右手提灯,它就倾向于在总结里报告右手提灯;提示词写了攻击膝部,它就报告膝部接触。它没有始终把最终像素重新当作独立证据。

这不是措辞问题,而是自动化风险。如果上层代理直接相信下层平台的自评,错误会穿过每一道 Gate,最后带着“全部通过”的标签进入导出。

因此,本轮最重要的结论不是“Flova 也会生成坏视频”,而是:

项目编排可以交给平台,最终事实判断不能交给生成同一结果的平台。

技术上完整,目标上失败

Flova 成功建立完整时间线并导出 38.24 秒视频:

  • 1280 × 720;
  • 30fps;
  • H.264 视频;
  • AAC 44.1kHz 双声道;
  • 未检测到异常黑帧;
  • 片尾约 1.25 秒静音,对应计划内淡出。
38.24 秒最终影片每秒抽帧组成的完整联系表
四镜在空间和叙事上可以顺序播放,但完整时间线不会自动修复镜头内部的语义错误。
Flova V1 最终导出 · 38.24 秒 · 技术交付完整,目标验收失败

技术通过与内容通过必须分开。编码、音轨、时长、黑帧检测和导出任务都成功,只能证明交付物完整;原始目标要求四镜同时成立,而其中两镜没有通过,所以整条工作流仍判失败。

成本:减少了编排劳动,没有消除返工

Gate B 的可观测图片消耗为:

  • 初始九张图:42 credits;
  • 第一轮两张修正:28 credits;
  • 第二轮三张修正:42 credits;
  • 合计:112 credits。

进入视频阶段前,账户余额被观察为 6558 credits;完成 Shot 1、Shot 2–4、时间线与导出后为 5484 credits,可观测媒体执行消耗约 1074 credits。其中 Shot 1 约 144 credits,后续三镜、时间线与导出合并差额约 930 credits。

Gate B 与视频阶段之间曾出现一次无法由项目日志解释的 50 credits 余额增加,因此这里不把所有数字伪装成一份精确逐项账单。可以确认的是:项目级整合没有让媒体成本消失,而错误的关键帧修正还会在进入视频前持续消耗。

Flova 节省的是组织成本:同一个项目里保留 Storyboard、资源、上一镜参考、声音和时间线,不再需要手工搬运每个模型结果。它没有节省最终验收,也没有避免重做错误镜头。

这条失败工作流留下的可复用原则

只允许一个权威视觉母版

角色、Boss、尺度和画风必须有明确优先级。修正版不能因为“更新”就自动覆盖已经批准的母版。

video reference 比重复描述更可靠

Shot 1 到 Shot 4 的空间连续性明显优于早期逐镜手搓,主要收益来自继承上一镜末段,而不是写出更长的提示词。

接触必须由像素证明

动作提示词、离体火花和结果状态都不能替代接触证据。剑刃与目标部位必须在正确时刻发生可见遮挡或交叠。

新角色入镜前先做身份 Gate

Vera 不应直接进入长视频生成。更稳妥的做法是先生成一张通过脸、服装、比例、提灯和左右手检查的入场首帧,再把它用于图生视频。

修局部错误不能整张重生成

Boss 头盔、提灯手或重复武器都应使用局部编辑。整张重生成会把已经通过的画风和身份重新放回随机过程。

下层自检只能作为线索

Flova 可以提出审查项、整理报告和发现部分问题,但它不能成为自己的最终验收者。上层代理仍需抽帧、核对物件、检查声音并对照原始目标。

结论

这次 Flova 测试比此前的逐镜手搓更接近真正的生产系统:它能先分析、再规划、生成镜头、继承参考、组织声音、建立时间线并导出成片。Shot 1 与 Shot 3 也证明,这套结构能够产生实际改善。

但目标不是证明平台能工作,而是得到一段角色、动作和剧情都可靠的影片。Shot 2 的接触因果与 Shot 4 的 Vera 身份仍然失败,平台自检又将它们报告为通过。因此这条完整 Flova 工作流必须按失败案例归档。

下一版不需要推翻全部结果。保留 Shot 1 与 Shot 3,只重做 Shot 2 和 Shot 4:前者锁定膝部接触,后者先建立经过身份审查的 Vera 入场首帧。真正需要保留的不是这条 V1,而是已经验证有效的项目结构和失败判定标准。

关联阅读

01 / LINKS
C01

AI 动作导演失败记录:逐镜生成失效与 Flova 转向

以石头巨人战斗镜头为例,记录 Niji、Image2、Seedance、Dreamina、BytePlus 与 Kling 的动作测试,分析动作因果、空间连续性与三维距离为何使逐镜生成路线失效,并说明转向 Flova 项目级工作流评估的依据。

阅读全文 ↗