这是一条在流程上完成、在作品上失败的 15 秒视频。该路线由 Codex 5.6 Sol 驱动,Flova 是项目编排与生成平台,创作者保留最终验收权。
项目从零建立,使用新的骑士与塞拉斯概念图,没有继承此前动作短片的 Storyboard、合成帧或视频。Flova 完成导演规划、五镜 Storyboard、Key Elements、两轮视频生成、声音设计、时间线和最终导出;Codex 5.6 Sol 负责材料说明、阶段 Gate、抽帧验收与修改指令。它满足“绿地重启”的形式条件,却没有获得相应的质量重置。
创作者的最终评价是 3–4/10,不及格。这一评分比“导出成功”更接近项目事实。
目标:让导演平台自行规划一次封路遭遇
剧情位于游戏第一章末段:三座火台已经点亮,骑士从钟楼方向返回,塞拉斯在寒冷、雾霭覆盖的峡口封住退路。这 15 秒不展示完整战斗,只需完成“独行—察觉—现身—压迫—对峙”的威胁揭示。
项目一开始刻意减少了对导演层的束缚。角色身份、剧情真值和视觉边界由人提供;镜头数量、时长、机位、节奏和声音由 Flova 判断。为了避免重复此前连续动作视频的失败,也明确不要求兵器碰撞、剑刃接触或多人长动作链。
Flova 给出的原生 Storyboard 包含五镜:
| 镜头 | 计划时长 | 单一职责 |
|---|---|---|
| 骑士独行 | 约 3 秒 | 建立峡口、寒冷和孤立感 |
| 察觉异常 | 约 2 秒 | 骑士停步并感知威胁 |
| 封路现身 | 约 4 秒 | 塞拉斯从雾中出现并横剑封路 |
| 压迫逼近 | 约 4 秒 | 以低角度和缓慢推进强化塞拉斯 |
| 剑拔弩张 | 约 2 秒 | 建立交锋前的双方轴线 |
文字规划本身是成立的。它没有把 15 秒浪费在背景解释上,也没有安排超出模型能力圈的复杂战斗。但后续证明:Storyboard 的因果顺序正确,不等于生成后的空间关系会自动正确。
工作流:阶段 Gate 完整,审美权却没有锁紧
实际流程分为六个阶段:
- 上传骑士的两张 Niji 概念图、正面结构图、单独长剑图,以及塞拉斯概念图;
- 让 Flova 建立 Final Video Spec 与五镜 Storyboard;
- 先生成塞拉斯、骑士和峡口环境的 Key Elements,作为付费能力探针;
- 一次生成五个视频镜头,由 Codex 5.6 Sol 抽帧、创作者终审;
- 保留 Shot 2、4,重拍 Shot 1、3、5;
- 对无法收敛的镜头做剪辑救场,生成统一声音层并导出 15 秒成片。
最高风险探针选择了“塞拉斯进入场景后能否保住身份、长剑和电流”。塞拉斯单体 Key Element 初步通过,但骑士第一次场景化结果混入了旧结构参考的塑料感。第二次只允许两张最新 Niji 概念图参与,画风明显改善。
这里已经出现了与 Claude Fable 5 驱动的并行项目《守夜》的关键差异。《守夜》把每个重要关键帧交给创作者在 Midjourney 中完成,平台只做编排和动化;本项目虽然也建立了 Gate,却仍让 Flova 的附属图像模型承担角色场景化与逐镜视觉解释。前者锁定的是最终像素层面的审美锚,后者锁定的仍然只是参考关系。
第一轮:五镜中只有两个通过
第一轮一次生成五个镜头。外部抽帧验收的结论如下:
- Shot 1:骑士走得过快,缺少负重、谨慎和环境阻力,拒绝;
- Shot 2:身份稳定,小动作克制,作为两秒反应镜成立,通过;
- Shot 3:塞拉斯失去高挑、修长的比例,像普通杂兵,拒绝;
- Shot 4:低角度缓慢推进,塞拉斯轮廓和电流保持稳定,通过;
- Shot 5:骑士把剑竖插在地上,塞拉斯像远处雕像,构图缺乏战术和叙事意义,拒绝。
两个成功镜头具有相同结构:单主体、低运动量、明确构图、让摄影和声音承担叙事。 这不是偶然,而是本次实验最稳定的能力边界。
第二轮:重拍没有解决根因
第二轮只重拍 Shot 1、3、5,但三个结果都没有真正收敛:
- Shot 1 的步频放慢了,角色却出现倒着行走,运动方向错误;
- Shot 3 的比例略有改善,但与第一版差别有限,动作和显影仍然僵硬;
- Shot 5 建立了较清楚的对峙轴线,但骑士背部再次出现本应只在胸前的橙色十字,人物动作也很僵。
重拍的失败说明,修改“慢一点”“更高挑”“建立对峙轴线”只能约束表面特征,无法补足首帧和镜头结构中缺失的信息。角色运动方向、身份标记所在表面、两人相距多远、为何此刻能看见对方,仍然由模型自由解释。
剪辑救场:技术上补齐,创作上没有获救
用户决定停止继续消耗生成额度。时间线采用以下妥协:
- Shot 1 回退第一版,降速并截取约三秒;
- Shot 2 使用第一轮通过版;
- Shot 3 勉强使用第二版;
- Shot 4 使用第一轮通过版;
- Shot 5 不采用带背部十字的动态视频,改用一张无明显错误的首帧做两秒轻推。
原视频自带声音全部静音,Flova 重新生成 15 秒环境、电弧和金属音效,并配一条克制的暗色弦乐/低频 drone。镜头之间主要使用硬切和声音桥。最终文件时长 15 秒,流程完整闭环。
问题是:剪辑可以隐藏局部错误,却不能制造缺失的表演、空间关系和叙事动作。 当 Shot 5 从失败视频退化为静帧时,时间线只是被填满,作品并没有因此获得一个结尾。
创作者最终评分
最终验收以创作者的观看体验为准,而不是平台任务状态:
| 镜头 | 评分 | 最终评价 |
|---|---|---|
| Shot 1 | 勉强及格 | 中规中矩,经过降速后可用,但没有明显亮点 |
| Shot 2 | 7–8/10 | 音效、角色与画风都较稳定,没有明显问题 |
| Shot 3 | 1/10 | 与 Shot 1 使用近似场景,但两个角色的出现没有逻辑;人物形象丑陋、武器塑料,1 分只是辛苦分 |
| Shot 4 | 8/10 | 基本保住塞拉斯的形象、画风与压迫感,武器特效仍有不足 |
| Shot 5 | 0/10 | 只是一张静图,没有可评价的动态内容 |
总体评价:3–4/10,不及格。
这一结果也揭示了平均分的误导性。Shot 2、4 可以达到七八分,但它们无法抵消 Shot 3 的叙事断裂和 Shot 5 的功能缺失。一条短片的质量由最关键的结构节点决定,不是五个镜头分数的简单平均。
为什么绿地重启仍然失败
1. 清空历史不等于建立视觉权威
本项目确实没有继承旧项目状态,但上传多张不同职责的参考图后,平台仍会重新解释角色。绿地只解决“旧污染”,没有解决“谁拥有最终像素裁决权”。《守夜》的优势不是更干净地开了新项目,而是把重要首帧全部交给人工 Midjourney 生成并逐张批准。
2. Storyboard 描述了因果,镜头资产没有证明因果
“独行—察觉—现身”在文字上自然,但 Shot 1 与 Shot 3 使用近似空间时,没有建立塞拉斯从哪里出现、骑士为何看见他、两人相距多远。模型生成了两个分别可读的画面,却没有生成一个连续事件。
3. 静态能力探针验证得太窄
塞拉斯 Key Element 探针只验证了静态身份、武器和画风。真正推翻方案的风险其实是:角色能否在指定空间中以合理方向出现,并与前后镜头形成连续关系。探针通过后直接批量生成五镜,仍然跨过了最危险的问题。
4. 重拍继续修改症状,没有重构镜头
第二轮仍以原有五镜为框架,要求平台“走慢一点”“更高挑”“换成对峙轴线”。当镜头职责本身无法被当前资产证明时,更有效的动作应是删除、合并或用人工关键帧重构,而不是继续在同一个镜头槽位里迭代。
5. 时间线完成被误当成项目完成
Shot 5 的静帧救场让文件满足 15 秒,却把“交锋前最后一刻”从动态高潮变成占位画面。一个导出任务成功,只能证明媒体被编码;不能证明镜头承担了叙事职责。
与《守夜》路线的对照
由 Claude Fable 5 驱动的并行实验《守夜》同样使用 Flova,但采取了不同结构:任务缩为三个微动氛围镜;所有重要关键帧由创作者在 Midjourney 中完成;失败镜头允许直接删除;厚涂氛围镜优先使用 MJ animate,Seedance 只承担更适合它的动化任务。
这两条路线共同证明 Flova 在项目记忆、Storyboard、资源编排、声音和时间线方面有价值。差异则说明:编排平台不能替代审美锚点,也不能替代删除镜头的创作判断。 当关键帧与终审都由人掌握时,代理可以安全地承接大量流程;当平台同时负责画面解释、动化和自我验收时,绿地项目仍会稳定地产出“流程完整、作品不成立”的结果。
下一次必须改变的规则
- 绿地定义必须包含资产治理:每个重要镜头都要有人工批准的唯一关键帧,不只是不继承旧项目。
- 能力探针必须验证最可能推翻方案的关系,例如运动方向、空间连续和身份表面,而非只验证漂亮静图。
- 每个镜头进入视频前先通过三项 Gate:单帧审美、空间逻辑、可执行动作。
- 重拍只能修改一个明确变量;若第二次仍失败,优先删除或重构镜头,不继续填补原 Storyboard。
- “静帧占位”必须标为缺镜,不能在最终验收中冒充视频镜头。
- Agent 与平台的职责必须分开记录:Codex 5.6 Sol 负责流程推进和外部验收,Flova 负责导演建议与编排,人工负责关键帧、取舍和事实验收;成功状态永远由成片观看结果定义。
这次实验最有价值的产物不是 15 秒视频,而是一个更严格的判断:绿地重启只是清理状态,真正的质量重置必须同时重置资产权威、能力探针和淘汰纪律。