上一条视频测试的是一条相对可控的流水线:Vera 在 HeyGen 里说英语,HyperFrames 加中文字幕和图文包装。那条样片虽然有闪帧与停顿,至少证明了“从任务到成片”可以跑通。
第二个目标更难:做一段 16:9 的游戏动作动画。Phase 1 骑士在雨夜遗迹里与石头巨人完成最后交锋,Boss 被击败后骑士力竭,Vera 才提灯出现。它既要展示 Seedance 的复杂动作和摄影机能力,又要能在未来重新配音,接回游戏剧情。
这次没有成片。做了一整天之后,我决定停手。
不是因为没有一帧好看,而是因为一段动作成立,依赖的是帧与帧之间的空间和因果。这恰好是当前流程最费力、最不稳定的地方。
第一轮:三段都能播放,三段都不能通过
最初的方案是一条约 30 秒短片:
- 骑士闪过巨人的攻击,滚翻后斩向膝部;
- 地板在撞击中坍塌,骑士与镜头一起自由落体;
- 骑士击败巨人后倒下,Vera 提灯走来。
所有视频都生成成功,编码、帧率、音轨和亮度检查也都正常。第一段甚至保住了骑士、巨人和整体画风。正常速度一看,问题却很直接:骑士在拳头真正形成威胁之前就先滚开;靠近 Boss 以后又停了一拍,才想起来挥剑。
第二段更严重。地板没有先表现受力、裂纹传播、石板分离和失去支撑,骑士就突然掉了下去;“用剑插墙减速”变成在墙上左右乱砍;后半段石头巨人又出现在远景,而且没有可信的地面接触,像漂浮在那里。
这一步让我第一次把“技术通过”和“导演通过”完全分开。全文件可以解码、没有黄色闪帧、人物数量也大致正确,只能说明文件没坏;它不能判断角色为什么移动、什么时候接触、力量从哪里来。
先纠正故事,再纠正提示词
自由落体本来只是为了展示运镜,却顺手篡改了游戏剧情。游戏里的逻辑很简单:
骑士击败石头巨人 → 精疲力尽 → Vera 在战斗结束后出现。
没有地板坍塌、异空间、黑焰或临时发明的新能力。于是第二版把所有这些技术展示欲删掉,只保留同一个 Boss 房、同一个 180 度轴线和一条能接回游戏的动作链。
同时我拆解了一个《望月剑舞》的优秀样例。它和我们画风不同,但提示词有一条很清楚的导演逻辑:
蓄力 → 接触点 → 材料反应 → 恢复 / 下一动作起势
剑不是“挥一下”,而是在某个时刻命中明确位置;命中后物体才裂开。一个动作结束时的落脚、重心和剑位,又已经是下一动作的准备。摄影机也不是独立写几个“环绕、推进、低机位”,而是跟着刀线、重心和撞击移动。
这比罗列“先滚、再砍、再跪下”更接近真正的动作指导。
画面怎么终于稳定下来
动作还没开始,双主体关键帧就先卡住了。
把骑士和 Boss 两张图一起交给 Niji,模型不知道谁属于谁,于是头盔、披风、盔甲和巨剑一起污染到 Boss 身上,石头人变成了另一名巨大骑士。用 Editor 局部补骑士,人物和 Boss 又像来自两种画风,服装还擅自增加了背部金色符号和长袍。Character Reference 也不是严格的局部身份锁,仍会影响整张图。
最后确定的分工反而更简单:
- Niji 负责高质量单体。 角色、Boss、服装、材质、剪影和整体美术语言分别做干净。
- Image2 负责受控拼装。 把已批准单体放进同一场景,调整站位、比例、镜头和接缝,不重新发明设计。
Image2 自己也需要约束。它很容易生成均匀高频噪点、密集微裂纹、塑料高光与过度锐化;这些静态瑕疵一旦进入视频,会变成逐帧爬动的噪点。经过几轮修正后,文章开头的静态母版终于稳定:骑士在左、Boss 在右,同一地面、同一光向,画风也基本统一。
所以这次不是“图做不出来”。图已经够用了。真正失败的是如何给这张图可靠地加上时间。
第二轮:别提前闪避,结果变成原地等死
BytePlus 上的第一次五秒测试专门修“提前闪避”。提示词反复写骑士不能早动、必须等巨拳进入危险线。
模型非常听话地抓住了“不要动”,却没有理解战术上的持续调整。骑士几乎冻结在原地,直到攻击贴脸才开始反应;肩滚翻不可读;Boss 的拳臂还在前景膨胀成一块大石头,把接触点遮住。
下一次把提示词彻底反过来:骑士从第一帧主动逼近,佯动、切入、滚翻、起身斩击,摄影机也要加速、贴地、产生视差并跟随剑的力线。八秒提示词写得非常详细,结果画风没坏,张力仍然不够。
这里得到一个不太讨喜的结论:提示词写得更长,不等于模型更会导演。 当五到八秒里同时塞入脚步、诱敌、追踪、砸击、滚翻、起身、斩击、Boss 跪地、运镜和音效,模型往往会删掉最难的中间步骤。
Dreamina 与 Kling:一次复杂路线,一次匹配测试
为了测试更强的运动,我又设计了一条八秒路线:巨拳先完整落地,骑士沿巨人的落地手臂跑上去,在肩胸处完成一次斩击。
Dreamina 大体守住了路线,但骑士像机器人一样走路,攻击没有力量,文件虽然有音轨,用户也听不到清楚有效的动作音效。Kling 一开始曾给过更灵动的攀爬,这次打开自动多镜头后却出现更严重的问题:骑士爬着爬着突然到了一个无关山崖,随后又被切回 Boss 身上,重复攀爬、随便砍一刀再跳走。
为了公平比较,我把任务缩成一个真正闭合的五秒动作:
- Boss 抬拳;
- 拳头进入危险范围;
- 骑士最后一刻向右前滚翻;
- 巨拳砸中刚离开的地面;
- 骑士停在 Boss 内线,面向它;这一次不反击。
Dreamina 和 Kling 使用同一张开场图、同一分辨率和近似提示词。Dreamina 赢了这一轮:它的动作顺序更完整,骑士也更像是进入 Boss 内线。Kling 保住了场景,却显得迟钝,闪避更像一次低身冲刺,而不是清楚的滚翻。
说实话,Kling 这两次穿帮真给我整笑了:一次爬着爬着换了座山,一次把滚翻做成贴地冲刺。严肃复盘写到这里,也很难完全绷住。
最后一条续接,暴露了最根本的问题
我从 Dreamina R4 尾部抽了一张相对稳定的帧,要求模型继续五秒:
骑士从单膝支撑立即蹬地起身,一记左上斜斩命中石头巨人的近侧膝关节;剑刃接触后岩石才沿斩痕崩裂。
输出抽帧看起来很像成功:骑士站起、剑光命中、Boss 膝部发亮、岩石裂开,巨人把重量压低。自动 QA 也因此写下“因果连续”。
正常速度播放,问题却完全无法忽略:
骑士视觉上离 Boss 还有很远。他没有跨步、冲刺或接近,只是原地站起来,剑就直接砍到了。
这是本轮最有价值的失败。末帧续接可以保留颜色和大致构图,却不保证模型正确重建隐藏的三维空间。提示词写“立即命中”,模型也可能选择删除距离,而不是生成合理的接近动作。
它也再次证明:接触表适合看构图、身份和色彩,不适合给动作因果盖章。 最终验收必须先以正常速度看一遍,再慢放看接触、支撑、动量与恢复。
为什么不继续把它硬剪成片
因为这些不是剪辑问题。
- 提前闪避不能靠删几帧变成真实反应;
- 人物离得太远不能靠加剑光补上;
- 无因山崖、瞬移和位置重置不能靠转场隐藏;
- 一条音轨存在,不等于音效清楚且与撞击同步;
- 几个孤立好看的镜头拼在一起,不会自动变成连贯动作。
继续做下去,需要为每五秒重新建立关键帧、提示词、生成任务、抽帧、正常速度与慢放 QA,再把末帧当作下一段的空间起点。照这个速度,可能花一周才能磨出一小段勉强正常的动画。它已经不再验证“自动生产”,而是在用人工协调补模型的每一处不确定性。
所以这次没有进入 HyperFrames,也没有把失败镜头包装成一条“完成”的短片。
下一步为什么是 Flova
下一步准备评估 Flova,不是因为它已经解决了问题,而是因为它的工作单位更接近当前瓶颈:项目、故事板、素材、模型生成和最终交付由一条工作流管理,而且可以调用包括 Image2、Seedance 和 Kling 在内的多个模型。
真正要测试的不是“它能不能再出一段视频”,而是八件事:
- 能不能先给出符合游戏剧情的故事板,而不是自行增加坍塌和异空间;
- 能不能在镜头里区分主动者、响应者、接触点与真实距离;
- 能不能跨镜头保存角色、装备、Boss、地形和左右轴线;
- 能不能为静态拼装、单镜头动作和特殊镜头选择不同模型;
- 能不能理解 Niji 单体、Image2 母版和动作参考各自的职责;
- 能不能在花费下一次 credits 之前暴露可审的故事板与任务状态;
- 能不能生成真正可听、同步的环境与接触音效;
- 能不能保留实际模型、参数、费用和失败记录,而不是变成新的黑箱。
Flova CLI 和 API 已经接通,但目前还没有用它生成这段项目。它在文章里不是胜利者,而是下一个待验证的假设。
这次留下的真正结果
没有成片,但有几条已经可以成为以后默认规则:
- Niji 出高质量单体与画风,Image2 做受控多主体拼装;
- 进入视频阶段之前,身份、服装、装备和空间母版必须已经解决;
- 五秒只做一个因果闭环,不能因为时长短就塞入更多动作;
- 每次接触都要写清蓄力、危险线、接触点、材料反应和恢复;
- 摄影机跟随力量与重心,不是单独堆“电影感”词汇;
- 音轨存在和音效有效是两项不同的验收;
- 技术 QA、抽帧 QA 和导演 QA 必须分开;
- 人工正常速度观看拥有最终否决权;
- 当人工协调成本超过自动化收益时,停下来换工作流,而不是继续抽卡。
第一条 AI 主播视频证明了自动化可以跑通。第二条动作视频提醒我:流程能跑,不代表方向值得继续。
这一次,停手本身就是交付。