Alias Archive档案更新中
档案更新中

AI 动作导演失败记录:逐镜生成失效与 Flova 转向

以石头巨人战斗镜头为例,记录 Niji、Image2、Seedance、Dreamina、BytePlus 与 Kling 的动作测试,分析动作因果、空间连续性与三维距离为何使逐镜生成路线失效,并说明转向 Flova 项目级工作流评估的依据。

归档日期
归属板块
其他
语言版本
ZH / 阅读版本
雨夜遗迹中,Phase 1 骑士面对巨大的石头人
这张静态母版通过了:角色、Boss、画风、尺度与舞台都清楚。问题从它开始运动之后才真正出现。

上一条视频测试的是一条相对可控的流水线:Vera 在 HeyGen 里说英语,HyperFrames 加中文字幕和图文包装。那条样片虽然有闪帧与停顿,至少证明了“从任务到成片”可以跑通。

第二个目标更难:做一段 16:9 的游戏动作动画。Phase 1 骑士在雨夜遗迹里与石头巨人完成最后交锋,Boss 被击败后骑士力竭,Vera 才提灯出现。它既要展示 Seedance 的复杂动作和摄影机能力,又要能在未来重新配音,接回游戏剧情。

这次没有成片。做了一整天之后,我决定停手。

不是因为没有一帧好看,而是因为一段动作成立,依赖的是帧与帧之间的空间和因果。这恰好是当前流程最费力、最不稳定的地方。

第一轮:三段都能播放,三段都不能通过

最初的方案是一条约 30 秒短片:

  1. 骑士闪过巨人的攻击,滚翻后斩向膝部;
  2. 地板在撞击中坍塌,骑士与镜头一起自由落体;
  3. 骑士击败巨人后倒下,Vera 提灯走来。

所有视频都生成成功,编码、帧率、音轨和亮度检查也都正常。第一段甚至保住了骑士、巨人和整体画风。正常速度一看,问题却很直接:骑士在拳头真正形成威胁之前就先滚开;靠近 Boss 以后又停了一拍,才想起来挥剑。

第一轮骑士闪避巨人攻击的抽帧联系表
抽帧能看到构图与身份,却很难看到“闪得太早”和攻击前的短暂停顿。

第二段更严重。地板没有先表现受力、裂纹传播、石板分离和失去支撑,骑士就突然掉了下去;“用剑插墙减速”变成在墙上左右乱砍;后半段石头巨人又出现在远景,而且没有可信的地面接触,像漂浮在那里。

地板坍塌与自由落体失败镜头的抽帧
单看某几帧仍有电影感,连续播放却没有可信的支撑、重力和空间。

这一步让我第一次把“技术通过”和“导演通过”完全分开。全文件可以解码、没有黄色闪帧、人物数量也大致正确,只能说明文件没坏;它不能判断角色为什么移动、什么时候接触、力量从哪里来。

先纠正故事,再纠正提示词

自由落体本来只是为了展示运镜,却顺手篡改了游戏剧情。游戏里的逻辑很简单:

骑士击败石头巨人 → 精疲力尽 → Vera 在战斗结束后出现。

没有地板坍塌、异空间、黑焰或临时发明的新能力。于是第二版把所有这些技术展示欲删掉,只保留同一个 Boss 房、同一个 180 度轴线和一条能接回游戏的动作链。

同时我拆解了一个《望月剑舞》的优秀样例。它和我们画风不同,但提示词有一条很清楚的导演逻辑:

蓄力 → 接触点 → 材料反应 → 恢复 / 下一动作起势

剑不是“挥一下”,而是在某个时刻命中明确位置;命中后物体才裂开。一个动作结束时的落脚、重心和剑位,又已经是下一动作的准备。摄影机也不是独立写几个“环绕、推进、低机位”,而是跟着刀线、重心和撞击移动。

这比罗列“先滚、再砍、再跪下”更接近真正的动作指导。

画面怎么终于稳定下来

动作还没开始,双主体关键帧就先卡住了。

把骑士和 Boss 两张图一起交给 Niji,模型不知道谁属于谁,于是头盔、披风、盔甲和巨剑一起污染到 Boss 身上,石头人变成了另一名巨大骑士。用 Editor 局部补骑士,人物和 Boss 又像来自两种画风,服装还擅自增加了背部金色符号和长袍。Character Reference 也不是严格的局部身份锁,仍会影响整张图。

最后确定的分工反而更简单:

  • Niji 负责高质量单体。 角色、Boss、服装、材质、剪影和整体美术语言分别做干净。
  • Image2 负责受控拼装。 把已批准单体放进同一场景,调整站位、比例、镜头和接缝,不重新发明设计。

Image2 自己也需要约束。它很容易生成均匀高频噪点、密集微裂纹、塑料高光与过度锐化;这些静态瑕疵一旦进入视频,会变成逐帧爬动的噪点。经过几轮修正后,文章开头的静态母版终于稳定:骑士在左、Boss 在右,同一地面、同一光向,画风也基本统一。

所以这次不是“图做不出来”。图已经够用了。真正失败的是如何给这张图可靠地加上时间。

第二轮:别提前闪避,结果变成原地等死

BytePlus 上的第一次五秒测试专门修“提前闪避”。提示词反复写骑士不能早动、必须等巨拳进入危险线。

模型非常听话地抓住了“不要动”,却没有理解战术上的持续调整。骑士几乎冻结在原地,直到攻击贴脸才开始反应;肩滚翻不可读;Boss 的拳臂还在前景膨胀成一块大石头,把接触点遮住。

骑士长时间保持原位,巨拳在前景变成巨大石块
纠正“太早”不能靠冻结角色。防守时机应该来自持续脚步、威胁追踪和临门变向。

下一次把提示词彻底反过来:骑士从第一帧主动逼近,佯动、切入、滚翻、起身斩击,摄影机也要加速、贴地、产生视差并跟随剑的力线。八秒提示词写得非常详细,结果画风没坏,张力仍然不够。

这里得到一个不太讨喜的结论:提示词写得更长,不等于模型更会导演。 当五到八秒里同时塞入脚步、诱敌、追踪、砸击、滚翻、起身、斩击、Boss 跪地、运镜和音效,模型往往会删掉最难的中间步骤。

Dreamina 与 Kling:一次复杂路线,一次匹配测试

为了测试更强的运动,我又设计了一条八秒路线:巨拳先完整落地,骑士沿巨人的落地手臂跑上去,在肩胸处完成一次斩击。

Dreamina 大体守住了路线,但骑士像机器人一样走路,攻击没有力量,文件虽然有音轨,用户也听不到清楚有效的动作音效。Kling 一开始曾给过更灵动的攀爬,这次打开自动多镜头后却出现更严重的问题:骑士爬着爬着突然到了一个无关山崖,随后又被切回 Boss 身上,重复攀爬、随便砍一刀再跳走。

Kling 多镜头中骑士从 Boss 突然切换到陌生山崖,再回到 Boss
多镜头带来瞬间张力,也把同一动作拆成互不相干的景点。每个镜头都像独立奇观,空间却不连续。

为了公平比较,我把任务缩成一个真正闭合的五秒动作:

  1. Boss 抬拳;
  2. 拳头进入危险范围;
  3. 骑士最后一刻向右前滚翻;
  4. 巨拳砸中刚离开的地面;
  5. 骑士停在 Boss 内线,面向它;这一次不反击。

Dreamina 和 Kling 使用同一张开场图、同一分辨率和近似提示词。Dreamina 赢了这一轮:它的动作顺序更完整,骑士也更像是进入 Boss 内线。Kling 保住了场景,却显得迟钝,闪避更像一次低身冲刺,而不是清楚的滚翻。

Dreamina R4 · 本轮相对最佳的五秒候选,不是最终成片。巨拳接触几何仍被前景岩体部分遮挡。
Dreamina 五秒闪避测试的高频抽帧
缩成一个动作闭环后,因果明显改善;但“相对最好”仍不等于通过完整动作链。
Kling R4 · 同任务对照。场景连续,但人物动作迟钝,闪避技术不清楚。

说实话,Kling 这两次穿帮真给我整笑了:一次爬着爬着换了座山,一次把滚翻做成贴地冲刺。严肃复盘写到这里,也很难完全绷住。

最后一条续接,暴露了最根本的问题

我从 Dreamina R4 尾部抽了一张相对稳定的帧,要求模型继续五秒:

骑士从单膝支撑立即蹬地起身,一记左上斜斩命中石头巨人的近侧膝关节;剑刃接触后岩石才沿斩痕崩裂。

输出抽帧看起来很像成功:骑士站起、剑光命中、Boss 膝部发亮、岩石裂开,巨人把重量压低。自动 QA 也因此写下“因果连续”。

正常速度播放,问题却完全无法忽略:

骑士视觉上离 Boss 还有很远。他没有跨步、冲刺或接近,只是原地站起来,剑就直接砍到了。

Dreamina R5 · 明确失败。请注意起始距离与剑刃实际可达范围。
骑士斩击石头人膝部的抽帧联系表
联系表把“起身、剑光、破裂、下沉”都采到了,却隐藏了人物根本没有走完那段距离。

这是本轮最有价值的失败。末帧续接可以保留颜色和大致构图,却不保证模型正确重建隐藏的三维空间。提示词写“立即命中”,模型也可能选择删除距离,而不是生成合理的接近动作。

它也再次证明:接触表适合看构图、身份和色彩,不适合给动作因果盖章。 最终验收必须先以正常速度看一遍,再慢放看接触、支撑、动量与恢复。

为什么不继续把它硬剪成片

因为这些不是剪辑问题。

  • 提前闪避不能靠删几帧变成真实反应;
  • 人物离得太远不能靠加剑光补上;
  • 无因山崖、瞬移和位置重置不能靠转场隐藏;
  • 一条音轨存在,不等于音效清楚且与撞击同步;
  • 几个孤立好看的镜头拼在一起,不会自动变成连贯动作。

继续做下去,需要为每五秒重新建立关键帧、提示词、生成任务、抽帧、正常速度与慢放 QA,再把末帧当作下一段的空间起点。照这个速度,可能花一周才能磨出一小段勉强正常的动画。它已经不再验证“自动生产”,而是在用人工协调补模型的每一处不确定性。

所以这次没有进入 HyperFrames,也没有把失败镜头包装成一条“完成”的短片。

下一步为什么是 Flova

下一步准备评估 Flova,不是因为它已经解决了问题,而是因为它的工作单位更接近当前瓶颈:项目、故事板、素材、模型生成和最终交付由一条工作流管理,而且可以调用包括 Image2、Seedance 和 Kling 在内的多个模型。

真正要测试的不是“它能不能再出一段视频”,而是八件事:

  1. 能不能先给出符合游戏剧情的故事板,而不是自行增加坍塌和异空间;
  2. 能不能在镜头里区分主动者、响应者、接触点与真实距离;
  3. 能不能跨镜头保存角色、装备、Boss、地形和左右轴线;
  4. 能不能为静态拼装、单镜头动作和特殊镜头选择不同模型;
  5. 能不能理解 Niji 单体、Image2 母版和动作参考各自的职责;
  6. 能不能在花费下一次 credits 之前暴露可审的故事板与任务状态;
  7. 能不能生成真正可听、同步的环境与接触音效;
  8. 能不能保留实际模型、参数、费用和失败记录,而不是变成新的黑箱。

Flova CLI 和 API 已经接通,但目前还没有用它生成这段项目。它在文章里不是胜利者,而是下一个待验证的假设。

这次留下的真正结果

没有成片,但有几条已经可以成为以后默认规则:

  • Niji 出高质量单体与画风,Image2 做受控多主体拼装;
  • 进入视频阶段之前,身份、服装、装备和空间母版必须已经解决;
  • 五秒只做一个因果闭环,不能因为时长短就塞入更多动作;
  • 每次接触都要写清蓄力、危险线、接触点、材料反应和恢复;
  • 摄影机跟随力量与重心,不是单独堆“电影感”词汇;
  • 音轨存在和音效有效是两项不同的验收;
  • 技术 QA、抽帧 QA 和导演 QA 必须分开;
  • 人工正常速度观看拥有最终否决权;
  • 当人工协调成本超过自动化收益时,停下来换工作流,而不是继续抽卡。

第一条 AI 主播视频证明了自动化可以跑通。第二条动作视频提醒我:流程能跑,不代表方向值得继续。

这一次,停手本身就是交付。

关联阅读

04 / LINKS
C01

AI 主播工作流:Codex、HeyGen 与 HyperFrames 的协作记录

从一句任务到英文虚拟主播、中文字幕与社交媒体成片:记录第一次完整跑通时的选择、返工和两个仍未解决的问题。

阅读全文 ↗
C02

《守夜人》开场 CG:无对白叙事与制作流程

记录《守夜人》59 秒无对白开场 CG 从概念关键帧、分段图生视频、剪辑转码到 Godot 接入的流程,以及颗粒沸腾与高清 CG、像素游戏衔接的问题。

阅读全文 ↗
C03

AI 音乐视频制作:从静帧生成到剪辑发布

记录一套从歌曲定稿、静帧生产、动画生成、质量复审到调色发布的八阶段 AI 影像流程。

阅读全文 ↗
C04

用 AI 做一个不违和的像素 Boss:石巨人踩坑全记录

通用生图做不了进像素游戏的怪——从'高清违和'翻车,到用 PixelLab 造出一头会砸、会咆哮、会碎裂的黑岩巨人,一路踩过的坑与修法。

阅读全文 ↗