生成式视频的能力边界很少被直接写出来。厂商文档描述能做什么,社区教程展示成功案例,而“哪一类镜头不要尝试”通常只能靠自己烧掉时间去撞。
本文记录一次撞的过程,以及撞之前本可以避免它的一项统计。
先做统计:五个已发布工作流里的 228 条提示词
目标是建立一套可靠的动作镜产线。开始之前,先拆解已经成功发布的作品,看别人怎么做。
样本是五个完整的公开工作流,其中最大的一个含 284 个节点、411 条连线。逐节点提取生成参数后得到 231 个视频节点、228 条提示词。
统计出的第一件事与预期相符:
| 输入模式 | 节点数 |
|---|---|
| 多模态参考(多张图作为身份/场景引导) | 188 |
| 纯文本生成 | 43 |
| 单图作为严格首帧 | 0 |
参考图数量中位数为 3,规律接近“同框主体数 + 关键道具数”:单主体氛围镜 1–2 张,四角色群戏 7–9 张。
第二件事不在预期内。对提示词做动作类词频统计:
| 类别 | 命中 | 占比 |
|---|---|---|
| 攻击动词(挥、砍、劈、砸、扑) | 41 | 18% |
| 双主体互动 | 14 | 6% |
| 接触、命中、撞上 | 5 | 2% |
| 格挡、招架 | 2 | 1% |
攻击被大量描述,接触几乎不被描述。而逐条检视那 5 条“接触”之后,占比还要归零:其中两条写的是“手掌在接触到对方身体时直接穿透而过”——这是刻意设定的非实体特效;另外三条是角色撞上数据洪流、掉落在地面——角色与环境的碰撞,不是角色与角色。
228 条已发布作品的提示词里,没有一条描述角色与角色之间的物理接触。
这些都是成功发布的作品。它们不是做不好接触,而是系统性地绕开它。
再做实验:十次生成的反面印证
目标镜头是一个双角色格斗段落:巨型岩石造物攻击、持剑者闪避、反击、格挡。这正好落在统计所指的空白区内。
十次生成逐项修复了七类问题,每一项都是可复现的因果关系:
- 回合制观感 —— 起始帧若是静态对峙,输出必然是双方轮流动作。修法是让起始帧本身处于运动中。
- 风格崩解 —— 提示词里写独立的风格描述段,在图生视频场景下会被当作新的合成目标,从而挤掉输入图的风格。正确写法是声明继承(“保留参考图的风格”),而不是复述风格本身。
- 非人角色的解剖漂移 —— 拱形四足造物的一条前肢在几帧内被拉长成细长摆动肢。负面提示必须点名到具体角色的具体失败模式,通用词表无效。
- 空间距离被参考图锁定 —— 参考图里两名角色相距较远时,模型复制该布局;文字写“相距四米”无效,因为模型不理解米。改用不含角色的空场景图,站位交由动作描述决定后解锁。
- 动作因果 —— 把攻击目标写成“角色脚下的地面”以规避角色接触,结果模型真的去打了一块无关的地面。正确写法是攻击直取角色,闪避才是它落空的原因。
- 静止等待 —— 12 秒的镜头只写了三个节拍,模型用静止填满剩余时间。激烈打斗中一个节拍约 2 至 2.5 秒,12 秒需要约五个节拍。
- 多余收尾 —— 动作完成后角色面向镜头摆造型。需要显式禁止。
七项修复都成立。唯独一项自始至终没有成立:攻击与闪避之间的因果可信度。
现象是稳定的:两个角色各自完成了正确的动作——攻击方挥出,闪避方翻滚——但攻击的运动轨迹从未真正收敛到闪避方的位置上。观感是“两个人各自做了一个动作”,而不是“一个人为了躲开另一个人的攻击而移动”。
第十次生成之后项目终止。
两项方法论结论
目视评估在抽帧网格上系统性不可靠
生成视频的评估长期依赖抽帧。本次过程中,同一批输出被审片方连续纠正四次:判为“有动作”(实为无因果)、误标动作类型、判为“未出现某动作”(实际出现)、判为“风格保持”(实际已漂移)。
原因是可以描述的:因果关系不存在于任何单帧中,它存在于帧与帧之间。姿势可以抽帧看,因果不能。而当画面主体是不规则的、与背景同色系的复杂形体时,缩略图尺度下连姿势也难以分辨。
尝试过两种客观替代,均不成立:
- 帧间差分的运动轨迹图 —— 雨、镜头运动等全局位移占满帧差信号,需要先做全局运动补偿。
- 拉普拉斯响应的纹理指标 —— 可以度量高频纹理的分布,但对“金属光泽、渐变高光”这类低频特征完全不敏感,因而测不出被观察者明确指出的风格问题。
可行的做法是收窄自己的判断范围:由人判断动作、因果与风格;程序只报可测量项——时长、分辨率、码率、边框、色彩统计、违禁元素是否出现、参数是否正确落地。
已成文的结论不会自动被检索
复盘时统计出一个数字:本次工作中,有七次结论早已写在项目自己的文档里,却在需要时未被查阅,每一次都是撞完之后才想起来。其中包括一次已经通过的受控实验(内容与当次任务几乎完全对应)、一条两周前写下的风格判断、以及三条自己总结的动作镜铁律。
值得注意的是,另一条并行的工作线(由另一套工具驱动)表现出完全相同的模式:它拥有一个 84 篇的资料库,同样在需要时没有检索。
这说明问题不在文档的数量或质量。 增加文档不解决“不查”。可能有效的是把检索变成流程的第一个动作,而不是一条“应当记住的事”——例如在写任何提示词之前,先执行一次对既有实验记录与平台内置工序的检索。这一条尚未验证。
边界与限制
本文的统计限于五个特定工作流,其作者均为同一平台的中文创作者,题材集中在都市奇幻与科幻短剧。“没有人做角色接触”与“做不到角色接触”不是同一命题——统计只能支持前者。但它与三处独立的内部结论方向一致:宽景中刃部接触缺乏像素预算;接触镜在叙事上往往也不该拍;相邻工作线的镜头命名中同样出现了“接触前切”的字样。
绕开这条边界的标准手法是 impact cut:拍攻击的承接,切,拍结果,接触本身由 1 至 3 帧人工确认的静帧承担。本文所述实验因故未走到验证这一手法的阶段。
结论限于所用模型与本文写作时点。