Alias Archive档案更新中
档案更新中

接触是边界:228 条提示词与十次失败实验

统计五个已发布的 AI 视频工作流共 228 条提示词后发现,没有一条描述角色与角色之间的物理接触;随后的十次生成实验从反面印证了这条边界。

归档日期
归属板块
其他
语言版本
ZH / 阅读版本

生成式视频的能力边界很少被直接写出来。厂商文档描述能做什么,社区教程展示成功案例,而“哪一类镜头不要尝试”通常只能靠自己烧掉时间去撞。

本文记录一次撞的过程,以及撞之前本可以避免它的一项统计。

先做统计:五个已发布工作流里的 228 条提示词

目标是建立一套可靠的动作镜产线。开始之前,先拆解已经成功发布的作品,看别人怎么做。

样本是五个完整的公开工作流,其中最大的一个含 284 个节点、411 条连线。逐节点提取生成参数后得到 231 个视频节点、228 条提示词

统计出的第一件事与预期相符:

输入模式节点数
多模态参考(多张图作为身份/场景引导)188
纯文本生成43
单图作为严格首帧0

参考图数量中位数为 3,规律接近“同框主体数 + 关键道具数”:单主体氛围镜 1–2 张,四角色群戏 7–9 张。

第二件事不在预期内。对提示词做动作类词频统计:

类别命中占比
攻击动词(挥、砍、劈、砸、扑)4118%
双主体互动146%
接触、命中、撞上52%
格挡、招架21%

攻击被大量描述,接触几乎不被描述。而逐条检视那 5 条“接触”之后,占比还要归零:其中两条写的是“手掌在接触到对方身体时直接穿透而过”——这是刻意设定的非实体特效;另外三条是角色撞上数据洪流、掉落在地面——角色与环境的碰撞,不是角色与角色

228 条已发布作品的提示词里,没有一条描述角色与角色之间的物理接触。

这些都是成功发布的作品。它们不是做不好接触,而是系统性地绕开它

再做实验:十次生成的反面印证

目标镜头是一个双角色格斗段落:巨型岩石造物攻击、持剑者闪避、反击、格挡。这正好落在统计所指的空白区内。

十次生成逐项修复了七类问题,每一项都是可复现的因果关系:

  • 回合制观感 —— 起始帧若是静态对峙,输出必然是双方轮流动作。修法是让起始帧本身处于运动中。
  • 风格崩解 —— 提示词里写独立的风格描述段,在图生视频场景下会被当作新的合成目标,从而挤掉输入图的风格。正确写法是声明继承(“保留参考图的风格”),而不是复述风格本身。
  • 非人角色的解剖漂移 —— 拱形四足造物的一条前肢在几帧内被拉长成细长摆动肢。负面提示必须点名到具体角色的具体失败模式,通用词表无效。
  • 空间距离被参考图锁定 —— 参考图里两名角色相距较远时,模型复制该布局;文字写“相距四米”无效,因为模型不理解米。改用不含角色的空场景图,站位交由动作描述决定后解锁。
  • 动作因果 —— 把攻击目标写成“角色脚下的地面”以规避角色接触,结果模型真的去打了一块无关的地面。正确写法是攻击直取角色,闪避才是它落空的原因。
  • 静止等待 —— 12 秒的镜头只写了三个节拍,模型用静止填满剩余时间。激烈打斗中一个节拍约 2 至 2.5 秒,12 秒需要约五个节拍。
  • 多余收尾 —— 动作完成后角色面向镜头摆造型。需要显式禁止。
持剑者压低重心双手举剑上格,剑与岩石造物的巨臂接触点爆出星形火花
过程中出现过质量足够的单帧:接触点、体量对比与二维手绘质感同时成立。静态的接触画面并不困难。

七项修复都成立。唯独一项自始至终没有成立:攻击与闪避之间的因果可信度。

现象是稳定的:两个角色各自完成了正确的动作——攻击方挥出,闪避方翻滚——但攻击的运动轨迹从未真正收敛到闪避方的位置上。观感是“两个人各自做了一个动作”,而不是“一个人为了躲开另一个人的攻击而移动”。

同一镜头的密集抽帧:巨臂沿高空弧线扫向画面一侧,持剑者在画面另一侧完成翻滚,两条运动轨迹全程不相交
密集抽帧下的典型失败:两条运动轨迹全程不相交。稀疏抽帧会把这种情况误判为“动作正常”。

第十次生成之后项目终止。

两项方法论结论

目视评估在抽帧网格上系统性不可靠

生成视频的评估长期依赖抽帧。本次过程中,同一批输出被审片方连续纠正四次:判为“有动作”(实为无因果)、误标动作类型、判为“未出现某动作”(实际出现)、判为“风格保持”(实际已漂移)。

原因是可以描述的:因果关系不存在于任何单帧中,它存在于帧与帧之间。姿势可以抽帧看,因果不能。而当画面主体是不规则的、与背景同色系的复杂形体时,缩略图尺度下连姿势也难以分辨。

尝试过两种客观替代,均不成立:

  • 帧间差分的运动轨迹图 —— 雨、镜头运动等全局位移占满帧差信号,需要先做全局运动补偿。
  • 拉普拉斯响应的纹理指标 —— 可以度量高频纹理的分布,但对“金属光泽、渐变高光”这类低频特征完全不敏感,因而测不出被观察者明确指出的风格问题。

可行的做法是收窄自己的判断范围:由人判断动作、因果与风格;程序只报可测量项——时长、分辨率、码率、边框、色彩统计、违禁元素是否出现、参数是否正确落地。

已成文的结论不会自动被检索

复盘时统计出一个数字:本次工作中,有七次结论早已写在项目自己的文档里,却在需要时未被查阅,每一次都是撞完之后才想起来。其中包括一次已经通过的受控实验(内容与当次任务几乎完全对应)、一条两周前写下的风格判断、以及三条自己总结的动作镜铁律。

值得注意的是,另一条并行的工作线(由另一套工具驱动)表现出完全相同的模式:它拥有一个 84 篇的资料库,同样在需要时没有检索。

这说明问题不在文档的数量或质量。 增加文档不解决“不查”。可能有效的是把检索变成流程的第一个动作,而不是一条“应当记住的事”——例如在写任何提示词之前,先执行一次对既有实验记录与平台内置工序的检索。这一条尚未验证。

边界与限制

本文的统计限于五个特定工作流,其作者均为同一平台的中文创作者,题材集中在都市奇幻与科幻短剧。“没有人做角色接触”与“做不到角色接触”不是同一命题——统计只能支持前者。但它与三处独立的内部结论方向一致:宽景中刃部接触缺乏像素预算;接触镜在叙事上往往也不该拍;相邻工作线的镜头命名中同样出现了“接触前切”的字样。

绕开这条边界的标准手法是 impact cut:拍攻击的承接,切,拍结果,接触本身由 1 至 3 帧人工确认的静帧承担。本文所述实验因故未走到验证这一手法的阶段。

结论限于所用模型与本文写作时点。

关联阅读

02 / LINKS
C01

让分镜迁就图像:一支手绘质感先导片的关键帧与动化产线

记录一支 90 秒无对白动画先导片的产线建立过程:为什么把构图写进分镜是错的,以及油画质感在视频生成中损失了多少、损失在哪里。

阅读全文 ↗
C02

AI 动作导演失败记录:逐镜生成失效与 Flova 转向

以石头巨人战斗镜头为例,记录 Niji、Image2、Seedance、Dreamina、BytePlus 与 Kling 的动作测试,分析动作因果、空间连续性与三维距离为何使逐镜生成路线失效,并说明转向 Flova 项目级工作流评估的依据。

阅读全文 ↗