← 返回日志

AI 音乐视频制作:从静帧生成到剪辑发布

记录一套从歌曲定稿、静帧生产、动画生成、质量复审到调色发布的八阶段 AI 影像流程。

MV 素材总览
一支音乐视频的主要制作阶段与过程素材

传统手绘或实拍音乐视频通常需要较高的制作成本。过去一年,我将相关工作整理为一套半自动影像流程:创意、审美和关键判断由我负责,AI 承担静帧生成、动画生成与部分重复处理。本篇记录这套流程的完整结构,数据来自实际制作,规则则来自多轮返工与验证。

这并不是“一句话生成成片”的方法。AI 降低了绘制与渲染成本,同时提高了筛选和判断的密度:需要持续决定采用何种风格、哪些静帧值得动画化,以及镜头应如何对应音乐节点。工具发生变化,但取舍仍是制作的核心工作。

八阶段制作流程

一首歌曲转化为成品音乐视频,可拆分为八个阶段:

八站流水线

  1. 歌曲定稿(Suno 生成与筛选);
  2. 导演脚本(总则、镜头表与 A/B/C 动效分级);
  3. 静帧生产(niji → GPT,应用四项基础约束);
  4. 图像筛选(每个关键镜头从 2 至 3 个候选中定稿);
  5. 动画生成(Seedance,应用六项运动控制原则);
  6. 两轮复审(使用 filmstrip 联系表逐镜检查);
  7. 调色交付(依据锚点镜进行仿射匹配);
  8. 剪辑发布(剪映 → 抖音)。

图像筛选与两轮复审由我直接完成。自动流程可以检查尺寸与循环接缝,但视觉质量与叙事适配仍需人工判断;其余阶段则尽可能标准化和自动化。

提示词分层:图像负责视觉,视频负责运动

这套流程将提示词严格分为两个层级:

两层提示词纪律

  • 首帧图提示词只描述视觉结果:风格、光线、构图、胶片质感、hex 色板与人物锚点。所有风格词集中在这一层;
  • 视频提示词只描述运动:运动主体、运动方式与镜头运动。此层不重复风格词。

如果在图像提示词中加入运镜要求,模型可能将运动趋势固化进静帧;如果在视频提示词中重复大量风格词,则容易造成画风闪烁和人物面部漂移。将视觉与运动分层,可以减少两个模型阶段之间的职责冲突。

这套图像与视频分层方法,以及后文使用的官方动画语法和受控运镜词表,主要参考 Higgsfield 的公开方法论,再根据项目的暗黑视觉方向进行调整。公开方法构成基础,具体约束来自本项目的实际测试。

静帧生成:四项基础约束

基础约束 · 四项
  • 将画风标杆置于末位:参考图的最后一张固定为夜景或昼景的风格标准,确保模型优先对齐视觉基准;
  • 灰色基调约束:世界以灰色为主,暖色仅存在于灯焰半径内,用于控制全局泛黄;
  • 细笔触约束:减少数码噪点与过粗颗粒;
  • 面部质感约束:保留红润、细腻与油画式高光,避免生成结果出现过度平滑且缺乏质感的面部。
关键镜成品
关键镜头在三轮候选后定稿:灰色基调、面部质感与灯焰半径内的暖光
进阶约束 · 三项
  • hex 色板入词:将定稿的 12 至 15 个 hex 值直接写入提示词,使配色从描述性语言转化为明确约束;
  • 风格预设词典:使用“魂系油画·夜”“闪回”“烛光祭坛”等预设组合,再填写主体,避免在单个镜头中临时重写风格;
  • 固定风格声明:使用统一的 Style: painterly dark fantasy, oil-painting texture, Rembrandt single-source lighting, chiaroscuro. No game engine, no 3D render look. 声明。
人物处理原则
  • 人物面部与身体比例不通过后期拉伸或换脸修正。此类处理容易引入新的形变,因此不合格结果直接返回生成阶段重新取样。
关键镜联系表
关键镜头联系表:每个镜头保留 2 至 3 个候选并排比较

动画生成:六项控制原则

动画控制 · 六项
  1. 避免“呼吸”“忽明忽暗”等开放式动词,以免模型增加发光环或生物结构等未指定内容;
  2. 对需要静止的对象使用明确约束,例如“亮度完全恒定”“绝不变大”;
  3. 每个镜头只保留 1 至 2 个运动源,其余对象逐项指定为静止;
  4. 需要虚焦的对象应注明“从开始到结束保持虚焦”;
  5. 循环镜头使用同一张图作为首尾帧,并锁定相机;
  6. 火焰不作为主要运动源。主体位置的火焰容易在生成过程中持续放大,这项限制来自五次连续失败。
QC 抽帧 filmstrip
机器 QC 抽帧:逐帧检查中段新增元素与焦点漂移,并以 diff<6 自动判断循环接缝

实测中,使用宽松措辞时的一次通过率为 67%;改用明确限制后提高到 88%。涉及火焰的镜头改用雾、雪、发丝或灯芯亮度作为运动源,也可以保留静帧并在剪辑阶段加入镜头运动。

动画提示词使用官方结构化语法,而不使用散文式描述,以便准确对应音乐时间点:

Total: 10s / 2 shots / 16:9
Shot 1: 0–3s: she raises the lantern slowly...
        3–5s: fog drifts left, [VFX: embers rising]
Shot 2: @image is the first keyframe and style reference
        camera: slow dolly in, sharp focus throughout

需要特别控制两点。第一,使用时间戳规定节拍位置;第二,将负面表述改写为正向目标。例如,不写 no blur,而写 sharp focus throughout。公开示例和实际测试均显示,直接出现某个负面关键词仍可能触发相应内容。

运镜限定为 8 个语义核心:static / pan / tilt / dolly / tracking / crane / push-pull / orbit,再搭配 slow 等速度副词。每个镜头只设置一个主要运镜时,可用率为 79%;在单镜头中组合多个主要运镜时,可用率下降到 34%。

模型分工与任务配置

流程设计的重点,是根据模型能力分配任务,并用固定约束弥补各自的已知偏差。

图像轨

平台/模型 强项 短板 任务
niji 7 / Midjourney 审美上限高,人物设定与画风表现较强 精确控制与一致性较弱 人物设定、画风原点、封面
GPT image2 指令执行准确,可差分修改与批量生成 审美上限低于 niji,容易全局泛黄 场景静帧、人物差分、情感镜头
Seedream 支持大尺寸,成本较低 整体质感一般 大图基础与草稿
Seedance 1.5-pro 首尾帧图生视频和循环较稳定,成本较低 火焰容易放大,大幅动作中面部可能漂移 动画生成主力
即梦 Jimeng 火焰与特效控制较好 批量处理与一致性较弱 火焰镜头备选
Suno / Whisper 歌曲生成 / 逐句转写与时间码校准 音乐与时间轴支持

Seedance 另有 2.0 版本,在复杂运镜、打斗与特效方面具有更高质量上限,但成本和余额门槛也更高。当前主力仍使用 1.5-pro;只有关键表演镜头才考虑使用 2.0。两者共用同一套流程约束,因为成片质量不仅取决于模型,也取决于工作流与提示词。更换模型时,不需要更换整套制作结构。

实测成本

项目 数据
静帧 ¥0.5–0.7/张,全片约 70 张,合计约 ¥35–50
动画生成 ¥11.3(5s)/ ¥22.5(10s),42 条合计约 ¥475
一次通过率 宽松措辞 67% / 明确限制 88%
完整周期 写词 → 发行 → MV 发布,约 4 天/首

成本控制主要依靠动效分级。A 级完整动画只用于实际表演镜头,占比不超过 25%;B 级微动循环用于氛围主体;C 级保留静帧,并在剪辑阶段加入镜头运动。26 个镜头全部使用 A 级方案需要 ¥900 以上,分级后约为 ¥475。对于强调凝滞气质的歌曲,B/C 级的慢速微动既能控制成本,也符合整体视觉方向。

调色、剪辑与发布

  • 调色:选择全片底色最准确的镜头作为锚点,逐通道进行仿射匹配,混合系数设为 0.6。完全匹配会削弱暖色特写,因此保留部分原始色彩;
  • 剪辑:循环片段无缝重复;人物静帧不使用 3D 运镜,以避免 AI 视差扭曲面部,改用慢推与轻微旋转;入梦转场使用模糊闭幕与叠化;
  • 导出:分辨率和帧率与原素材保持一致,例如 24fps 素材不导出为 60fps;关闭一键超清与 AI 补帧,避免生成式后处理引入伪影;
  • 发布:手动选择同时包含人物面部与有效光源的封面帧,避免默认首帧为黑场而降低信息流中的识别度。
调色前后对比
调色前后对比:确认暖色主导镜头未被整体匹配削弱
封面帧示例
封面帧选择:同时保留人物面部与有效光源,避免使用默认黑场首帧

常见问题与对策

问题 现象 对策
视频提示词包含过多风格词 画风闪烁、面部漂移 风格仅写入首帧图提示词,视频提示词只描述运动
使用负面禁止式措辞 no blur 等词反而触发对应现象 将限制改写为正向目标
使用散文式动画提示词 镜头无法准确对应音乐节点 使用官方语法与时间戳
单镜头组合多个主要运镜 抖动并降低画质 每个镜头只保留一个主要运镜
仅用形容词描述配色 跨镜头色调漂移 将 hex 色板写入提示词
将火焰设为运动源 火焰持续放大 改用雾、雪或发丝作为运动源
后期修正人物面部 拉伸与换脸产生新形变 返回生成阶段重新取样
使用剪辑软件的 AI 后处理 面部与油画质感出现伪影 关闭相关功能,并保持素材原生帧率

结论

这套流程并未减少创作判断,而是重新分配了创作劳动:AI 承担生成与重复处理,人负责风格、镜头、节奏和最终选择。工具与模型会持续更新,但视觉标准、运动约束和审核方法可以作为稳定的制作层保留下来。

关联阅读

01 / LINKS
C01

Suno 角色主题曲制作:提示词结构与编曲约束

以角色设定为起点,记录 Style 提示词、人声、和声、动态与结构的具体约束方法。

阅读全文 ↗