这条视频的题目刻意选择了一个自指命题:让视频解释自己是怎样被生产出来的。 它没有宏大的内容目标,重点是验证一条更基础的链路——我只向 Codex 布置任务,脚本、接口调用、人物视频与后期包装由它继续组织,最终交付可以直接发布的竖屏视频。
结果不是“输入一句话就自动得到完美成片”。真正跑通后,最明显的变化是:工具操作被集中起来了,但导演判断没有消失,反而变成了一系列更明确的验收条件。
最终工作流
这一版确定了三个清晰的责任层:
- Codex:全局策划与调度。 把主题写成英文口播,拆解场景,规定字幕与信息图位置,调用外部服务,并对关键帧和成片做复审。
- HeyGen:人物表演。 使用我已经建立的 Vera Avatar,生成英文语音、口型同步和基础人物动作。ElevenLabs 没有参与这条样片。
- HyperFrames:画面包装。 组合遗迹背景、中文字幕、流程卡、引导线、转场和 9:16 社交媒体输出。
人工仍然拥有最后一票:事实是否准确、节奏是否自然、图文是否遮挡人物、画面是否真的值得发布,都不能只靠自动检查决定。
第一个坑:Avatar 不是角色设定板
最初放进 HeyGen 的图片是一张完整人物设定板:正面、背面、半身、全身和道具全部在同一张图上。对于人类来说,它完整描述了角色;对 Avatar 系统来说,它却只是一张需要“动起来”的平面图片。结果是整张设定板被当成表演主体,构图和口型自然无法成立。
解决方法不是补充更多角度,而是反过来减少信息:换成一张干净、正面、胸像范围的 vera1。这让系统只需回答一个问题——哪张脸需要说话。完整角色包仍然有价值,但它更适合生成插图、场景图与其他镜头,而不是作为说话 Avatar 的直接输入。
第二个坑:能动起来,不等于会导演
HeyGen 很适合生成正面主播式表演,但它不会凭空理解镜头之外的空间。背景、道具、复杂运镜和角色走位不应该全部压进 Avatar 生成阶段。当前更稳定的分工是:让 HeyGen 交付人物表演,让 HyperFrames 负责环境与图文层级;真正的行走、物件互动或大幅摄影机运动则应成为单独的生成视频镜头。
这条样片选择了与 Vera 画风一致的遗迹背景,并把她始终留在中心。视觉变化主要来自信息图、节奏与轻微重构图,而不是让角色在不存在的三维场景中表演。
排版返工:从“信息很多”到“信息有序”
第一版后期包装暴露了典型的竖屏问题:一段长英文铺满容器,多个卡片同时出现,指引线方向不清,还遮住了人物的脸。中文字幕也被放进厚重的卡片框,视觉上和主信息竞争。
第二轮做了几件简单但重要的事:缩短标签;限制行数;建立横向安全边距;把卡片移出面部区域;降低同时出现的信息数量;取消中文字幕外框,让字幕变成独立的底部阅读轨。效果的改善并不依赖更多特效,而来自更严格的层级和留白。
- 背景闪帧:某个转场附近仍能看到极短的黄色闪烁。它在编辑预览中不稳定复现,但在人工观看时仍然可感知。
- 语言过渡:Vera 在长段落之间的停顿比段落内部的自然停顿更僵硬。一次直接硬剪静音的尝试让衔接更差,因此最终恢复原始时长。
为什么没有继续修这两个问题
因为它们已经指出了修复层级选错的风险。黄色闪帧不能只靠“编辑器里看起来没了”判断,下一条必须在源视频和最终编码中对每个场景边界前后逐帧检查。语言停顿也不该等到成片后再粗暴删除;更好的做法是在脚本里写出较短的语义段落,在语音生成时控制停顿,必要时生成独立 take,再用可审听的过渡连接。
这也是保留本次缺陷的意义:样片完成了能力验证,同时为下一条建立了更具体的制作门槛。
这次验证了什么
“我的接口只有 Codex”是可行的,但它更像一位全局制片与执行导演,而不是一个魔法按钮。它可以保存人物 ID、声音选择、字幕规范、画面安全区、接口结果和返工原因,并把这些经验写回下一次任务;而我负责决定什么叫自然、清楚和好看。
自动化真正值得保留的部分,不是取消人类判断,而是让每一次判断都能成为下一条作品的默认规则。