この映像の題材は意図的に自己言及的にした。映像自身が、どのように作られたかを説明する。 内容を単純にしたのは、背後の制作経路を検証するためだ。私はCodexに一つの依頼を渡し、その後の脚本、サービス実行、人物映像、画面包装、SNS向け縦型マスターまでを統括させた。
得られたのは「一文から完璧な作品」ではない。操作は一つの窓口へ集約されたが、演出判断はむしろ具体的な合格条件として表に出た。
最終的な役割分担
採用したワークフローには三つの層がある。
- Codex:企画と統括。 テーマを英語の台本にし、シーンを分け、字幕とグラフィックの位置を決め、外部サービスを呼び出し、キーフレームと完成映像を検品する。
- HeyGen:人物演技。 既存のVera Avatarを使い、英語音声、リップシンク、基礎的な動きを生成する。このサンプルではElevenLabsを使用していない。
- HyperFrames:画面包装。 遺跡背景、中国語字幕、工程カード、ガイド線、トランジション、9:16の最終画面を構成する。
最終判断は人間に残る。事実、話す間、顔への重なり、可読性、そして本当に公開できる品質かどうかは、自動検査だけでは決められない。
失敗1:Avatarはキャラクター設定画ではない
最初にHeyGenへ渡した画像は、正面、背面、胸像、全身、道具を一枚にまとめた設定画だった。人間にはVeraを詳しく説明する資料だが、Avatarシステムには「動かす一枚の平面画像」にすぎない。設定画全体が主体として扱われ、構図も口元の演技も成立しなかった。
解決策は情報を増やすのではなく、減らすことだった。正面で胸から上を写したクリーンなvera1へ交換すると、システムは「どの顔が話すのか」だけに集中できた。完全なキャラクターパックは挿絵、背景、別カットには有効だが、話すAvatarの直接入力には向かない。
失敗2:動くことと演出は別である
HeyGenは正面プレゼンターの生成に強いが、元画像の外側にある空間までは理解しない。背景、道具、大きなカメラワーク、人物の立ち位置をすべてAvatar生成に押し込むべきではない。安定した分担は、HeyGenが人物演技を作り、HyperFramesが環境と情報階層を担当することだ。歩行、物体との接触、本格的なカメラ移動は別の生成映像ショットとして作る必要がある。
このサンプルでは、Veraの画風に合う遺跡背景を置き、人物を常に中心に保った。変化は主にグラフィック、リズム、控えめな再構図で作り、存在しない三次元空間での演技を装わなかった。
文字組みの作り直し
最初の包装では縦型映像の典型的な問題が出た。長い英語ラベルが枠いっぱいに広がり、複数のカードが同時に競合し、ガイド線の方向が曖昧で、Veraの顔まで隠した。中国語字幕も重いカードの中に置かれ、主要情報と競合していた。
二回目はラベルを短くし、行数と横方向の安全域を決め、顔からグラフィックを離し、同時情報量を減らし、字幕の箱を外した。改善を生んだのは追加エフェクトではなく、階層と余白だった。
- 背景の瞬間発光:一つの切り替え付近に、ごく短い黄色のフラッシュが残る。編集プレビューでは安定して再現しなかったが、人間の視聴では知覚できた。
- 発話のつながり:Veraの長い段落間の停止が、段落内の自然な間より硬い。無音を直接切る試みは接続を悪化させたため、元の長さへ戻した。
なぜ二つの欠点を残したのか
修正を試みる層が違っていたからだ。フラッシュは編集画面だけで判断できず、次作では全シーン境界の前後を、デコード済み素材と最終エンコードの両方でフレーム単位に確認する。発話の間も完成後に乱暴に削るべきではない。短い意味段落、明示したポーズ、別テイク、試聴済みの接続を、脚本と音声生成の段階から設計する。
欠点を残したことで、このサンプルは完成能力の検証だけでなく、次作のより厳密な合格条件にもなった。
このテストで分かったこと
「窓口はCodexだけ」という形は成立する。ただしCodexは魔法のボタンではなく、全体プロデューサー兼実行ディレクターに近い。Avatar ID、声、字幕規則、安全域、APIの結果、不採用理由を保存し、次の依頼へ持ち越せる。自然さ、明瞭さ、公開する価値を判断するのは私だ。
自動化の持続的な価値は、人間の判断を消すことではない。各判断を、再利用できる制作ルールへ変えることにある。