ステップバイステップガイド
最初のアップ
ロードから完成した動画まで。
このガイドでは、VocaVidの全工程を順を追って解説します。順序は実用性を重視して構成されています。まず構造とタイミング、次にルックと動き、そして編集とリールです。
最初のプロジェクトを始める前に
VocaVidは、Python 3.11以降がインストールされたローカル環境で動作します。さらに、起動中のComfyUIインスタンス、適切なワークフローファイル、および ffmpeg が必要です。Whisperおよび生成処理には、CUDA対応のGPUの使用が推奨されます。
ヒント:まずComfyUIを起動し、ワークフロー内で必要なモデルやカスタムノードが利用可能かどうかを確認してください。その後、VocaVidを python -m VocaVid serve 起動し、 http://127.0.0.1:8000 を開いてください。
1. 新しいプロジェクトを作成する
- 「New Project」を開くダッシュボードで新しいミュージックビデオプロジェクトを作成します。
- プロジェクトに名前を付ける明確なタイトルを付けると、後でKdenliveファイル、MP4、Reelエクスポートファイルを見つけやすくなります。
- 基本フォーマットを設定する:希望する最終フォーマットに合わせて、解像度、FPS、トランジションハンドルを選択します。
2. 設定値と素材の読み込み
- WAVファイルと歌詞をアップロードします。WAVファイルは時間軸の基準となります。歌詞は、SUNO形式で、
[Verse],[Chorus]または[Bridge]などのセクションマーカーを追加して、SUNOスタイルで記述してください。 - スタイルを定義するジャンル、映像言語、雰囲気、繰り返し登場するモチーフを記述します。これが、シーンプランやプロンプトのための創造的な指針となります。
- リファレンスを設定する キャラクターや繰り返し登場するビジュアルが重要な場合は、適切なリファレンス画像を追加します。アバターのデフォルト設定はグローバルに準備し、プロジェクトごとに調整可能です。
- セグメントサイズを選択する:ヴァースとリフレインについて、1つのシーンに何行の歌詞をまとめるかを個別に設定します。
3. 自動セグメント分割 — 必要に応じて修正
- 「Analyze + Split」を開始する:VocaVidはWhisperを使用して歌詞を楽曲に合わせ、そこから最初のレンダリングセグメントを構築します。
- タイミングの確認:転写精度が低い行を重点的に確認します。Whisperの同期が不十分な場合、VocaVidは追跡可能な代替タイミングを使用します。
- 手動で調整する:拡張テーブルモードで、行の開始時刻と終了時刻を修正したり、行のグループ分けを変更したり、セグメントを調整したりします。
- 意図的にインストゥルメンタルを配置する:イントロ、ブレイク、またはトランジション用に、手動タイミングエディタでインターリュードを作成します。これらのパッセージは、レンダリング可能な独立したシーンとなります。
まずタイミングとセグメンテーションを正確に整えてください。その後のすべてのシーン、クリップ、そして最終的な編集は、これに基づいて行われます。
4. シーンプランとプロンプト
- シーンプランの作成「シーンプラン」を作成することで、曲全体を通じた一貫したストーリーラインが生まれます。長めの曲の場合、VocaVidがバッチ間の文脈を引き継ぎます。
- プランの編集:画像を生成する前に、繰り返し登場する場所、人物、色、象徴的なモチーフを明確に定義します。
- 画像プロンプトの生成:選択したセグメントに対して画像プロンプトを生成します。必要に応じて、個々のプロンプトを手動で微調整しても構いませんし、むしろそうすべきです。
- モーションプロンプトの生成:その後、画像から動画へのプロンプトを生成します。カメラの動き、テンポ、アクション、そしてシーンに求めるエネルギーなどを指定します。
5. 画像、アバター、クリップ
- 画像の生成:選択したストーリーボードカードのベース画像を生成し、プレビューで比較します。
- アバターは重要な場面でのみ生成する。典型的な例としては、リフレイン、フック、または繰り返し登場する場面が挙げられる。アバターのバリエーションを使用することで、複数のシーンにわたって同じキャラクターの一貫性を保つことができる。
- 画像ソースの選択:セグメントごとに、クリップを基本画像から生成するか、アバターバリエーションから生成するかを決定します。
- クリップの生成:選択したシーンを動画としてレンダリングします。この際、グローバルなレンダリングキューは表示されたままになります。
- 確認と保護:良質な動画には
OKマークを付けます。保護されたクリップは、後のバッチ処理で上書きされません。問題のある箇所をピンポイントで再生成します。
6. 仕上げ、Kdenlive、MP4
- ストーリーボードを完全に確認する順序、メディアソース、タイミング、および「OK」ステータスを最後に一度確認します。
- 「Assemble Final」を実行します。VocaVidは、承認されたクリップから、ビデオトラック、オーディオトラック、およびトランジションを含む編集可能なKdenliveプロジェクトを作成します。
- Kdenliveプロジェクトを開く。最終的な微調整、独自のタイトル作成、色補正、または手動でのトランジションを行うために、
.kdenliveファイルが利用可能です。 - MP4をレンダリングします。「Render MP4」で最終的なエクスポートを作成します。すでにMP4ファイルが存在する場合、VocaVidはプレビューを開きます。
7. 完成した動画からリールを作成
- 「Make Reels」を開く MP4のエクスポート後、Reelsのワークフローに切り替えます。
- 分析を開始するWhisperアライメントおよびビート/エネルギー分析により、縦方向で音楽的に興味深いシーンが提案されます。
- 候補を確認:最適な箇所をプレビューとしてレンダリングし、画角や選択した瞬間を評価します。
- 最終的なReelsをエクスポート承認された候補を縦型動画としてエクスポートします。Shorts、Reels、またはTikTokへの投稿準備が整います。