FAQ · ブラックボックスではなく透明性

VocaVidに必要なもの。
そしてその費用。

以下の数値は、使用したRTX 4080環境において完了したローカルのVocaVidジョブから得られたものです。これらは現実的な目安であり、性能を保証するものではありません。モデル、解像度、VRAM、キュー、プロンプト、ComfyUIのバージョンは、各生成結果に影響を与えます。

~ 9 秒/セグメントあたりの画像プロンプト
~ 5 秒/セグメントあたりの画像生成
~ 1:22 セグメントあたりのクリップ
VocaVidプロジェクトの費用は?

VocaVid自体は、画像やクリップごとに課金する仕組みではありません。生成処理は、お使いのコンピュータ上で、インストール済みのモデルを使用して実行されます。したがって、実際のコストは、計算時間、電力代、および必要に応じて追加で使用するモデルのライセンス料やアクセス費用となります。

ミュージックビデオの制作にはどれくらい時間がかかりますか?

最大の要因はクリップと、使用される場合はアバターです。以下の平均値は、RTX 4080 を使用した本プロジェクトのローカルジョブデータベースに基づくものです:

ステップ1単位あたりの平均
画像プロンプト~9秒/セグメント
画像~ 5秒 / セグメント
動画プロンプト約6秒/セグメント
アバター画像~1分29秒/セグメント
クリップ~1分22秒/セグメント
シーンプラン約4分37秒/処理済みセグメント*
MP4レンダリング約2分33秒 / エクスポート
リール分析約45秒/1回分

* シーンプランの処理時間は、曲の長さ、バッチサイズ、テキスト量に大きく左右されるため、ばらつきが大きくなります。そのため、この値はあくまで大まかな計画の目安としてご利用ください。

開始前に必要なものは?

Python 3.11 以上、動作中の ComfyUI インスタンス、FFmpeg、および CUDA 対応 GPU が実用上の基本要件です。具体的なモデルやカスタムノードは、選択したワークフローによって異なります。ワークフローリファレンスには、現在同梱されている JSON ファイルが記載されています。

タイミングやセグメンテーションを手動で修正できますか?

はい。「Analyze + Split」実行後、テーブルモードで個々の小節、小節のグループ、およびインストゥルメンタル・パッセージの開始点と終了点を確認・調整できます。後のすべての処理はこれらのセグメントに基づいて行われるため、特に「Scene Plan」やレンダリングを行う前にこの作業を行うことをお勧めします。

Kdenliveは他に何に必要ですか?

VocaVidは編集可能なKdenliveプロジェクトを作成し、必要に応じて直接MP4をレンダリングします。Kdenliveは、最終的な微調整、タイトル、独自のトランジション、または色補正を行うためのツールとして引き続き活用できます。

リールは自動的に作成されますか?

最終的なMP4ファイルが完成した後、VocaVidは音楽的に興味深い部分を分析し、プレビューを生成して、ユーザーが選択した箇所を縦方向の動画としてエクスポートします。選択はユーザーが行いますが、検索や技術的なエクスポート作業はツールが代行します。