GUIDE ÉTAPE PAR ÉTAPE

Du premier téléchargement
au film final.

Ce guide vous accompagne tout au long d’un cycle complet de VocaVid. L’ordre des étapes a été délibérément choisi pour des raisons pratiques : d’abord la structure et le timing, puis le style visuel et les mouvements, et enfin le montage et les reels.

Avant de commencer votre premier projet

VocaVid fonctionne en local sous Python 3.11 ou une version plus récente. Une instance ComfyUI en cours d’exécution, des fichiers de workflow adaptés et ffmpeg . Pour Whisper et la génération, il est recommandé d’utiliser un GPU compatible CUDA.

Astuce : lancez d’abord ComfyUI et vérifiez que les modèles et nœuds personnalisés requis sont disponibles dans les workflows. Lancez ensuite VocaVid python -m VocaVid serve et ouvrez-le sous http://127.0.0.1:8000 .

1. Créer un nouveau projet

  1. Ouvrir « New Project » : créer un nouveau projet de clip musical sur le tableau de bord.
  2. Nommer le projet : un titre clair vous aidera plus tard à retrouver les fichiers Kdenlive, les exportations MP4 et Reel.
  3. Définir le format de base : sélectionnez la résolution, le nombre d’images par seconde (FPS) et les poignées de transition en fonction du format final souhaité.

2. Remplir les paramètres et importer le matériel source

  1. Importer le fichier WAV et les paroles : le fichier WAV sert de référence temporelle. Les paroles doivent être au format SUNO, avec des marqueurs de section tels que [Verse], [Chorus] ou [Bridge] .
  2. Définir le style : décrire le genre, le langage visuel, l’ambiance et les motifs récurrents. Il s’agit du cadre créatif pour le plan de scène et les prompts.
  3. Définir des références : si des personnages ou un style visuel récurrent sont importants, ajoutez des images de référence appropriées. Les avatars par défaut peuvent être préparés de manière globale et adaptés pour chaque projet.
  4. Choisir la taille des segments : pour les couplets et les refrains, définir séparément le nombre de lignes de paroles devant figurer dans une scène.

3. Segmenter automatiquement — et corriger si nécessaire

  1. Lancer « Analyze + Split » : VocaVid aligne les paroles sur la chanson à l’aide de Whisper et construit à partir de là les premiers segments de rendu.
  2. Vérifier le timing : examinez de manière ciblée les lignes dont la transcription n’est pas suffisamment fiable. Si Whisper n’est pas assez précis, VocaVid utilise un timing de secours traçable.
  3. Ajuster manuellement : en mode tableau avancé, corrigez l’heure de début et de fin d’une ligne, regroupez les lignes différemment ou ajustez les segments.
  4. Définir les passages instrumentaux de manière ciblée : pour l’intro, le break ou la transition, créez un interlude dans l’éditeur de timing manuel. Ces passages deviennent des scènes distinctes pouvant être rendues.

Commencez par affiner le timing et la segmentation. Chaque scène ultérieure, chaque clip et le montage final s’y référeront.

4. Plan de scène et indications

  1. Créer un plan de scène : le « plan de scène » permet de définir le fil conducteur de l’ensemble du morceau. Pour les morceaux plus longs, VocaVid assure la cohérence entre les lots.
  2. Modifier le plan : définir les lieux, personnages, couleurs et motifs symboliques récurrents avant la génération des images.
  3. Générer des prompts d’image : créer des prompts d’image pour les segments sélectionnés. Les prompts individuels peuvent et doivent être affinés manuellement si nécessaire.
  4. Générer des consignes de mouvement : générer ensuite des consignes « image-vidéo » : mouvement de caméra, rythme, action et énergie souhaitée pour la scène.

5. Images, avatars et clips

  1. Générer des images : créer les images de base pour les cartes de storyboard sélectionnées et les comparer dans l’aperçu.
  2. Ne générer des avatars que là où ils apportent une valeur ajoutée. Il s’agit généralement de refrains, de « hooks » ou d’apparitions récurrentes. Les variantes d’avatars permettent de maintenir la cohérence d’un même personnage sur plusieurs scènes.
  3. Choisir la source de l’image : pour chaque segment, décider si le clip doit partir de l’image de base ou de la variante d’avatar.
  4. Générer des clips : rendre les scènes sélectionnées sous forme de vidéo. La file d’attente de rendu globale reste visible.
  5. Vérifier et protéger : marquer les bonnes vidéos avec OK . Les clips protégés ne seront pas écrasés lors d’actions par lots ultérieures. Régénérer de manière ciblée les passages faibles.

6. Finalisation, Kdenlive et MP4

  1. Passer en revue l’intégralité du storyboard : vérifier une dernière fois l’ordre, la source multimédia, le timing et le statut « OK ».
  2. Exécuter « Assemble Final » : VocaVid crée, à partir des clips validés, un projet Kdenlive modifiable comprenant des pistes vidéo et audio ainsi que des transitions.
  3. Ouvrir le projet Kdenlive : le fichier est prêt pour le montage de précision final, l’ajout de titres personnalisés, la correction des couleurs ou la création manuelle de transitions .kdenlive.
  4. Rendu MP4 : lancer l’exportation finale avec « Render MP4 ». Si un fichier MP4 existe déjà, VocaVid ouvre l’aperçu.

7. Créer des « Reels » à partir de la vidéo finale

  1. Ouvrir « Make reels » : après l’exportation au format MP4, passez au workflow Reels.
  2. Lancer l'analyse L'alignement Whisper et l'analyse du rythme et de l'énergie proposent des extraits verticaux et musicalement intéressants.
  3. Vérifier les extraits potentiels : effectuez un rendu des meilleurs passages sous forme d’aperçu et évaluez le cadrage ainsi que le moment choisi.
  4. Exporter les Reels définitifs : exporter les extraits validés au format vertical — prêts pour les Shorts, les Reels ou TikTok.