GUÍA PASO A PASO

Desde la primera subida
hasta el vídeo final.

Esta guía te lleva paso a paso por todo el proceso de VocaVid. El orden se ha elegido deliberadamente por motivos prácticos: primero, la estructura y la sincronización; después, el aspecto y el movimiento; y, por último, el montaje y los reels.

Antes de empezar el primer proyecto

VocaVid se ejecuta localmente en Python 3.11 o superior. Además, se necesita una instancia de ComfyUI en ejecución, los archivos de flujo de trabajo adecuados y ffmpeg . Para Whisper y la generación, se recomienda una GPU compatible con CUDA.

Consejo: Inicia primero ComfyUI y comprueba si los modelos y nodos personalizados necesarios están disponibles en los flujos de trabajo. A continuación, inicia VocaVid python -m VocaVid serve y ábrelo en http://127.0.0.1:8000 .

1. Crear un nuevo proyecto

  1. Abrir «New Project»: crea un nuevo proyecto de videoclip en el panel de control.
  2. Asignar un nombre al proyecto: un título claro te ayudará más adelante a encontrar los archivos de Kdenlive, los MP4 y las exportaciones de Reel.
  3. Establecer el formato base: Selecciona la resolución, los FPS y los «Transition Handles» que se ajusten al formato final deseado.

2. Introducir los valores y el material de partida

  1. Subir el archivo WAV y la letra: el archivo WAV es la base temporal. La letra debe estar en formato SUNO con marcadores de sección como [Verse], [Chorus] o [Bridge] .
  2. Definir el estilo: describir el género, el lenguaje visual, el ambiente y los motivos recurrentes. Esta es la guía creativa para el plan de escenas y las indicaciones.
  3. Establecer referencias: si los personajes o un estilo visual recurrente son importantes, añade imágenes de referencia adecuadas. Los avatares predeterminados se pueden preparar de forma global y adaptar por proyecto.
  4. Seleccionar el tamaño de los segmentos: establece por separado para las estrofas y los estribillos cuántas líneas de letra deben incluirse en una escena.

3. Segmentar automáticamente — y corregir si es necesario

  1. Iniciar «Analyze + Split»: VocaVid alinea la letra con la canción mediante Whisper y crea a partir de ahí los primeros segmentos de renderizado.
  2. Comprobar la sincronización: revisa específicamente las líneas con baja fiabilidad en la transcripción. Si Whisper no está lo suficientemente preciso, VocaVid utiliza una sincronización alternativa comprensible.
  3. Ajustar manualmente: en el modo de tabla ampliado, corrige la hora de inicio y fin de una línea, agrupa las líneas de otra forma o ajusta los segmentos.
  4. Colocar instrumentales de forma deliberada: crea un interludio en el editor de sincronización manual para la intro, el break o la transición. Estos pasajes se convierten en escenas independientes que se pueden renderizar.

Primero hay que pulir la sincronización y la segmentación. Cada escena posterior, cada clip y el montaje final se basan en ello.

4. Plan de escena y indicaciones

  1. Crear el «Scene Plan»: con el «Scene Plan» se establece el hilo conductor de toda la canción. En canciones más largas, VocaVid se encarga del contexto entre los lotes.
  2. Editar el plan: definir los lugares, personajes, colores y motivos simbólicos recurrentes antes de generar las imágenes.
  3. Generar indicaciones de imagen: Genera indicaciones de imagen para los segmentos seleccionados. Las indicaciones individuales pueden y deben perfeccionarse manualmente si es necesario.
  4. Generar indicaciones de movimiento: A continuación, genera indicaciones de imagen a vídeo: movimiento de cámara, ritmo, acción y la energía deseada para la escena.

5. Imágenes, avatares y clips

  1. Generar imágenes: Generar las imágenes básicas para las tarjetas seleccionadas del storyboard y compararlas en la vista previa.
  2. Generar avatares solo donde sean necesarios: suelen ser estribillos, ganchos o apariciones recurrentes. Las variantes de avatar ayudan a mantener la coherencia del mismo personaje a lo largo de varias escenas.
  3. Seleccionar la fuente de la imagen: decidir, para cada segmento, si el clip debe partir de la imagen base o de la variante del avatar.
  4. Generar clips: renderizar las escenas seleccionadas como vídeo. La cola de renderizado global permanece visible.
  5. Revisar y proteger: Marcar los vídeos correctos con OK . Los clips protegidos no se sobrescribirán en acciones por lotes posteriores. Vuelve a generar de forma selectiva los puntos débiles.

6. Finalizar, Kdenlive y MP4

  1. Revisar el guion gráfico al completo: comprobar por última vez el orden, la fuente multimedia, la sincronización y el estado «OK».
  2. Ejecutar «Assemble Final»: VocaVid crea, a partir de los clips aprobados, un proyecto editable de Kdenlive con pistas de vídeo y audio, así como transiciones.
  3. Abrir el proyecto de Kdenlive: para el montaje final, los títulos personalizados, la corrección de color o las transiciones manuales, ya está disponible el .kdenlive.
  4. Renderizar el MP4: con «Render MP4» se genera la exportación final. Si ya existe un MP4, VocaVid abre la vista previa.

7. Crear «reels» a partir del vídeo final

  1. Abrir «Make reels»: tras la exportación a MP4, pasa al flujo de trabajo de Reels.
  2. Iniciar el análisis: la alineación de «Whisper» y el análisis de ritmo y energía sugieren fragmentos verticales y musicalmente interesantes.
  3. Revisar las opciones: renderiza las mejores secuencias como vista previa y evalúa el encuadre y el momento elegido.
  4. Exportar los Reels definitivos: exportar los fragmentos aprobados como archivos verticales, listos para Shorts, Reels o TikTok.