Passer à la navigation

Conseils sur le contenu média

La qualité de vos médias d’entrée a un impact direct sur la sortie finale de lipsync. Pour des résultats optimaux, suivez ces conseils pour préparer votre contenu vidéo et audio.

Conseils pour le contenu vidéo

Éviter les profils et les obstructions

Pour de meilleures performances, évitez les plans de profil complet (vue de côté) et les obstructions qui couvrent le visage.

Assurer un mouvement de parole naturel

Le modèle fonctionne mieux quand le personnage dans la vidéo semble parler naturellement. Il conservera le style du locuteur pendant le lipsync.

Conseil pour la vidéo générée par IA: Lorsque vous créez des vidéos avec des modèles tiers de génération vidéo IA, incluez cette instruction dans le prompt texte: "the character should be speaking naturally". La vidéo IA générée aura des mouvements de bouche aléatoires, nécessaires pour obtenir les meilleurs résultats avec notre modèle lipsync.

Conseils pour le contenu audio

Utiliser un audio clair

Pour de meilleures performances, évitez les audios avec musique, bruit de fond, ou plusieurs locuteurs qui parlent en même temps.

Options de mode Sync

Quand votre vidéo et votre audio ont des durées différentes, vous pouvez choisir comment gérer cet écart avec le paramètre sync_mode. Consultez le guide mode Sync pour la matrice complète des comportements et des exemples de durées de sortie.

Sync mode s’applique uniquement aux entrées vidéo. Pour les entrées image (sync-3), mode Sync est ignoré puisque les images n’ont pas de durée intrinsèque à comparer à l’audio.

bounce

Quand la vidéo est plus courte que l’audio, la vidéo est lue en sens inverse à la fin pour correspondre à la durée audio. Sinon, la vidéo est rognée pour correspondre à l’audio.

loop

Quand la vidéo est plus courte que l’audio, la vidéo boucle depuis le début pour correspondre à la durée audio. Sinon, la vidéo est rognée pour correspondre à l’audio.

cut_off

Quand l’audio est plus long que la vidéo, l’audio est coupé pour correspondre à la durée vidéo. Sinon, la vidéo est rognée pour correspondre à l’audio.

silence

Quand la vidéo est plus longue que l’audio, du silence est ajouté à l’audio pour correspondre à la durée vidéo. Quand l’audio est plus long que la vidéo, la sortie conserve la durée audio complète.

remap

La vitesse de lecture de la vidéo est ajustée (accélérée ou ralentie) pour correspondre exactement à la durée audio, en conservant tout le contenu des deux.

Mode Sync Labs par défaut: Le mode par défaut dépend de votre type de génération et des durées vidéo/audio :

  • Générations non segmentées:
    • Vidéo plus longue que l’audio: cut_off est le mode par défaut
    • Audio plus long que la vidéo: bounce est le mode par défaut
  • Générations segmentées (avec segments_secs ou segments_frames): remap est le mode par défaut, recommandé pour éviter les coupes abruptes au milieu de la vidéo.

Choisir le bon mode Sync Labs: Utilisez bounce ou loop pour les vidéos courtes avec audio plus long, cut_off quand vous voulez privilégier la durée vidéo, silence quand vous voulez conserver toute la vidéo, et remap quand vous devez conserver tout le contenu de la vidéo et de l’audio.

Ressources associées