Passer à la navigation

Comment fonctionne la synchronisation labiale AI

Qu’est-ce que AI Lip Sync ?

La synchronisation labiale AI prend une vidéo d’une personne parlant et une piste audio distincte, puis génère de nouveaux mouvements des lèvres qui correspondent à l’audio. Le visage de l’orateur d’origine est modifié image par image afin que les mouvements de la bouche s’alignent naturellement avec le discours cible.

Cela signifie que vous pouvez modifier ce que quelqu’un semble dire dans une vidéo (échanger de l’audio traduit, un nouveau dialogue ou une synthèse vocale) et le résultat donne l’impression que la personne a réellement prononcé ces mots.

Comment fonctionnent les modèles Sync Labs

Les modèles lipsync de Sync Labs traitent la vidéo via un pipeline en trois étapes :

1. Détection de visage

Le modèle scanne chaque image pour localiser et suivre le visage de l’orateur. Il identifie les repères du visage autour de la bouche, de la mâchoire et du bas du visage. Pour les vidéos avec plusieurs personnes, vous pouvez spécifier quel locuteur cibler à l’aide de sélection du locuteur.

2. Génération de mouvements des lèvres

Le modèle analyse l’audio cible et génère des formes de bouche correspondantes image par image. Les modèles Sync Labs utilisent des morceaux indépendants de 2 secondes pour l’inférence. Au cours de ce processus, le modèle apprend le style de parole unique de l’orateur : la largeur de sa bouche, l’inclinaison naturelle de sa tête lorsqu’il parle, la visibilité de ses dents. Cela produit des mouvements de lèvres qui ressemblent à ceux du locuteur d’origine, et non à des formes de bouche génériques collées sur un visage.

3. Mélange

La région des lèvres générée est reconstituée dans l’image vidéo d’origine. Le modèle gère la correspondance des tons de peau, la cohérence de l’éclairage et la fusion des bords afin que la zone de la bouche modifiée s’intègre au visage environnant. Le reste du cadre (arrière-plan, corps, cheveux) reste intact.

Le résultat est une vidéo dans laquelle seules la région des lèvres et du bas du visage a changé, tout le reste étant conservé exactement tel qu’il était.

Choisir un modèle

Sync Labs propose plusieurs modèles optimisés pour différents compromis de qualité et de vitesse. lipsync-2 est le point de départ recommandé pour la plupart des applications. Pour une qualité supérieure avec des détails améliorés autour des dents, de la barbe et des traits du visage, utilisez lipsync-2-pro. Pour une synchronisation labiale expressive avec contrôle des émotions et mouvements de la tête sur du contenu court, utilisez react-1.

Pour connaître les spécifications complètes, les prix et les comparaisons détaillées des fonctionnalités, consultez les pages Modèles Lipsync et Modèles React.

Cas d’utilisation courants

La synchronisation labiale de l’IA permet un large éventail d’applications dans tous les secteurs :

Apprentissage et formation en ligne

Localisez des vidéos de formation pour les équipes mondiales. Créez du contenu dirigé par un instructeur dans des dizaines de langues à partir d’un seul enregistrement.

Marketing et ventes

Générez des messages vidéo personnalisés à grande échelle. Un enregistrement devient des milliers de vidéos de sensibilisation personnalisées.

Localisation du contenu

Dub du contenu pour un public international tout en gardant intacts les mouvements naturels des lèvres.

Divertissement et jeux

Doublage de post-production, édition des dialogues des personnages et synchronisation labiale pour les personnages d’animation ou de jeu.

Consultez la page complète Cas d’utilisation pour des exemples détaillés et des liens vers des guides de mise en œuvre.

Questions fréquemment posées

Le doublage traditionnel enregistre un nouveau doubleur pour chaque langue et s’appuie sur les réalisateurs pour se rapprocher du timing de la bouche. La synchronisation labiale IA remplace les mouvements des lèvres dans la vidéo d’origine image par image afin qu’ils correspondent exactement à toute nouvelle piste audio. Cela signifie qu’une vidéo source peut être doublée dans des dizaines de langues avec des mouvements de bouche parfaitement synchronisés en quelques minutes au lieu de plusieurs semaines.

Oui. Les modèles Sync Labs fonctionnent sur des formes d’onde audio et non sur du texte, ils fonctionnent donc avec n’importe quelle langue parlée, y compris les langues tonales comme le mandarin et le thaï. Tant que l’audio d’entrée est clair, le modèle génère des mouvements de lèvres correspondants, quelle que soit la paire de langues.

Le temps de traitement dépend du modèle et de la durée de la vidéo. lipsync-1.9.0-beta traite à une vitesse en temps réel d’environ 3 fois, tandis que lipsync-2 et lipsync-2-pro fonctionnent à une vitesse en temps réel d’environ 1 fois. Une vidéo de 60 secondes se termine généralement en 20 à 60 secondes selon le modèle sélectionné.

Oui. Vous pouvez cibler un haut-parleur spécifique à l’aide de la fonction de sélection de haut-parleur de Sync Labs, qui identifie les visages individuels dans le cadre. Pour les vidéos comportant deux intervenants ou plus, soumettez des demandes de génération distinctes par intervenant ou utilisez des segments pour traiter indépendamment la partie de chaque intervenant.

Commencer

Prêt à construire avec la synchronisation labiale Sync Labs API ?

1

Obtenez votre clé API

Inscrivez-vous et créez une clé API à partir du Tableau de bord.

2

Suivez le démarrage rapide

Exécutez votre première génération de lipsync en quelques minutes avec le [Guide de démarrage rapide](/démarrage rapide).

3

Explorez le API

Consultez la [Référence API] complète (/api-reference) pour tous les paramètres, modèles et options disponibles.