Modeles lipsync
Sync Labs propose une famille de modeles lipsync adaptes a differents besoins de qualite et de vitesse. sync-3 est notre modele le plus puissant, avec sortie native 4K et detection d’obstruction integree. lipsync-2-pro offre une super resolution basee sur la diffusion pour des details faciaux fins. lipsync-2 equilibre qualite et vitesse pour un usage general. Les tarifs vont de $0.04/sec (lipsync-2) a $0.133/sec (sync-3) a 25 fps. Explorez et comparez ci-dessous les capacites des differents modeles.
Ces modeles publics sont disponibles a la fois dans Studio et via l’API.
Options avancees
Toutes les options avancees ne sont pas disponibles sur chaque modele. Le tableau ci-dessous indique quelles options vous pouvez configurer pour chaque modele lipsync.
Les options marquees par ”-” sont soit non prises en charge, soit gerees automatiquement par le modele. Si vous incluez une option non prise en charge dans votre requete, elle sera ignoree.
- Temperature: Controle l’expressivite des mouvements de levres (0-1, valeur par defaut 0.5). Disponible sur lipsync-2 et lipsync-2-pro. sync-3 gere l’expressivite nativement.
- Obstruction Detection: Pour les contenus video difficiles ou les visages peuvent etre partiellement caches par des objets, des mains ou d’autres elements, vous pouvez activer la detection d’obstruction sur lipsync-2 et lipsync-2-pro. Cette fonctionnalite ameliore la precision de detection des visages dans les scenes complexes, mais ralentit la generation. sync-3 gere les obstructions automatiquement - aucune configuration necessaire.
- Reasoning: Analyse d’image amelioree pour les artefacts et cas limites. Disponible sur lipsync-2-pro. sync-3 inclut cette capacite nativement.
- Active Speaker Detection: Detecte automatiquement les locuteurs actifs et applique le lipsync uniquement a eux dans les videos avec plusieurs personnes. Disponible sur tous les modeles lipsync.
Limites
- Limitation des images fixes: lipsync-2 et lipsync-2-pro necessitent un mouvement de parole naturel dans la video d’entree pour fonctionner correctement. Si votre video contient des segments avec des images fixes (ou le locuteur ne bouge pas ou ne parle pas activement), le lipsync ne fonctionnera pas sur ces portions, meme si de l’audio est present. Ces modeles utilisent des chunks independants de 2 secondes pour l’inference et doivent detecter un style de parole naturel pour generer des mouvements de levres adaptes. Les segments video statiques ne fournissent pas les indices visuels necessaires pour creer une synchronisation labiale realiste. sync-3 peut ouvrir des levres silencieuses pour correspondre a l’audio, mais le resultat est generique et non aligne sur le style du locuteur. Recommandation: Pour de meilleurs resultats avec lipsync-2 et lipsync-2-pro, assurez-vous que la video d’entree montre le locuteur en train de parler activement pendant toute la duree a synchroniser.
Modeles historiques
lipsync-1.9.0-beta est notre modele lipsync historique rapide pour les videos simples. Il utilise des mouvements de levres generiques standards et reste l’option la plus rapide a $0.02 - $0.025/sec a 25 fps. Bien qu’il soit toujours pris en charge, nous recommandons lipsync-2 ou des modeles plus recents pour une meilleure precision et preservation du style.
FAQ
Pourquoi le mouvement des levres de mon personnage genere par IA ne fonctionne-t-il pas correctement ?
Le personnage dans la video d’entree doit donner l’impression de parler. Nos modeles apprennent a imiter le style de parole present dans la video d’entree. Si le personnage est totalement statique, le modele peut aussi ne pas generer de levres en mouvement. sync-3 peut ouvrir des levres silencieuses, mais pour des resultats les plus naturels, l’entree doit montrer un certain mouvement de parole.
Solution: Lors de la creation de votre video generee par IA, ajoutez le prompt texte “person is speaking naturally” a votre generation. Cela creera des personnages dont les levres bougent deja, ce qui fonctionne beaucoup mieux avec notre plateforme.
Puis-je utiliser sync pour synchroniser une chanson sur un personnage ?
Absolument. Pour la meilleure qualite, commencez avec sync-3 ; pour la plupart des usages standards de song-lip-sync, lipsync-2 est un bon choix par defaut. Pour de meilleurs resultats, veillez a isoler et uploader la piste vocale, car l’instrumental peut parfois deteriorer la qualite du lipsync.
sync fonctionne-t-il avec des visages d'animaux ou des personnages non humains ?
Vous pouvez faire du lipsync sur des visages humanoides, mais nos modeles ne prennent pas encore en charge les animaux ni les personnages non humanoides.
Pourquoi la qualite du lipsync est-elle faible ou inexistante dans certaines parties de ma video ?
Verifiez si les segments problematiques contiennent :
- Plusieurs locuteurs dans le cadre
- Des visages trop petits ou en vue de profil
- Des segments ou le locuteur de la video d’entree ne parle pas
- Des visages partiellement masques par des objets, des mains ou d’autres elements
Pour les videos avec plusieurs personnes, essayez de masquer ou recadrer certains visages avec des outils externes. Pour les problemes d’obstruction, sync-3 gere les obstructions automatiquement. Sur lipsync-2 et lipsync-2-pro, activez l’option occlusion_detection_enabled dans votre requete de generation pour ameliorer la detection des visages dans les scenes complexes (au prix d’un traitement plus lent).
Pourquoi ma video a-t-elle un lipsync de mauvaise qualite quand les visages sont en vue de profil ?
Les visages en profil tres marque peuvent donner des resultats inferieurs sur lipsync-2 et lipsync-2-pro. sync-3 prend nativement en charge les angles extremes, y compris les profils, les plans over-the-shoulder et les positions de levres non frontales. Si vous travaillez avec des angles difficiles, sync-3 est la meilleure option.
Pourquoi le visage genere semble-t-il de plus faible resolution que ma video d'entree ?
lipsync-2 et lipsync-2-pro generent les visages en resolution 512×512, ce qui est generalement suffisant pour la plupart des videos 1080p. Si le visage de votre video d’entree est tres grand, vous pouvez remarquer une difference de resolution. lipsync-2-pro offre une meilleure preservation des details pour les barbes, les dents et les traits fins du visage. sync-3 genere en resolution native 4K avec super resolution integree, donc la perte de resolution n’est pas un probleme.
Qu'est-ce qui differencie lipsync-2-pro des autres modeles ?
lipsync-2-pro utilise une technologie avancee de super resolution basee sur la diffusion au lieu des approches traditionnelles basees sur les GAN. Cela apporte :
- Resolution de barbe amelioree: Meilleure gestion des poils faciaux sans flou
- Generation des dents amelioree: Dents plus coherentes et naturelles d’une frame a l’autre
- Preservation superieure des details: Meilleure qualite autour de la bouche et des traits du visage
- Meilleure gestion de la taille du visage: Peut traiter des regions de visage plus grandes (jusqu’a 350×350 pixels) sans degradation de qualite
Le compromis est un temps de traitement plus long (1.5-2x plus lent que lipsync-2) et un cout plus eleve, ce qui en fait un choix ideal pour les usages premium exigeant la fidelite maximale.
Qu'est-ce qui differencie sync-3 de lipsync-2-pro ?
sync-3 repose sur une architecture fondamentalement differente. Au lieu de traiter la video en petits chunks independants, sync-3 construit une comprehension globale de la personne sur tout le plan et genere toutes les frames d’un coup. Cela lui donne :
- Coherence longue portee: Pas d’artefacts de frontiere de chunk ni de scintillement
- Detection d’obstruction integree: Gere automatiquement les mains, microphones, echarpes et autres objets bloquant le visage
- Prise en charge des angles extremes: Les profils, plans over-the-shoulder et angles non frontaux fonctionnent nativement
- Sortie native 4K: Super resolution integree sans perte de qualite
- Preservation de l’emotion et du style: Conserve la cadence, les expressions et la performance emotionnelle du locuteur
sync-3 offre une qualite significativement superieure, avec un prix plus eleve refletant son pipeline de traitement avance.
Quelle est la duree video maximale ?
La duree video maximale depend de votre abonnement, de 1 minute sur Hobbyist jusqu’a 30 minutes sur les offres Scale+. Consultez la page de tarification pour la limite de votre offre.
Combien coute chaque modele lipsync ?
Chaque modele lipsync a une tarification par seconde differente a 25 fps. Les tarifs ne sont pas identiques entre modeles :
lipsync-2 coute environ 2x plus que lipsync-1.9.0-beta, lipsync-2-pro coute environ 1.7x plus que lipsync-2, et sync-3 est le modele de plus haute qualite au prix le plus eleve. Choisissez selon vos exigences de qualite et de budget. Consultez la page facturation pour tous les details.
Pourquoi la generation de ma video longue a-t-elle echoue apres un long traitement ?
Pour lipsync-2 et lipsync-2-pro, les videos longues sont automatiquement divisees en chunks de 30-40 secondes pour le traitement. Les generations peuvent expirer et echouer si votre video contient trop de changements de scene dans ces chunks, ou si beaucoup de scenes ne contiennent pas de visages detectables.
Cela se produit car le pipeline de traitement doit detecter et suivre les visages dans toute la video. Les changements de scene rapides ou les scenes sans visage ajoutent de la complexite et peuvent depasser les limites de temps de traitement.
Pour corriger cela :
- Reduisez le nombre de coupes de scene dans votre video avant l’upload
- Assurez-vous que des visages sont visibles dans la plupart des frames de la video
- Decoupez les videos tres longues avec de nombreuses scenes en segments plus courts et plus faciles a traiter
sync-3 traite les plans differemment et peut mieux gerer certains de ces scenarios, meme si les videos tres longues avec de nombreux changements de scene peuvent rester difficiles.

