Zur Navigation springen

Lipsync-Modelle

Sync Labs bietet eine Familie von lipsync-Modellen für unterschiedliche Anforderungen an Qualität und Geschwindigkeit. sync-3 ist unser leistungsstärkstes Modell mit 4K Native Output und integrierter Obstruction Detection. lipsync-2-pro liefert diffusion-basierte Super Resolution für feine Gesichtsdetails. lipsync-2 bietet ein gutes Gleichgewicht zwischen Qualität und Geschwindigkeit für allgemeine Anwendungsfälle. Die Preise reichen von $0.04/sec (lipsync-2) bis $0.133/sec (sync-3) bei 25 fps. Entdecke und vergleiche die Fähigkeiten der verschiedenen Modelle unten.

Featurelipsync-2lipsync-2-prosync-3
BeschreibungUnser bisher natürlichstes lipsyncing-Modell. Das erste Modell, das den einzigartigen Sprechstil jeder sprechenden Person erhalten kann.Unser lipsyncing-Modell mit der höchsten Qualität und diffusion-basierter Super Resolution. Verbesserte Detailerhaltung bei Bärten, Zähnen und Gesichtsmerkmalen.Unser leistungsstärkstes lipsync-Modell. Verarbeitet die gesamte Einstellung auf einmal, mit integrierter Obstruction Detection, 4K Native Output und Unterstützung für extreme Winkel und teilweise sichtbare Gesichter.
Preis bei 25fps$0.04 — $0.05/sec$0.067 — $0.083/sec$0.107 — $0.133/sec
Genauigkeit
Geschwindigkeit
StilLippenbewegungen im einzigartigen Stil der sprechenden PersonLippenbewegungen im einzigartigen Stil der sprechenden Person, mit verbesserten Details und höherer GenauigkeitVollständige Erhaltung von Stil und Emotion der sprechenden Person durch breiteres räumliches Verständnis
Identitätserhaltung
Zähne
Gesichtserkennung
Face Blending
Pose-Robustheit
Bart
Gesichtsauflösung512×512512×512 mit verbesserter Detailerhaltung4K Native Output mit integrierter Super Resolution
Am besten geeignet fürbestes lipsync für die Mehrheit der Videosbesser als das Beste. lipsync-2 mit Premium-Qualität, sehr empfohlen für professionelle Anforderungen. Erzeugt nahtlos Gesichtsdetails bei Bärten, Falten und Zähnen.lipsync auf Produktionsniveau. Verarbeitet Nahaufnahmen, Profilaufnahmen, Obstructions und komplexe Szenen, mit denen andere Modelle Schwierigkeiten haben.

Diese öffentlichen Modelle sind sowohl in Studio als auch in der API verfügbar.

Erweiterte Optionen

Nicht alle erweiterten Optionen sind bei jedem Modell verfügbar. Die folgende Tabelle zeigt, welche Optionen du pro lipsync-Modell konfigurieren kannst.

Optionlipsync-2lipsync-2-prosync-3
temperature✓✓- (managed natively)
occlusion_detection_enabled✓✓- (automatic)
reasoning_enabled-✓- (integriert)
active_speaker_detection✓✓✓

Optionen mit ”-” werden entweder nicht unterstützt oder automatisch durch das Modell behandelt. Wenn du eine nicht unterstützte Option in deiner Anfrage angibst, wird sie ignoriert.

  • Temperature: Steuert die Ausdrucksstärke der Lippenbewegungen (0-1, Standard 0.5). Verfügbar bei lipsync-2 und lipsync-2-pro. sync-3 steuert Ausdrucksstärke nativ.
  • Obstruction Detection: Für anspruchsvolle Videoinhalte, bei denen Gesichter teilweise durch Objekte, Hände oder andere Elemente verdeckt sein können, kannst du bei lipsync-2 und lipsync-2-pro Obstruction Detection aktivieren. Dieses Feature verbessert die Genauigkeit der Gesichtserkennung in komplexen Szenen, geht aber mit langsameren Generierungsgeschwindigkeiten einher. sync-3 verarbeitet Obstructions automatisch, keine Konfiguration erforderlich.
  • Reasoning: Verbesserte Frame-Analyse für Artefakte und Edge Cases. Verfügbar bei lipsync-2-pro. sync-3 enthält diese Fähigkeit nativ.
  • Active Speaker Detection: Erkennt aktive Sprecher in Videos mit mehreren Personen automatisch und wendet lip sync nur auf diese an. Verfügbar bei allen lipsync-Modellen.

Einschränkungen

  • Still Frame Limitation: lipsync-2 und lipsync-2-pro benötigen natürliche Sprechbewegung im Eingabevideo, um korrekt zu funktionieren. Wenn dein Video Abschnitte mit Standbildern enthält (bei denen die sprechende Person sich nicht aktiv bewegt oder spricht), funktioniert lip sync in diesen Abschnitten nicht, selbst wenn Audio vorhanden ist. Diese Modelle nutzen 2-second independent chunks für die Inferenz und müssen den natürlichen Sprechstil erkennen, um passende Lippenbewegungen zu erzeugen. Statische oder stillstehende Videoabschnitte liefern dem Modell nicht die notwendigen visuellen Hinweise für realistische Lippensynchronisation. sync-3 kann stille Lippen passend zum Audio öffnen, die Ergebnisse sind dann jedoch generisch und nicht an den Stil der sprechenden Person angepasst. Empfehlung: Für beste Ergebnisse mit lipsync-2 und lipsync-2-pro sollte dein Eingabevideo über die gesamte gewünschte Dauer für lip sync eine aktiv sprechende Person zeigen.

Legacy-Modelle

lipsync-1.9.0-beta ist unser schnelles Legacy-lipsync-Modell für einfache Videos. Es nutzt standardisierte generische Lippenbewegungen und ist mit $0.02 — $0.025/sec bei 25 fps die schnellste verfügbare Option. Es wird weiterhin unterstützt, wir empfehlen aber lipsync-2 oder neuere Modelle für bessere Genauigkeit und Stilerhaltung.

FAQs

Der Charakter im Eingabevideo muss so aussehen, als würde er sprechen. Unsere Modelle lernen, den Sprechstil aus dem Eingabevideo nachzuahmen. Wenn der Charakter vollständig statisch ist, erzeugt das Modell möglicherweise ebenfalls keine bewegten Lippen. sync-3 kann stille Lippen öffnen, aber für die natürlichsten Ergebnisse sollte die Eingabe etwas Sprechbewegung zeigen.

Lösung: Wenn du dein AI-generiertes Video erstellst, füge den Text-Prompt “person is speaking naturally” zu deiner Generierung hinzu. Dadurch entstehen Charaktere mit bereits bewegten Lippen, was mit unserer Plattform deutlich besser funktioniert.

Auf jeden Fall. Für die beste Qualität starte mit sync-3. Für die meisten Standard-Song-lip-sync-Jobs ist lipsync-2 ein guter Standard. Für bestmögliche Ergebnisse solltest du die Gesangsspur isolieren und hochladen, da instrumentale Anteile die lipsync-Qualität manchmal beeinträchtigen können.

Du kannst menschlich wirkende Gesichter lipsyncen, aber unsere Modelle unterstützen aktuell keine Tiere oder nicht-humanoiden Charaktere.

Bitte prüfe, ob die problematischen Abschnitte Folgendes haben:

  • Mehrere Sprecher im Frame
  • Zu kleine Gesichter oder Profilansicht
  • Abschnitte, in denen die sprechende Person im Eingabevideo nicht spricht
  • Gesichter, die teilweise durch Objekte, Hände oder andere Elemente verdeckt sind

Bei mehreren Personen versuche, einige Gesichter mit externen Tools zu maskieren oder auszuschneiden. Bei Verdeckungsproblemen verarbeitet sync-3 Obstructions automatisch. Bei lipsync-2 und lipsync-2-pro aktiviere die Option occlusion_detection_enabled in deiner Generierungsanfrage für bessere Gesichtserkennung in komplexen Szenen, beachte aber die langsamere Verarbeitung.

Extreme Profilansichten können bei lipsync-2 und lipsync-2-pro zu schwächeren Ergebnissen führen. sync-3 unterstützt extreme Gesichtswinkel nativ, einschließlich Profilen, Over-the-Shoulder-Shots und nicht-frontaler Lippenpositionen. Wenn du mit anspruchsvollen Winkeln arbeitest, ist sync-3 deine beste Option.

lipsync-2 und lipsync-2-pro erzeugen Gesichter in 512×512-Auflösung, was für die meisten 1080p-Videos normalerweise ausreicht. Wenn das Gesicht in deinem Eingabevideo sehr groß ist, kannst du Auflösungsunterschiede bemerken. lipsync-2-pro bietet verbesserte Detailerhaltung bei Bärten, Zähnen und feinen Gesichtsmerkmalen. sync-3 erzeugt in 4K Native Output mit integrierter Super Resolution, daher ist Auflösungsverlust dort kein Problem.

lipsync-2-pro nutzt fortschrittliche diffusion-basierte Super Resolution statt traditioneller GAN-basierter Ansätze. Das führt zu:

  • Verbesserter Bartauflösung: Bessere Verarbeitung von Gesichtsbehaarung ohne Unschärfe
  • Verbesserter Zahnerzeugung: Konsistentere und natürlichere Zähne über Frames hinweg
  • Überlegener Detailerhaltung: Höhere Qualität rund um Mundbereich und Gesichtsmerkmale
  • Bessere Verarbeitung großer Gesichter: Kann größere Gesichtsbereiche (bis 350×350 Pixel) ohne Qualitätsverlust verarbeiten

Der Trade-off sind längere Verarbeitungszeiten (1.5-2x langsamer als lipsync-2) und höhere Kosten. Damit ist es ideal für Premium-Anwendungen, bei denen höchste Genauigkeit gefordert ist.

sync-3 ist eine grundlegend andere Architektur. Statt Video in kleinen unabhängigen Chunks zu verarbeiten, baut sync-3 ein globales Verständnis der Person über die gesamte Einstellung auf und erzeugt alle Frames auf einmal. Das bringt:

  • Langstreckenkonsistenz: Keine Chunk-Grenzartefakte oder Flackern
  • Integrierte Obstruction Detection: Verarbeitet automatisch Hände, Mikrofone, Schals und andere Objekte, die das Gesicht verdecken
  • Unterstützung extremer Winkel: Profilaufnahmen, Over-the-Shoulder und nicht-frontale Winkel funktionieren nativ
  • 4K Native Output: Integrierte Super Resolution ohne Qualitätsverlust
  • Erhaltung von Emotion und Stil: Erhält Kadenz, Ausdruck und emotionale Performance der sprechenden Person

sync-3 liefert deutlich höhere Qualität zu einem höheren Preis, der die fortgeschrittene Verarbeitungspipeline widerspiegelt.

Die maximale Videodauer hängt von deinem Subscription-Plan ab, von 1 Minute im Hobbyist-Plan bis zu 30 Minuten im Scale+-Plan. Siehe die pricing page für das Limit deines Plans.

Jedes lipsync-Modell hat unterschiedliche Preise pro Sekunde bei 25 fps. Die Preise sind nicht modellübergreifend gleich:

ModelPreis pro Sekunde (bei 25 fps)
lipsync-1.9.0-beta$0.02 — $0.025/sec
lipsync-2$0.04 — $0.05/sec
lipsync-2-pro$0.067 — $0.083/sec
sync-3$0.107 — $0.133/sec

lipsync-2 kostet ungefähr 2x mehr als lipsync-1.9.0-beta, lipsync-2-pro kostet ungefähr 1.7x mehr als lipsync-2, und sync-3 ist das hochwertigste Modell zum höchsten Preis. Wähle entsprechend deiner Qualitäts- und Budgetanforderungen. Vollständige Details auf der Seite Abrechnung.

Bei lipsync-2 und lipsync-2-pro werden lange Videos automatisch für die Verarbeitung in 30-40-Sekunden-Abschnitte unterteilt. Generierungen können mit Timeout fehlschlagen, wenn dein Video in diesen Abschnitten zu viele Szenenwechsel hat oder wenn viele Szenen keine erkennbaren Gesichter enthalten.

Das passiert, weil die Verarbeitungspipeline Gesichter über das gesamte Video hinweg erkennen und verfolgen muss. Schnelle Szenenwechsel oder Szenen ohne Gesichter erhöhen die Komplexität und können die Zeitlimits überschreiten.

So behebst du das:

  • Reduziere vor dem Upload die Anzahl der Szenenschnitte in deinem Video
  • Stelle sicher, dass in den meisten Frames des Videos Gesichter sichtbar sind
  • Teile sehr lange Videos mit vielen Szenen in kürzere, besser handhabbare Segmente auf

sync-3 verarbeitet Einstellungen anders und kann einige dieser Szenarien besser handhaben, obwohl sehr lange Videos mit häufigen Szenenwechseln weiterhin anspruchsvoll bleiben können.