> For the documentation index, fetch https://sync.so/docs/llms.txt. Append .md to a page URL for Markdown. Documentation-search MCP: https://sync.so/docs/_mcp/server.

# Lipsync-Modelle

> Vergleiche sync. labs AI lip sync-Modelle: sync-3, lipsync-2 und lipsync-2-pro. Funktionen, Preise, Qualitätsvergleiche und beste Anwendungsfälle für jedes Modell.

Sync Labs bietet eine Familie von lipsync-Modellen für unterschiedliche Anforderungen an Qualität und Geschwindigkeit. sync-3 ist unser leistungsstärkstes Modell mit 4K Native Output und integrierter Obstruction Detection. lipsync-2-pro liefert diffusion-basierte Super Resolution für feine Gesichtsdetails. lipsync-2 bietet ein gutes Gleichgewicht zwischen Qualität und Geschwindigkeit für allgemeine Anwendungsfälle. Die Preise reichen von \$0.04/sec (lipsync-2) bis \$0.133/sec (sync-3) bei 25 fps. Entdecke und vergleiche die Fähigkeiten der verschiedenen Modelle unten.

| Feature                    |                                                                 lipsync-2                                                                |                                                                             lipsync-2-pro                                                                             |                                                                                                           sync-3                                                                                                          |
| :------------------------- | :--------------------------------------------------------------------------------------------------------------------------------------: | :-------------------------------------------------------------------------------------------------------------------------------------------------------------------: | :-----------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------: |
| **Beschreibung**           | Unser bisher natürlichstes lipsyncing-Modell. Das erste Modell, das den einzigartigen Sprechstil jeder sprechenden Person erhalten kann. |   Unser lipsyncing-Modell mit der höchsten Qualität und diffusion-basierter Super Resolution. Verbesserte Detailerhaltung bei Bärten, Zähnen und Gesichtsmerkmalen.   | Unser leistungsstärkstes lipsync-Modell. Verarbeitet die gesamte Einstellung auf einmal, mit integrierter Obstruction Detection, 4K Native Output und Unterstützung für extreme Winkel und teilweise sichtbare Gesichter. |
| **Preis bei 25fps**        |                                                           \$0.04 -- \$0.05/sec                                                           |                                                                         \$0.067 -- \$0.083/sec                                                                        |                                                                                                   \$0.107 -- \$0.133/sec                                                                                                  |
| **Genauigkeit**            |                                                                                                                                          |                                                                                                                                                                       |                                                                                                                                                                                                                           |
| **Geschwindigkeit**        |                                                                                                                                          |                                                                                                                                                                       |                                                                                                                                                                                                                           |
| **Stil**                   |                                       Lippenbewegungen im einzigartigen Stil der sprechenden Person                                      |                            Lippenbewegungen im einzigartigen Stil der sprechenden Person, mit verbesserten Details und höherer Genauigkeit                            |                                                         Vollständige Erhaltung von Stil und Emotion der sprechenden Person durch breiteres räumliches Verständnis                                                         |
| **Identitätserhaltung**    |                                                                                                                                          |                                                                                                                                                                       |                                                                                                                                                                                                                           |
| **Zähne**                  |                                                                                                                                          |                                                                                                                                                                       |                                                                                                                                                                                                                           |
| **Gesichtserkennung**      |                                                                                                                                          |                                                                                                                                                                       |                                                                                                                                                                                                                           |
| **Face Blending**          |                                                                                                                                          |                                                                                                                                                                       |                                                                                                                                                                                                                           |
| **Pose-Robustheit**        |                                                                                                                                          |                                                                                                                                                                       |                                                                                                                                                                                                                           |
| **Bart**                   |                                                                                                                                          |                                                                                                                                                                       |                                                                                                                                                                                                                           |
| **Gesichtsauflösung**      |                                                                  512×512                                                                 |                                                                512×512 mit verbesserter Detailerhaltung                                                               |                                                                                     4K Native Output mit integrierter Super Resolution                                                                                    |
| **Am besten geeignet für** |                                                bestes lipsync für die Mehrheit der Videos                                                | besser als das Beste. lipsync-2 mit Premium-Qualität, sehr empfohlen für professionelle Anforderungen. Erzeugt nahtlos Gesichtsdetails bei Bärten, Falten und Zähnen. |                                lipsync auf Produktionsniveau. Verarbeitet Nahaufnahmen, Profilaufnahmen, Obstructions und komplexe Szenen, mit denen andere Modelle Schwierigkeiten haben.                                |

Diese öffentlichen Modelle sind sowohl in [Studio](https://sync.so/login) als auch in der [API](/api-reference) verfügbar.

## Erweiterte Optionen

Nicht alle erweiterten Optionen sind bei jedem Modell verfügbar. Die folgende Tabelle zeigt, welche Optionen du pro lipsync-Modell konfigurieren kannst.

| Option                        | lipsync-2 | lipsync-2-pro |        sync-3        |
| :---------------------------- | :-------: | :-----------: | :------------------: |
| `temperature`                 |     ✓     |       ✓       | - (managed natively) |
| `occlusion_detection_enabled` |     ✓     |       ✓       |     - (automatic)    |
| `reasoning_enabled`           |     -     |       ✓       |    - (integriert)    |
| `active_speaker_detection`    |     ✓     |       ✓       |           ✓          |

Optionen mit "-" werden entweder nicht unterstützt oder automatisch durch das Modell behandelt. Wenn du eine nicht unterstützte Option in deiner Anfrage angibst, wird sie ignoriert.

* **Temperature**: Steuert die Ausdrucksstärke der Lippenbewegungen (0-1, Standard 0.5). Verfügbar bei lipsync-2 und lipsync-2-pro. sync-3 steuert Ausdrucksstärke nativ.
* **Obstruction Detection**: Für anspruchsvolle Videoinhalte, bei denen Gesichter teilweise durch Objekte, Hände oder andere Elemente verdeckt sein können, kannst du bei lipsync-2 und lipsync-2-pro Obstruction Detection aktivieren. Dieses Feature verbessert die Genauigkeit der Gesichtserkennung in komplexen Szenen, geht aber mit langsameren Generierungsgeschwindigkeiten einher. sync-3 verarbeitet Obstructions automatisch, keine Konfiguration erforderlich.
* **Reasoning**: Verbesserte Frame-Analyse für Artefakte und Edge Cases. Verfügbar bei lipsync-2-pro. sync-3 enthält diese Fähigkeit nativ.
* **Active Speaker Detection**: Erkennt aktive Sprecher in Videos mit mehreren Personen automatisch und wendet lip sync nur auf diese an. Verfügbar bei allen lipsync-Modellen.

## Einschränkungen

* **Still Frame Limitation**: lipsync-2 und lipsync-2-pro benötigen natürliche Sprechbewegung im Eingabevideo, um korrekt zu funktionieren. Wenn dein Video Abschnitte mit Standbildern enthält (bei denen die sprechende Person sich nicht aktiv bewegt oder spricht), funktioniert lip sync in diesen Abschnitten nicht, selbst wenn Audio vorhanden ist.
  Diese Modelle nutzen 2-second independent chunks für die Inferenz und müssen den natürlichen Sprechstil erkennen, um passende Lippenbewegungen zu erzeugen. Statische oder stillstehende Videoabschnitte liefern dem Modell nicht die notwendigen visuellen Hinweise für realistische Lippensynchronisation.
  sync-3 kann stille Lippen passend zum Audio öffnen, die Ergebnisse sind dann jedoch generisch und nicht an den Stil der sprechenden Person angepasst.
  **Empfehlung**: Für beste Ergebnisse mit lipsync-2 und lipsync-2-pro sollte dein Eingabevideo über die gesamte gewünschte Dauer für lip sync eine aktiv sprechende Person zeigen.

## Legacy-Modelle

**lipsync-1.9.0-beta** ist unser schnelles Legacy-lipsync-Modell für einfache Videos. Es nutzt standardisierte generische Lippenbewegungen und ist mit \$0.02 -- \$0.025/sec bei 25 fps die schnellste verfügbare Option. Es wird weiterhin unterstützt, wir empfehlen aber lipsync-2 oder neuere Modelle für bessere Genauigkeit und Stilerhaltung.

## FAQs

#### Warum funktioniert die Lippenbewegung meines AI-generierten Charakters nicht richtig?

Der Charakter im Eingabevideo muss so aussehen, als würde er sprechen. Unsere Modelle lernen, den Sprechstil aus dem Eingabevideo nachzuahmen. Wenn der Charakter vollständig statisch ist, erzeugt das Modell möglicherweise ebenfalls keine bewegten Lippen. sync-3 kann stille Lippen öffnen, aber für die natürlichsten Ergebnisse sollte die Eingabe etwas Sprechbewegung zeigen.

**Lösung:** Wenn du dein AI-generiertes Video erstellst, füge den Text-Prompt "*person is speaking naturally*" zu deiner Generierung hinzu. Dadurch entstehen Charaktere mit bereits bewegten Lippen, was mit unserer Plattform deutlich besser funktioniert.

#### Kann ich sync verwenden, um ein Lied auf einen Charakter zu lipsyncen?

Auf jeden Fall. Für die beste Qualität starte mit sync-3. Für die meisten Standard-Song-lip-sync-Jobs ist lipsync-2 ein guter Standard. Für bestmögliche Ergebnisse solltest du die Gesangsspur isolieren und hochladen, da instrumentale Anteile die lipsync-Qualität manchmal beeinträchtigen können.

#### Funktioniert sync mit Tiergesichtern oder nicht-menschlichen Charakteren?

Du kannst menschlich wirkende Gesichter lipsyncen, aber unsere Modelle unterstützen aktuell keine Tiere oder nicht-humanoiden Charaktere.

#### Warum ist die lipsync-Qualität in bestimmten Teilen meines Videos schlecht oder nicht vorhanden?

Bitte prüfe, ob die problematischen Abschnitte Folgendes haben:

* Mehrere Sprecher im Frame
* Zu kleine Gesichter oder Profilansicht
* Abschnitte, in denen die sprechende Person im Eingabevideo nicht spricht
* Gesichter, die teilweise durch Objekte, Hände oder andere Elemente verdeckt sind

Bei mehreren Personen versuche, einige Gesichter mit externen Tools zu maskieren oder auszuschneiden. Bei Verdeckungsproblemen verarbeitet [sync-3](/models/sync-3) Obstructions automatisch. Bei lipsync-2 und lipsync-2-pro aktiviere die Option `occlusion_detection_enabled` in deiner Generierungsanfrage für bessere Gesichtserkennung in komplexen Szenen, beachte aber die langsamere Verarbeitung.

#### Warum hat mein Video schlechte lipsync-Qualität bei Gesichtern in Profilansicht?

Extreme Profilansichten können bei lipsync-2 und lipsync-2-pro zu schwächeren Ergebnissen führen. sync-3 unterstützt extreme Gesichtswinkel nativ, einschließlich Profilen, Over-the-Shoulder-Shots und nicht-frontaler Lippenpositionen. Wenn du mit anspruchsvollen Winkeln arbeitest, ist sync-3 deine beste Option.

#### Warum wirkt das erzeugte Gesicht niedriger aufgelöst als mein Eingabevideo?

lipsync-2 und lipsync-2-pro erzeugen Gesichter in 512×512-Auflösung, was für die meisten 1080p-Videos normalerweise ausreicht. Wenn das Gesicht in deinem Eingabevideo sehr groß ist, kannst du Auflösungsunterschiede bemerken. lipsync-2-pro bietet verbesserte Detailerhaltung bei Bärten, Zähnen und feinen Gesichtsmerkmalen. sync-3 erzeugt in 4K Native Output mit integrierter Super Resolution, daher ist Auflösungsverlust dort kein Problem.

#### Was unterscheidet lipsync-2-pro von anderen Modellen?

lipsync-2-pro nutzt fortschrittliche diffusion-basierte Super Resolution statt traditioneller GAN-basierter Ansätze. Das führt zu:

* **Verbesserter Bartauflösung**: Bessere Verarbeitung von Gesichtsbehaarung ohne Unschärfe
* **Verbesserter Zahnerzeugung**: Konsistentere und natürlichere Zähne über Frames hinweg
* **Überlegener Detailerhaltung**: Höhere Qualität rund um Mundbereich und Gesichtsmerkmale
* **Bessere Verarbeitung großer Gesichter**: Kann größere Gesichtsbereiche (bis 350×350 Pixel) ohne Qualitätsverlust verarbeiten

Der Trade-off sind längere Verarbeitungszeiten (1.5-2x langsamer als lipsync-2) und höhere Kosten. Damit ist es ideal für Premium-Anwendungen, bei denen höchste Genauigkeit gefordert ist.

#### Was unterscheidet sync-3 von lipsync-2-pro?

sync-3 ist eine grundlegend andere Architektur. Statt Video in kleinen unabhängigen Chunks zu verarbeiten, baut sync-3 ein globales Verständnis der Person über die gesamte Einstellung auf und erzeugt alle Frames auf einmal. Das bringt:

* **Langstreckenkonsistenz**: Keine Chunk-Grenzartefakte oder Flackern
* **Integrierte Obstruction Detection**: Verarbeitet automatisch Hände, Mikrofone, Schals und andere Objekte, die das Gesicht verdecken
* **Unterstützung extremer Winkel**: Profilaufnahmen, Over-the-Shoulder und nicht-frontale Winkel funktionieren nativ
* **4K Native Output**: Integrierte Super Resolution ohne Qualitätsverlust
* **Erhaltung von Emotion und Stil**: Erhält Kadenz, Ausdruck und emotionale Performance der sprechenden Person

sync-3 liefert deutlich höhere Qualität zu einem höheren Preis, der die fortgeschrittene Verarbeitungspipeline widerspiegelt.

#### Was ist die maximale Videodauer?

Die maximale Videodauer hängt von deinem Subscription-Plan ab, von 1 Minute im Hobbyist-Plan bis zu 30 Minuten im Scale+-Plan. Siehe die [pricing page](https://sync.so/pricing) für das Limit deines Plans.

#### Wie viel kostet jedes lipsync-Modell?

Jedes lipsync-Modell hat unterschiedliche Preise pro Sekunde bei 25 fps. Die Preise sind **nicht** modellübergreifend gleich:

| Model              | Preis pro Sekunde (bei 25 fps) |
| :----------------- | :----------------------------- |
| lipsync-1.9.0-beta | \$0.02 -- \$0.025/sec          |
| lipsync-2          | \$0.04 -- \$0.05/sec           |
| lipsync-2-pro      | \$0.067 -- \$0.083/sec         |
| sync-3             | \$0.107 -- \$0.133/sec         |

lipsync-2 kostet ungefähr 2x mehr als lipsync-1.9.0-beta, lipsync-2-pro kostet ungefähr 1.7x mehr als lipsync-2, und sync-3 ist das hochwertigste Modell zum höchsten Preis. Wähle entsprechend deiner Qualitäts- und Budgetanforderungen. Vollständige Details auf der Seite [Abrechnung](/product/abrechnung).

#### Warum ist die Generierung meines langen Videos nach langer Verarbeitung fehlgeschlagen?

Bei lipsync-2 und lipsync-2-pro werden lange Videos automatisch für die Verarbeitung in 30-40-Sekunden-Abschnitte unterteilt. Generierungen können mit Timeout fehlschlagen, wenn dein Video in diesen Abschnitten zu viele Szenenwechsel hat oder wenn viele Szenen keine erkennbaren Gesichter enthalten.

Das passiert, weil die Verarbeitungspipeline Gesichter über das gesamte Video hinweg erkennen und verfolgen muss. Schnelle Szenenwechsel oder Szenen ohne Gesichter erhöhen die Komplexität und können die Zeitlimits überschreiten.

So behebst du das:

* Reduziere vor dem Upload die Anzahl der Szenenschnitte in deinem Video
* Stelle sicher, dass in den meisten Frames des Videos Gesichter sichtbar sind
* Teile sehr lange Videos mit vielen Szenen in kürzere, besser handhabbare Segmente auf

sync-3 verarbeitet Einstellungen anders und kann einige dieser Szenarien besser handhaben, obwohl sehr lange Videos mit häufigen Szenenwechseln weiterhin anspruchsvoll bleiben können.

## Lipsync-Modellreferenz

### Modell-IDs und Preise (bei 25fps)

| Model ID             | Preis pro Sekunde    | Geschwindigkeit      | Am besten geeignet für                                                                                                 |
| -------------------- | -------------------- | -------------------- | ---------------------------------------------------------------------------------------------------------------------- |
| `lipsync-2`          | $0.04 -- $0.05/sec   | Schnell (4/5)        | Schnelles, kosteneffizientes lipsync mit solider Qualität                                                              |
| `lipsync-2-pro`      | $0.067 -- $0.083/sec | Mittel (3/5)         | Premium-Qualität mit diffusion-basierter Super Resolution, am besten für Bärte, Zähne, Gesichtsmerkmale                |
| `sync-3`             | $0.107 -- $0.133/sec | Schnell (4/5)        | Leistungsstärkstes Modell. 4K Native Output, integrierte Obstruction Detection, extreme Winkel, Full-Shot-Verarbeitung |
| `lipsync-1.9.0-beta` | $0.02 -- $0.025/sec  | Am schnellsten (5/5) | Legacy-Modell. Schnelles lipsync für einfache Videos                                                                   |

### Welches Modell wann verwenden

| Szenario                                      | Empfohlenes Modell            |
| --------------------------------------------- | ----------------------------- |
| Allgemeiner Einsatz, die meisten Videos       | `lipsync-2`                   |
| Professionelle/Premium-Qualitätsanforderungen | `lipsync-2-pro`               |
| Produktionsniveau, komplexe Szenen            | `sync-3`                      |
| Nahaufnahmen, Profilaufnahmen, Obstructions   | `sync-3`                      |
| 4K-Output erforderlich                        | `sync-3`                      |
| Bärte, Zähne, feine Gesichtsdetails           | `lipsync-2-pro` oder `sync-3` |
| Kostensensibel, einfache Videos               | `lipsync-1.9.0-beta` (legacy) |

### Geschwindigkeits-Benchmarks (relativ)

* lipsync-2: \~1x Baseline
* sync-3: Schnell (4/5)
* lipsync-2-pro: 1.5--2x langsamer als lipsync-2
* lipsync-1.9.0-beta: Legacy-Modell

### Wichtige Spezifikationen

* Gesichtsauflösung: 512x512 für lipsync-2/lipsync-2-pro, 4K nativ für sync-3
* Alle Modelle über API (`/v2/generate`) und Studio verfügbar
* Obstruction Detection: integriert bei sync-3, optional (`occlusion_detection_enabled`) bei lipsync-2/lipsync-2-pro
* Still Frame Limitation: gilt für lipsync-2/lipsync-2-pro (sync-3 kann stille Lippen öffnen)

### Erweiterte Optionen nach Modell

| Option                        | lipsync-2 | lipsync-2-pro | sync-3          | lipsync-1.9.0-beta |
| ----------------------------- | --------- | ------------- | --------------- | ------------------ |
| `temperature`                 | Yes       | Yes           | No (native)     | No                 |
| `occlusion_detection_enabled` | Yes       | Yes           | No (automatic)  | Yes                |
| `reasoning_enabled`           | No        | Yes           | No (integriert) | No                 |
| `active_speaker_detection`    | Yes       | Yes           | Yes             | Yes                |

Nicht unterstützte Optionen werden ignoriert, wenn sie in einer Anfrage enthalten sind.

### WICHTIG: Preise unterscheiden sich je Modell

Jedes lipsync-Modell hat UNTERSCHIEDLICHE Preise pro Sekunde. Gehe NICHT davon aus, dass alle Modelle gleich viel kosten:

* lipsync-1.9.0-beta: $0.02 -- $0.025/sec (günstigstes)
* lipsync-2: $0.04 -- $0.05/sec (2x mehr als 1.9.0-beta)
* lipsync-2-pro: $0.067 -- $0.083/sec (Premium-Qualität lipsync)
* sync-3: $0.107 -- $0.133/sec (leistungsstärkstes, 4K nativ, integrierte Obstruction Detection)
* react-1: $0.133 -- $0.167/sec (ausdrucksstarke Emotionen, erfordert bezahltes Abonnement)
  Die Preisberechnung erfolgt immer pro Sekunde des Output-Videos bei 25 fps. Höhere Tiers erhalten Nutzungsrabatte.