Zur Navigation springen

Tipps zu Medieninhalten

Die Qualität Ihrer Eingabemedien hat einen direkten Einfluss auf die endgültige Lipsync-Ausgabe. Um optimale Ergebnisse zu erzielen, befolgen Sie bitte diese Tipps zur Vorbereitung Ihrer Video- und Audioinhalte.

Tipps für Videoinhalte

Vermeiden Sie Profilansichten und Hindernisse

Um eine optimale Leistung zu erzielen, vermeiden Sie Vollprofilaufnahmen (Seitenansicht) und Hindernisse, die das Gesicht verdecken.

Sorgen Sie für eine natürliche Sprechbewegung

Das Modell funktioniert am besten, wenn die Figur im Video natürlich zu sprechen scheint. Dadurch bleibt der Stil des Sprechers während der lip sync erhalten.

Tipp für KI-generiertes Video: Fügen Sie beim Erstellen von Videos mit KI-Videogenerierungsmodellen von Drittanbietern diese Anweisung in die Textaufforderung ein: "the character should be speaking naturally". Das generierte KI-Video weist einige zufällige Mundbewegungen auf, die notwendig sind, um mit unserem lip syncsmodell die besten Ergebnisse zu erzielen.

Tipps für Audioinhalte

Verwenden Sie klares Audio

Um eine optimale Leistung zu erzielen, vermeiden Sie Audio mit Musik, Hintergrundgeräuschen oder mehreren gleichzeitigen Lautsprechern.

Optionen für den Synchronisierungsmodus

Wenn Ihr Video und Ihr Audio unterschiedlich lang sind, können Sie mithilfe des Parameters sync_mode auswählen, wie mit der Nichtübereinstimmung umgegangen werden soll. Die vollständige Verhaltensmatrix und Beispiele für die Ausgabedauer finden Sie im Sync-Modus-Leitfaden.

Der Synchronisierungsmodus gilt nur für Videoeingänge. Bei Bildeingaben (sync-3) wird der Synchronisierungsmodus ignoriert, da Bilder keine intrinsische Dauer haben, die mit dem Audio verglichen werden kann.

prallen

Wenn das Video kürzer als der Ton ist, wird die Wiedergabe des Videos am Ende umgekehrt, um der Audiodauer zu entsprechen. Andernfalls wird das Video so zugeschnitten, dass es mit dem Audio übereinstimmt.

Schleife

Wenn das Video kürzer als das Audio ist, wird das Video von Anfang an wiederholt, um der Audiodauer zu entsprechen. Andernfalls wird das Video so zugeschnitten, dass es mit dem Audio übereinstimmt.

abgeschnitten

Wenn der Ton länger als das Video ist, wird der Ton abgeschnitten, um der Videodauer zu entsprechen. Andernfalls wird das Video so zugeschnitten, dass es mit dem Audio übereinstimmt.

Schweigen

Wenn das Video länger als der Ton ist, wird dem Ton Stille hinzugefügt, um der Videodauer zu entsprechen. Wenn Audio länger als Video ist, behält die Ausgabe die volle Audiodauer bei.

neu zuordnen

Die Videowiedergabegeschwindigkeit wird so angepasst (beschleunigt oder verlangsamt), dass sie genau mit der Audiodauer übereinstimmt, sodass alle Inhalte beider erhalten bleiben.

Standard-Sync Labs-Modus: Die Standardeinstellung hängt von Ihrem Generierungstyp und der Video-/Audiodauer ab: - Nicht segmentierte Generationen: - Video länger als Audio: cut_off ist die Standardeinstellung - Audio länger als Video: bounce ist die Standardeinstellung - Segmentierte Generationen (mit segments_secs oder segments_frames): remap ist die Standardeinstellung, empfohlen, um abrupte Schnitte mitten im Video zu vermeiden.

Auswahl des richtigen Sync Labs-Modus: Verwenden Sie bounce oder loop für kurze Videos mit längerem Ton, cut_off, wenn Sie die Videolänge priorisieren möchten, silence, wenn Sie das gesamte Video erhalten möchten, und remap, wenn Sie alle Video- und Audioinhalte beibehalten müssen.

Verwandte Ressourcen - Unterstützung für Medienformate - unterstützte Video- und Audioformate, Codecs und empfohlene Eingabeeigenschaften - Lipsync-Modell - Erfahren Sie mehr über die verfügbaren lip sync-Modelle und wie sich die Eingabequalität auf die Ausgabe auswirkt