Saltar a la navegación

Modelos lipsync

Sync Labs ofrece una familia de modelos lipsync para distintas necesidades de calidad y velocidad. sync-3 es nuestro modelo mas potente, con salida nativa 4K y deteccion de obstrucciones integrada. lipsync-2-pro ofrece superresolucion basada en difusion para detalle facial fino. lipsync-2 equilibra calidad y velocidad para uso general. Los precios van de $0.04/sec (lipsync-2) a $0.133/sec (sync-3) a 25 fps. Explora y compara las capacidades de los distintos modelos a continuacion.

Funcionlipsync-2lipsync-2-prosync-3
DescripcionNuestro modelo de lipsyncing mas natural hasta ahora. El primer modelo que puede preservar el estilo de habla unico de cada hablante.Nuestro modelo de lipsyncing de mayor calidad, con superresolucion basada en difusion. Preservacion mejorada de detalle para barbas, dientes y rasgos faciales.Nuestro modelo lipsync mas potente. Procesa la toma completa a la vez con deteccion de obstrucciones integrada, salida nativa 4K y soporte para angulos extremos y rostros parciales.
Precio @ 25fps$0.04 - $0.05/sec$0.067 - $0.083/sec$0.107 - $0.133/sec
Precision
Velocidad
EstiloMovimientos de labios en el estilo unico del hablanteMovimientos de labios en el estilo unico del hablante con detalle y fidelidad mejoradosPreservacion completa del estilo y la emocion del hablante, con mayor comprension espacial
Preservacion de identidad
Dientes
Deteccion de rostro
Integracion de rostro
Robustez de pose
Barba
Resolucion de rostro512×512512×512 con preservacion de detalle mejoradaSalida nativa 4K con superresolucion integrada
Mejor paraMejor lipsync para la mayoria de los videosMejor que lo mejor. lipsync-2 con calidad premium, muy recomendado para necesidades profesionales. Genera sin problemas detalles faciales con barbas, arrugas y dientes.Lipsync de nivel produccion. Maneja close-ups, tomas de perfil, obstrucciones y escenas complejas donde otros modelos tienen dificultades.

Estos modelos publicos estan disponibles tanto en Studio como en API.

Opciones avanzadas

No todas las opciones avanzadas estan disponibles en todos los modelos. La tabla siguiente muestra que opciones puedes configurar para cada modelo lipsync.

Opcionlipsync-2lipsync-2-prosync-3
temperature✓✓- (gestionada de forma nativa)
occlusion_detection_enabled✓✓- (automatica)
reasoning_enabled-✓- (integrada)
active_speaker_detection✓✓✓

Las opciones marcadas con ”-” no estan admitidas o el modelo las maneja automaticamente. Si incluyes una opcion no admitida en tu solicitud, se ignorara.

  • Temperature: Controla la expresividad de los movimientos de labios (0 a 1, valor predeterminado 0.5). Disponible en lipsync-2 y lipsync-2-pro. sync-3 gestiona la expresividad de forma nativa.
  • Obstruction Detection: Para contenido de video desafiante donde los rostros pueden estar parcialmente ocultos por objetos, manos u otros elementos, puedes activar obstruction detection en lipsync-2 y lipsync-2-pro. Esta funcion mejora la precision de deteccion de rostro en escenas complejas, pero reduce la velocidad de generacion. sync-3 maneja obstrucciones automaticamente, sin configuracion necesaria.
  • Reasoning: Analisis de frames mejorado para artefactos y edge cases. Disponible en lipsync-2-pro. sync-3 incluye esta capacidad de forma nativa.
  • Active Speaker Detection: Detecta automaticamente y aplica lipsync solo a hablantes activos en videos con varias personas. Disponible en todos los modelos lipsync.

Advertencias

  • Limitacion de frame fijo: lipsync-2 y lipsync-2-pro requieren movimiento natural de habla en el video de entrada para funcionar correctamente. Si tu video contiene segmentos con frames fijos (donde el hablante no se mueve ni habla activamente), lipsync no funcionara durante esas partes, aunque haya audio presente. Estos modelos usan chunks independientes de 2 segundos para la inferencia y necesitan detectar un estilo de habla natural para generar movimientos de labios adecuados. Los segmentos de video estaticos o fijos no proporcionan las senales visuales necesarias para que el modelo cree una sincronizacion labial realista. sync-3 puede abrir labios silenciosos para alinearlos con el audio, aunque los resultados son genericos en lugar de coincidir con el estilo del hablante. Recomendacion: Para obtener mejores resultados con lipsync-2 y lipsync-2-pro, asegurate de que el video de entrada muestre al hablante hablando activamente durante toda la duracion en la que quieres aplicar lipsync.

Modelos legacy

lipsync-1.9.0-beta es nuestro modelo lipsync legacy rapido para videos simples. Usa movimientos de labios genericos estandar y es la opcion mas rapida disponible a $0.02 - $0.025/sec a 25 fps. Aunque sigue teniendo soporte, recomendamos lipsync-2 o modelos mas nuevos para mejor precision y preservacion de estilo.

FAQs

El personaje en el video de entrada debe parecer que esta hablando. Nuestros modelos aprenden a imitar el estilo de habla del video de entrada. Si el personaje esta completamente estatico, es posible que el modelo tampoco genere labios que se muevan. sync-3 puede abrir labios silenciosos, pero para obtener los resultados mas naturales la entrada deberia mostrar algo de movimiento de habla.

Solucion: Cuando crees tu video generado con IA, agrega el prompt de texto “person is speaking naturally” a tu generacion. Esto creara personajes con labios que ya se estan moviendo, lo que funcionara mucho mejor con nuestra plataforma.

Absolutamente. Para la mejor calidad, empieza con sync-3; para la mayoria de trabajos estandar de lip sync de canciones, lipsync-2 es un buen valor predeterminado. Para obtener mejores resultados, asegurate de aislar y subir la pista vocal, ya que los sonidos instrumentales a veces pueden interferir con la calidad del lipsync.

Puedes hacer lipsync en rostros parecidos a humanos, pero nuestros modelos actualmente no admiten animales ni personajes no humanoides.

Revisa si los segmentos problematicos tienen:

  • Varios hablantes en el frame
  • Rostros demasiado pequenos o en vista de perfil
  • Segmentos donde el hablante del video de entrada no esta hablando
  • Rostros parcialmente obstruidos por objetos, manos u otros elementos

Para varias personas, intenta enmascarar o recortar algunos rostros con herramientas externas. Para problemas de obstruccion, sync-3 maneja obstrucciones automaticamente. En lipsync-2 y lipsync-2-pro, activa la opcion occlusion_detection_enabled en tu solicitud de generacion para mejorar la deteccion de rostro en escenas complejas (aunque ralentizara el procesamiento).

Los rostros en perfil extremo pueden producir resultados inferiores en lipsync-2 y lipsync-2-pro. sync-3 admite de forma nativa angulos de rostro extremos, incluidos perfiles, tomas sobre el hombro y posiciones de labios no frontales. Si trabajas con angulos dificiles, sync-3 es tu mejor opcion.

lipsync-2 y lipsync-2-pro generan rostros a resolucion 512×512, lo que suele ser suficiente para la mayoria de videos 1080p. Si el rostro en tu video de entrada es bastante grande, podrias notar diferencias de resolucion. lipsync-2-pro ofrece preservacion de detalle mejorada para barbas, dientes y rasgos faciales finos. sync-3 genera a resolucion nativa 4K con superresolucion integrada, por lo que la perdida de resolucion no es un problema.

lipsync-2-pro usa tecnologia avanzada de superresolucion basada en difusion en lugar de enfoques tradicionales basados en GAN. Esto produce:

  • Resolucion de barba mejorada: Mejor manejo del vello facial sin desenfoque
  • Generacion de dientes mejorada: Dientes mas consistentes y naturales entre frames
  • Preservacion de detalle superior: Mayor calidad alrededor de la region de la boca y los rasgos faciales
  • Mejor manejo del tamano del rostro: Puede procesar regiones de rostro mas grandes (hasta 350×350 pixeles) sin degradacion de calidad

La contrapartida es un tiempo de procesamiento mas lento (1.5-2x mas lento que lipsync-2) y mayor costo, por lo que es ideal para aplicaciones de calidad premium donde se requiere la maxima fidelidad.

sync-3 es una arquitectura fundamentalmente distinta. En lugar de procesar video en pequenos chunks independientes, sync-3 construye una comprension global de la persona a lo largo de toda la toma y genera todos los frames a la vez. Esto le da:

  • Consistencia de largo alcance: Sin artefactos de limites de chunks ni parpadeo
  • Deteccion de obstrucciones integrada: Maneja automaticamente manos, microfonos, bufandas y otros objetos que bloquean el rostro
  • Soporte para angulos extremos: Tomas de perfil, sobre el hombro y angulos no frontales funcionan de forma nativa
  • Salida nativa 4K: Superresolucion integrada sin perdida de calidad
  • Preservacion de emocion y estilo: Preserva la cadencia, expresion y actuacion emocional del hablante

sync-3 ofrece una calidad significativamente mayor a un precio mas alto que refleja su pipeline de procesamiento avanzado.

La duracion maxima de video depende de tu plan de suscripcion, desde 1 minuto en Hobbyist hasta 30 minutos en planes Scale+. Consulta la pagina de precios para ver el limite de tu plan.

Cada modelo lipsync tiene precios por segundo diferentes a 25 fps. El precio no es igual en todos los modelos:

ModeloTarifa por segundo (a 25 fps)
lipsync-1.9.0-beta$0.02 — $0.025/sec
lipsync-2$0.04 — $0.05/sec
lipsync-2-pro$0.067 — $0.083/sec
sync-3$0.107 — $0.133/sec

lipsync-2 cuesta aproximadamente 2x mas que lipsync-1.9.0-beta, lipsync-2-pro cuesta aproximadamente 1.7x mas que lipsync-2 y sync-3 es el modelo de mayor calidad al precio mas alto. Elige segun tus requisitos de calidad y presupuesto. Consulta la pagina de facturación para ver todos los detalles.

Para lipsync-2 y lipsync-2-pro, los videos largos se dividen automaticamente en chunks de 30 a 40 segundos para procesarlos. Las generaciones pueden hacer timeout y fallar si tu video tiene demasiados cambios de escena dentro de estos chunks o si muchas escenas no contienen rostros detectables.

Esto ocurre porque el pipeline de procesamiento necesita detectar y seguir rostros a traves del video. Los cambios rapidos de escena o escenas sin rostros crean complejidad adicional que puede superar los limites de tiempo de procesamiento.

Para solucionarlo:

  • Reduce la cantidad de cortes de escena en tu video antes de subirlo
  • Asegurate de que los rostros sean visibles en la mayoria de los frames del video
  • Divide videos muy largos con muchas escenas en segmentos mas cortos y manejables

sync-3 procesa las tomas de forma diferente y puede manejar mejor algunos de estos escenarios, aunque los videos muy largos con cambios de escena frecuentes aun pueden ser desafiantes.