> For the documentation index, fetch https://sync.so/docs/llms.txt. Append .md to a page URL for Markdown. Documentation-search MCP: https://sync.so/docs/_mcp/server.

# Modelos lipsync

> Compara los modelos de lip sync con IA de sync. labs: sync-3, lipsync-2 y lipsync-2-pro. Funciones, precios, comparaciones de calidad y mejores casos de uso para cada modelo.

Sync Labs ofrece una familia de modelos lipsync para distintas necesidades de calidad y velocidad. sync-3 es nuestro modelo mas potente, con salida nativa 4K y deteccion de obstrucciones integrada. lipsync-2-pro ofrece superresolucion basada en difusion para detalle facial fino. lipsync-2 equilibra calidad y velocidad para uso general. Los precios van de \$0.04/sec (lipsync-2) a \$0.133/sec (sync-3) a 25 fps. Explora y compara las capacidades de los distintos modelos a continuacion.

| Funcion                       |                                                               lipsync-2                                                               |                                                                               lipsync-2-pro                                                                              |                                                                                         sync-3                                                                                        |
| :---------------------------- | :-----------------------------------------------------------------------------------------------------------------------------------: | :----------------------------------------------------------------------------------------------------------------------------------------------------------------------: | :-----------------------------------------------------------------------------------------------------------------------------------------------------------------------------------: |
| **Descripcion**               | Nuestro modelo de lipsyncing mas natural hasta ahora. El primer modelo que puede preservar el estilo de habla unico de cada hablante. |      Nuestro modelo de lipsyncing de mayor calidad, con superresolucion basada en difusion. Preservacion mejorada de detalle para barbas, dientes y rasgos faciales.     | Nuestro modelo lipsync mas potente. Procesa la toma completa a la vez con deteccion de obstrucciones integrada, salida nativa 4K y soporte para angulos extremos y rostros parciales. |
| **Precio @ 25fps**            |                                                          \$0.04 - \$0.05/sec                                                          |                                                                           \$0.067 - \$0.083/sec                                                                          |                                                                                 \$0.107 - \$0.133/sec                                                                                 |
| **Precision**                 |                                                                                                                                       |                                                                                                                                                                          |                                                                                                                                                                                       |
| **Velocidad**                 |                                                                                                                                       |                                                                                                                                                                          |                                                                                                                                                                                       |
| **Estilo**                    |                                         Movimientos de labios en el estilo unico del hablante                                         |                                          Movimientos de labios en el estilo unico del hablante con detalle y fidelidad mejorados                                         |                                               Preservacion completa del estilo y la emocion del hablante, con mayor comprension espacial                                              |
| **Preservacion de identidad** |                                                                                                                                       |                                                                                                                                                                          |                                                                                                                                                                                       |
| **Dientes**                   |                                                                                                                                       |                                                                                                                                                                          |                                                                                                                                                                                       |
| **Deteccion de rostro**       |                                                                                                                                       |                                                                                                                                                                          |                                                                                                                                                                                       |
| **Integracion de rostro**     |                                                                                                                                       |                                                                                                                                                                          |                                                                                                                                                                                       |
| **Robustez de pose**          |                                                                                                                                       |                                                                                                                                                                          |                                                                                                                                                                                       |
| **Barba**                     |                                                                                                                                       |                                                                                                                                                                          |                                                                                                                                                                                       |
| **Resolucion de rostro**      |                                                                512×512                                                                |                                                               512×512 con preservacion de detalle mejorada                                                               |                                                                     Salida nativa 4K con superresolucion integrada                                                                    |
| **Mejor para**                |                                              Mejor lipsync para la mayoria de los videos                                              | Mejor que lo mejor. lipsync-2 con calidad premium, muy recomendado para necesidades profesionales. Genera sin problemas detalles faciales con barbas, arrugas y dientes. |                       Lipsync de nivel produccion. Maneja close-ups, tomas de perfil, obstrucciones y escenas complejas donde otros modelos tienen dificultades.                      |

Estos modelos publicos estan disponibles tanto en [Studio](https://sync.so/login) como en [API](/api-reference).

## Opciones avanzadas

No todas las opciones avanzadas estan disponibles en todos los modelos. La tabla siguiente muestra que opciones puedes configurar para cada modelo lipsync.

| Opcion                        | lipsync-2 | lipsync-2-pro |             sync-3             |
| :---------------------------- | :-------: | :-----------: | :----------------------------: |
| `temperature`                 |     ✓     |       ✓       | - (gestionada de forma nativa) |
| `occlusion_detection_enabled` |     ✓     |       ✓       |         - (automatica)         |
| `reasoning_enabled`           |     -     |       ✓       |          - (integrada)         |
| `active_speaker_detection`    |     ✓     |       ✓       |                ✓               |

Las opciones marcadas con "-" no estan admitidas o el modelo las maneja automaticamente. Si incluyes una opcion no admitida en tu solicitud, se ignorara.

* **Temperature**: Controla la expresividad de los movimientos de labios (0 a 1, valor predeterminado 0.5). Disponible en lipsync-2 y lipsync-2-pro. sync-3 gestiona la expresividad de forma nativa.
* **Obstruction Detection**: Para contenido de video desafiante donde los rostros pueden estar parcialmente ocultos por objetos, manos u otros elementos, puedes activar obstruction detection en lipsync-2 y lipsync-2-pro. Esta funcion mejora la precision de deteccion de rostro en escenas complejas, pero reduce la velocidad de generacion. sync-3 maneja obstrucciones automaticamente, sin configuracion necesaria.
* **Reasoning**: Analisis de frames mejorado para artefactos y edge cases. Disponible en lipsync-2-pro. sync-3 incluye esta capacidad de forma nativa.
* **Active Speaker Detection**: Detecta automaticamente y aplica lipsync solo a hablantes activos en videos con varias personas. Disponible en todos los modelos lipsync.

## Advertencias

* **Limitacion de frame fijo**: lipsync-2 y lipsync-2-pro requieren movimiento natural de habla en el video de entrada para funcionar correctamente. Si tu video contiene segmentos con frames fijos (donde el hablante no se mueve ni habla activamente), lipsync no funcionara durante esas partes, aunque haya audio presente.
  Estos modelos usan chunks independientes de 2 segundos para la inferencia y necesitan detectar un estilo de habla natural para generar movimientos de labios adecuados. Los segmentos de video estaticos o fijos no proporcionan las senales visuales necesarias para que el modelo cree una sincronizacion labial realista.
  sync-3 puede abrir labios silenciosos para alinearlos con el audio, aunque los resultados son genericos en lugar de coincidir con el estilo del hablante.
  **Recomendacion**: Para obtener mejores resultados con lipsync-2 y lipsync-2-pro, asegurate de que el video de entrada muestre al hablante hablando activamente durante toda la duracion en la que quieres aplicar lipsync.

## Modelos legacy

**lipsync-1.9.0-beta** es nuestro modelo lipsync legacy rapido para videos simples. Usa movimientos de labios genericos estandar y es la opcion mas rapida disponible a \$0.02 - \$0.025/sec a 25 fps. Aunque sigue teniendo soporte, recomendamos lipsync-2 o modelos mas nuevos para mejor precision y preservacion de estilo.

## FAQs

#### Por que el movimiento de labios de mi personaje generado con IA no funciona correctamente?

El personaje en el video de entrada debe parecer que esta hablando. Nuestros modelos aprenden a imitar el estilo de habla del video de entrada. Si el personaje esta completamente estatico, es posible que el modelo tampoco genere labios que se muevan. sync-3 puede abrir labios silenciosos, pero para obtener los resultados mas naturales la entrada deberia mostrar algo de movimiento de habla.

**Solucion:** Cuando crees tu video generado con IA, agrega el prompt de texto "*person is speaking naturally*" a tu generacion. Esto creara personajes con labios que ya se estan moviendo, lo que funcionara mucho mejor con nuestra plataforma.

#### Puedo usar sync para hacer lipsync de una cancion a un personaje?

Absolutamente. Para la mejor calidad, empieza con sync-3; para la mayoria de trabajos estandar de lip sync de canciones, lipsync-2 es un buen valor predeterminado. Para obtener mejores resultados, asegurate de aislar y subir la pista vocal, ya que los sonidos instrumentales a veces pueden interferir con la calidad del lipsync.

#### sync funciona con rostros de animales o personajes no humanos?

Puedes hacer lipsync en rostros parecidos a humanos, pero nuestros modelos actualmente no admiten animales ni personajes no humanoides.

#### Por que la calidad del lipsync es mala o inexistente en ciertas partes de mi video?

Revisa si los segmentos problematicos tienen:

* Varios hablantes en el frame
* Rostros demasiado pequenos o en vista de perfil
* Segmentos donde el hablante del video de entrada no esta hablando
* Rostros parcialmente obstruidos por objetos, manos u otros elementos

Para varias personas, intenta enmascarar o recortar algunos rostros con herramientas externas. Para problemas de obstruccion, [sync-3](/models/sync-3) maneja obstrucciones automaticamente. En lipsync-2 y lipsync-2-pro, activa la opcion `occlusion_detection_enabled` en tu solicitud de generacion para mejorar la deteccion de rostro en escenas complejas (aunque ralentizara el procesamiento).

#### Por que mi video tiene lipsync de baja calidad cuando los rostros estan de perfil?

Los rostros en perfil extremo pueden producir resultados inferiores en lipsync-2 y lipsync-2-pro. sync-3 admite de forma nativa angulos de rostro extremos, incluidos perfiles, tomas sobre el hombro y posiciones de labios no frontales. Si trabajas con angulos dificiles, sync-3 es tu mejor opcion.

#### Por que el rostro generado parece tener menor resolucion que mi video de entrada?

lipsync-2 y lipsync-2-pro generan rostros a resolucion 512×512, lo que suele ser suficiente para la mayoria de videos 1080p. Si el rostro en tu video de entrada es bastante grande, podrias notar diferencias de resolucion. lipsync-2-pro ofrece preservacion de detalle mejorada para barbas, dientes y rasgos faciales finos. sync-3 genera a resolucion nativa 4K con superresolucion integrada, por lo que la perdida de resolucion no es un problema.

#### Que hace diferente a lipsync-2-pro frente a otros modelos?

lipsync-2-pro usa tecnologia avanzada de superresolucion basada en difusion en lugar de enfoques tradicionales basados en GAN. Esto produce:

* **Resolucion de barba mejorada**: Mejor manejo del vello facial sin desenfoque
* **Generacion de dientes mejorada**: Dientes mas consistentes y naturales entre frames
* **Preservacion de detalle superior**: Mayor calidad alrededor de la region de la boca y los rasgos faciales
* **Mejor manejo del tamano del rostro**: Puede procesar regiones de rostro mas grandes (hasta 350×350 pixeles) sin degradacion de calidad

La contrapartida es un tiempo de procesamiento mas lento (1.5-2x mas lento que lipsync-2) y mayor costo, por lo que es ideal para aplicaciones de calidad premium donde se requiere la maxima fidelidad.

#### Que hace diferente a sync-3 frente a lipsync-2-pro?

sync-3 es una arquitectura fundamentalmente distinta. En lugar de procesar video en pequenos chunks independientes, sync-3 construye una comprension global de la persona a lo largo de toda la toma y genera todos los frames a la vez. Esto le da:

* **Consistencia de largo alcance**: Sin artefactos de limites de chunks ni parpadeo
* **Deteccion de obstrucciones integrada**: Maneja automaticamente manos, microfonos, bufandas y otros objetos que bloquean el rostro
* **Soporte para angulos extremos**: Tomas de perfil, sobre el hombro y angulos no frontales funcionan de forma nativa
* **Salida nativa 4K**: Superresolucion integrada sin perdida de calidad
* **Preservacion de emocion y estilo**: Preserva la cadencia, expresion y actuacion emocional del hablante

sync-3 ofrece una calidad significativamente mayor a un precio mas alto que refleja su pipeline de procesamiento avanzado.

#### Cual es la duracion maxima de video?

La duracion maxima de video depende de tu plan de suscripcion, desde 1 minuto en Hobbyist hasta 30 minutos en planes Scale+. Consulta la [pagina de precios](https://sync.so/pricing) para ver el limite de tu plan.

#### Cuanto cuesta cada modelo lipsync?

Cada modelo lipsync tiene precios por segundo diferentes a 25 fps. El precio **no** es igual en todos los modelos:

| Modelo             | Tarifa por segundo (a 25 fps) |
| :----------------- | :---------------------------- |
| lipsync-1.9.0-beta | \$0.02 -- \$0.025/sec         |
| lipsync-2          | \$0.04 -- \$0.05/sec          |
| lipsync-2-pro      | \$0.067 -- \$0.083/sec        |
| sync-3             | \$0.107 -- \$0.133/sec        |

lipsync-2 cuesta aproximadamente 2x mas que lipsync-1.9.0-beta, lipsync-2-pro cuesta aproximadamente 1.7x mas que lipsync-2 y sync-3 es el modelo de mayor calidad al precio mas alto. Elige segun tus requisitos de calidad y presupuesto. Consulta la pagina de [facturación](/product/facturación) para ver todos los detalles.

#### Por que fallo mi generacion de video largo despues de procesar durante mucho tiempo?

Para lipsync-2 y lipsync-2-pro, los videos largos se dividen automaticamente en chunks de 30 a 40 segundos para procesarlos. Las generaciones pueden hacer timeout y fallar si tu video tiene demasiados cambios de escena dentro de estos chunks o si muchas escenas no contienen rostros detectables.

Esto ocurre porque el pipeline de procesamiento necesita detectar y seguir rostros a traves del video. Los cambios rapidos de escena o escenas sin rostros crean complejidad adicional que puede superar los limites de tiempo de procesamiento.

Para solucionarlo:

* Reduce la cantidad de cortes de escena en tu video antes de subirlo
* Asegurate de que los rostros sean visibles en la mayoria de los frames del video
* Divide videos muy largos con muchas escenas en segmentos mas cortos y manejables

sync-3 procesa las tomas de forma diferente y puede manejar mejor algunos de estos escenarios, aunque los videos muy largos con cambios de escena frecuentes aun pueden ser desafiantes.

## Referencia de modelos lipsync

### Model IDs y precios (a 25fps)

| Model ID             | Precio por segundo   | Velocidad        | Mejor para                                                                                                                   |
| -------------------- | -------------------- | ---------------- | ---------------------------------------------------------------------------------------------------------------------------- |
| `lipsync-2`          | $0.04 -- $0.05/sec   | Rapido (4/5)     | Lipsync rapido, rentable y con calidad solida                                                                                |
| `lipsync-2-pro`      | $0.067 -- $0.083/sec | Moderado (3/5)   | Calidad premium con superresolucion basada en difusion, ideal para barbas, dientes y rasgos faciales                         |
| `sync-3`             | $0.107 -- $0.133/sec | Rapido (4/5)     | Modelo mas potente. Salida nativa 4K, deteccion de obstrucciones integrada, angulos extremos, procesamiento de toma completa |
| `lipsync-1.9.0-beta` | $0.02 -- $0.025/sec  | Mas rapido (5/5) | Modelo legacy. Lipsync rapido para videos simples                                                                            |

### Cuando usar cada modelo

| Escenario                                      | Modelo recomendado            |
| ---------------------------------------------- | ----------------------------- |
| Uso general, la mayoria de videos              | `lipsync-2`                   |
| Necesidades profesionales o de calidad premium | `lipsync-2-pro`               |
| Nivel produccion, escenas complejas            | `sync-3`                      |
| Close-ups, tomas de perfil, obstrucciones      | `sync-3`                      |
| Se necesita salida 4K                          | `sync-3`                      |
| Barbas, dientes, detalle facial fino           | `lipsync-2-pro` o `sync-3`    |
| Sensible a costo, videos simples               | `lipsync-1.9.0-beta` (legacy) |

### Benchmarks de velocidad (relativos)

* lipsync-2: \~1x baseline
* sync-3: Rapido (4/5)
* lipsync-2-pro: 1.5--2x mas lento que lipsync-2
* lipsync-1.9.0-beta: Modelo legacy

### Especificaciones clave

* Resolucion de rostro: 512x512 para lipsync-2/lipsync-2-pro, 4K nativo para sync-3
* Todos los modelos disponibles via API (`/v2/generate`) y Studio
* Deteccion de obstrucciones: integrada para sync-3, opcional (`occlusion_detection_enabled`) para lipsync-2/lipsync-2-pro
* Limitacion de frame fijo: aplica a lipsync-2/lipsync-2-pro (sync-3 puede abrir labios silenciosos)

### Opciones avanzadas por modelo

| Opcion                        | lipsync-2 | lipsync-2-pro | sync-3         | lipsync-1.9.0-beta |
| ----------------------------- | --------- | ------------- | -------------- | ------------------ |
| `temperature`                 | Yes       | Yes           | No (native)    | No                 |
| `occlusion_detection_enabled` | Yes       | Yes           | No (automatic) | Yes                |
| `reasoning_enabled`           | No        | Yes           | No (built-in)  | No                 |
| `active_speaker_detection`    | Yes       | Yes           | Yes            | Yes                |

Las opciones no admitidas se ignoran si se incluyen en una solicitud.

### IMPORTANTE: Los precios varian por modelo

Cada modelo lipsync tiene precios por segundo DIFERENTES. NO asumas que todos los modelos cuestan lo mismo:

* lipsync-1.9.0-beta: $0.02 -- $0.025/sec (mas barato)
* lipsync-2: $0.04 -- $0.05/sec (2x mas que 1.9.0-beta)
* lipsync-2-pro: $0.067 -- $0.083/sec (lipsync de calidad premium)
* sync-3: $0.107 -- $0.133/sec (mas potente, 4K nativo, deteccion de obstrucciones integrada)
* react-1: $0.133 -- $0.167/sec (emociones expresivas, requiere suscripcion paga)
  El precio siempre es por segundo de video de salida a 25 fps. Los niveles superiores reciben descuentos de uso.