> For the documentation index, fetch https://sync.so/docs/llms.txt. Append .md to a page URL for Markdown. Documentation-search MCP: https://sync.so/docs/_mcp/server.

# Modelos de Lipsync

> Compare os modelos de lip sync da sync. labs: sync-3, lipsync-2 e lipsync-2-pro. Recursos, preços, comparações de qualidade e melhores casos de uso para cada modelo.

Sync Labs oferece uma família de modelos de lipsync para diferentes necessidades de qualidade e velocidade. sync-3 é nosso modelo mais poderoso com saída nativa em 4K e detecção de obstrução embutida. lipsync-2-pro oferece super resolução baseada em difusão para detalhes faciais finos. lipsync-2 equilibra qualidade e velocidade para uso geral. Os preços variam de \$0,04/seg (lipsync-2) a \$0,133/seg (sync-3) a 25 fps. Explore e compare as capacidades dos diferentes modelos abaixo.

| Recurso                       |                                                           lipsync-2                                                          |                                                                                   lipsync-2-pro                                                                                  |                                                                                        sync-3                                                                                        |
| :---------------------------- | :--------------------------------------------------------------------------------------------------------------------------: | :------------------------------------------------------------------------------------------------------------------------------------------------------------------------------: | :----------------------------------------------------------------------------------------------------------------------------------------------------------------------------------: |
| **Descrição**                 | Nosso modelo de lipsync mais natural até agora. O primeiro modelo que pode preservar o estilo único de fala de cada locutor. |     Nosso modelo de lipsync de mais alta qualidade com super resolução baseada em difusão. Preservação de detalhes aprimorada para barbas, dentes e características faciais.     | Nosso modelo de lipsync mais poderoso. Processa a cena completa de uma vez com detecção de obstrução embutida, saída nativa em 4K e suporte para ângulos extremos e rostos parciais. |
| **Preço @ 25fps**             |                                                      \$0,04 - \$0,05/seg                                                     |                                                                               \$0,067 - \$0,083/seg                                                                              |                                                                                 \$0,107 - \$0,133/seg                                                                                |
| **Precisão**                  |                                                                                                                              |                                                                                                                                                                                  |                                                                                                                                                                                      |
| **Velocidade**                |                                                                                                                              |                                                                                                                                                                                  |                                                                                                                                                                                      |
| **Estilo**                    |                                         Movimentos labiais no estilo único do locutor                                        |                                                Movimentos labiais no estilo único do locutor com detalhes e fidelidade aprimorados                                               |                                                Preservação completa do estilo e emoção do locutor com compreensão espacial mais ampla                                                |
| **Preservação de Identidade** |                                                                                                                              |                                                                                                                                                                                  |                                                                                                                                                                                      |
| **Dentes**                    |                                                                                                                              |                                                                                                                                                                                  |                                                                                                                                                                                      |
| **Detecção Facial**           |                                                                                                                              |                                                                                                                                                                                  |                                                                                                                                                                                      |
| **Mistura Facial**            |                                                                                                                              |                                                                                                                                                                                  |                                                                                                                                                                                      |
| **Robustez de Posição**       |                                                                                                                              |                                                                                                                                                                                  |                                                                                                                                                                                      |
| **Barba**                     |                                                                                                                              |                                                                                                                                                                                  |                                                                                                                                                                                      |
| **Resolução Facial**          |                                                            512×512                                                           |                                                                  512×512 com preservação de detalhes aprimorada                                                                  |                                                                    Saída nativa em 4K com super resolução embutida                                                                   |
| **Melhor para**               |                                           melhor lipsync para a maioria dos vídeos                                           | melhor que o melhor. lipsync-2 com qualidade premium, altamente recomendado para necessidades profissionais. Gera detalhes faciais com barbas, rugas e dentes de forma perfeita. |                         lipsync de nível de produção. Lida com close-ups, tomadas de perfil, obstruções e cenas complexas que outros modelos têm dificuldade.                        |

Esses modelos públicos estão disponíveis tanto no [Studio](https://sync.so/login) quanto na [API](/api-reference).

## Opções Avançadas

Nem todas as opções avançadas estão disponíveis em todos os modelos. A tabela abaixo mostra quais opções você pode configurar para cada modelo de lipsync.

| Opção                         | lipsync-2 | lipsync-2-pro |           sync-3           |
| :---------------------------- | :-------: | :-----------: | :------------------------: |
| `temperature`                 |     ✓     |       ✓       | - (gerenciado nativamente) |
| `occlusion_detection_enabled` |     ✓     |       ✓       |       - (automático)       |
| `reasoning_enabled`           |     -     |       ✓       |        - (embutido)        |
| `active_speaker_detection`    |     ✓     |       ✓       |              ✓             |

Opções marcadas com " - " não são suportadas ou são gerenciadas automaticamente pelo modelo. Se você incluir uma opção não suportada em sua solicitação, ela será ignorada.

* **Temperatura**: Controla a expressividade dos movimentos dos lábios (0 - 1, padrão 0.5). Disponível no lipsync-2 e lipsync-2-pro. sync-3 gerencia a expressividade nativamente.
* **Detecção de Obstrução**: Para conteúdo de vídeo desafiador onde os rostos podem estar parcialmente ocultos por objetos, mãos ou outros elementos, você pode habilitar a detecção de obstrução no lipsync-2 e lipsync-2-pro. Este recurso melhora a precisão da detecção facial em cenas complexas, mas vem com velocidades de geração mais lentas. sync-3 lida com obstruções automaticamente - nenhuma configuração necessária.
* **Raciocínio**: Análise de quadros aprimorada para artefatos e casos extremos. Disponível no lipsync-2-pro. sync-3 inclui essa capacidade nativamente.
* **Detecção de Locutor Ativo**: Detecta automaticamente e aplica lipsync apenas aos locutores ativos em vídeos com várias pessoas. Disponível em todos os modelos de lipsync.

## Advertências

* **Limitação de Quadro Estático**: lipsync-2 e lipsync-2-pro requerem movimento natural de fala no vídeo de entrada para funcionar corretamente. Se o seu vídeo contiver segmentos com quadros estáticos (onde o locutor não está se movendo ou falando ativamente), o lipsync não funcionará durante essas partes, mesmo que o áudio esteja presente.
  Esses modelos usam blocos independentes de 2 segundos para inferência e precisam detectar o estilo natural de fala para gerar movimentos dos lábios apropriados. Segmentos de vídeo estáticos ou parados não fornecem as pistas visuais necessárias para o modelo criar uma lip sync realista.
  sync-3 pode abrir lábios silenciosos para combinar com o áudio, embora os resultados sejam genéricos em vez de combinados com o estilo do locutor.
  **Recomendação**: Para melhores resultados com lipsync-2 e lipsync-2-pro, certifique-se de que seu vídeo de entrada mostre o locutor falando ativamente durante toda a duração que você deseja sincronizar.

## Modelos Legados

**lipsync-1.9.0-beta** é nosso modelo legado rápido de lipsync para vídeos simples. Ele usa movimentos dos lábios genéricos padrão e é a opção mais rápida disponível a \$0,02 - \$0,025/seg a 25 fps. Embora ainda seja suportado, recomendamos lipsync-2 ou modelos mais novos para melhor precisão e preservação de estilo.

## FAQs

#### Por que o movimento labial do meu personagem gerado por IA não está funcionando corretamente?

O personagem no vídeo de entrada precisa parecer que está falando. Nossos modelos aprendem a imitar o estilo de fala no vídeo de entrada. Se o personagem estiver completamente estático, o modelo pode não gerar lábios que se movem também. sync-3 pode abrir lábios silenciosos, mas para os resultados mais naturais, a entrada deve mostrar algum movimento de fala.

**Solução:** Ao criar seu vídeo gerado por IA, adicione o prompt de texto "*pessoa está falando naturalmente*" à sua geração. Isso criará personagens com lábios que já estão se movendo, o que funcionará muito melhor com nossa plataforma.

#### Posso usar sync para sincronizar uma música com um personagem?

Absolutamente. Para a melhor qualidade, comece com sync-3; para a maioria dos trabalhos padrão de sincronização de música com lábios, lipsync-2 é uma boa escolha. Para melhores resultados, certifique-se de isolar e fazer upload da faixa vocal, pois os sons instrumentais podem, às vezes, interferir na qualidade da lip sync.

#### O sync funciona com rostos de animais ou personagens não humanos?

Você pode sincronizar rostos humanóides, mas nossos modelos atualmente não suportam animais ou personagens não humanoides.

#### Por que a qualidade da lip sync é ruim ou inexistente em certas partes do meu vídeo?

Verifique se os segmentos problemáticos têm:

* Vários locutores no quadro
* Rostos muito pequenos ou em vista de perfil
* Segmentos onde o locutor no vídeo de entrada não está falando
* Rostos parcialmente obstruídos por objetos, mãos ou outros elementos

Para várias pessoas, tente mascarar ou recortar alguns rostos usando ferramentas externas. Para problemas de obstrução, [sync-3](/models/sync-3) lida com obstruções automaticamente. No lipsync-2 e lipsync-2-pro, habilite a opção `occlusion_detection_enabled` em sua solicitação de geração para melhor detecção facial em cenas complexas (embora isso diminua a velocidade de processamento).

#### Por que meu vídeo tem qualidade de lip sync ruim quando os rostos estão em vista de perfil?

Rostos em vista de perfil extrema podem levar a resultados abaixo do esperado no lipsync-2 e lipsync-2-pro. sync-3 suporta nativamente ângulos de rosto extremos, incluindo perfis, tomadas sobre o ombro e posições labiais não frontais. Se você estiver trabalhando com ângulos desafiadores, sync-3 é sua melhor opção.

#### Por que o rosto gerado parece ter resolução inferior ao meu vídeo de entrada?

lipsync-2 e lipsync-2-pro geram rostos em resolução 512×512, o que geralmente é suficiente para a maioria dos vídeos em 1080p. Se o rosto no seu vídeo de entrada for bastante grande, você pode notar algumas diferenças de resolução. lipsync-2-pro oferece preservação de detalhes aprimorada para barbas, dentes e características faciais finas. sync-3 gera em resolução nativa 4K com super resolução embutida, então a perda de resolução não é um problema.

#### O que torna o lipsync-2-pro diferente de outros modelos?

lipsync-2-pro usa tecnologia avançada de super resolução baseada em difusão em vez de abordagens tradicionais baseadas em GAN. Isso resulta em:

* **Resolução de barba aprimorada**: Melhor manuseio de pelos faciais sem borrões
* **Geração de dentes melhorada**: Dentes mais consistentes e com aparência natural em todos os quadros
* **Preservação de detalhes superior**: Qualidade aprimorada ao redor da região da boca e características faciais
* **Melhor manuseio de tamanho de rosto**: Pode processar regiões faciais maiores (até 350×350 pixels) sem degradação de qualidade

A desvantagem é o tempo de processamento mais lento (1,5-2x mais lento que lipsync-2) e custo mais alto, tornando-o ideal para aplicações de qualidade premium onde a mais alta fidelidade é necessária.

#### O que torna o sync-3 diferente do lipsync-2-pro?

sync-3 é uma arquitetura fundamentalmente diferente. Em vez de processar o vídeo em pequenos blocos independentes, sync-3 constrói uma compreensão global da pessoa em toda a cena e gera todos os quadros de uma vez. Isso lhe dá:

* **Consistência de longo alcance**: Sem artefatos de limite de bloco ou cintilação
* **Detecção de obstrução embutida**: Lida automaticamente com mãos, microfones, cachecóis e outros objetos bloqueando o rosto
* **Suporte a ângulos extremos**: Tomadas de perfil, sobre o ombro e ângulos não frontais funcionam nativamente
* **Saída nativa em 4K**: Super resolução embutida sem perda de qualidade
* **Preservação de emoção e estilo**: Preserva a cadência, expressão e performance emocional do locutor

sync-3 oferece qualidade significativamente superior a um preço mais alto, refletindo seu pipeline de processamento avançado.

#### Qual é a duração máxima do vídeo?

A duração máxima do vídeo depende do seu plano de assinatura - variando de 1 minuto no plano Hobbyist até 30 minutos nos planos Scale+. Veja a [página de preços](https://sync.so/pricing) para o limite do seu plano.

#### Quanto custa cada modelo de lipsync?

Cada modelo de lipsync tem preços diferentes por segundo a 25 fps. Os preços **não** são os mesmos entre os modelos:

| Modelo             | Taxa por segundo (a 25 fps) |
| :----------------- | :-------------------------- |
| lipsync-1.9.0-beta | \$0,02 -- \$0,025/seg       |
| lipsync-2          | \$0,04 -- \$0,05/seg        |
| lipsync-2-pro      | \$0,067 -- \$0,083/seg      |
| sync-3             | \$0,107 -- \$0,133/seg      |

lipsync-2 custa aproximadamente 2x mais que lipsync-1.9.0-beta, lipsync-2-pro custa aproximadamente 1,7x mais que lipsync-2, e sync-3 é o modelo de mais alta qualidade com o preço mais alto. Escolha com base em seus requisitos de qualidade e orçamento. Veja a página de [Faturamento](/product/cobrança) para detalhes completos.

#### Por que a geração do meu vídeo longo falhou após processar por muito tempo?

Para lipsync-2 e lipsync-2-pro, vídeos longos são automaticamente divididos em blocos de 30-40 segundos para processamento. As gerações podem expirar e falhar se o seu vídeo tiver muitas mudanças de cena dentro desses blocos ou se muitas cenas não contiverem rostos detectáveis.

Isso acontece porque o pipeline de processamento precisa detectar e rastrear rostos ao longo do vídeo. Mudanças rápidas de cena ou cenas sem rostos criam complexidade adicional que pode exceder os limites de tempo de processamento.

Para corrigir isso:

* Reduza o número de cortes de cena em seu vídeo antes de fazer o upload
* Certifique-se de que rostos sejam visíveis na maioria dos quadros do vídeo
* Divida vídeos muito longos com muitas cenas em segmentos mais curtos e gerenciáveis

sync-3 processa cenas de forma diferente e pode lidar melhor com alguns desses cenários, embora vídeos muito longos com mudanças frequentes de cena ainda possam ser desafiadores.

## Referência de Modelos de Lipsync

### IDs de Modelos e Preços (a 25fps)

| ID do Modelo         | Preço por segundo    | Velocidade        | Melhor Para                                                                                                                |
| -------------------- | -------------------- | ----------------- | -------------------------------------------------------------------------------------------------------------------------- |
| `lipsync-2`          | $0,04 -- $0,05/seg   | Rápido (4/5)      | Lipsync rápido e econômico com qualidade sólida                                                                            |
| `lipsync-2-pro`      | $0,067 -- $0,083/seg | Moderado (3/5)    | Qualidade premium com super resolução baseada em difusão, melhor para barbas, dentes, características faciais              |
| `sync-3`             | $0,107 -- $0,133/seg | Rápido (4/5)      | Modelo mais poderoso. Saída nativa em 4K, detecção de obstrução embutida, ângulos extremos, processamento de cena completa |
| `lipsync-1.9.0-beta` | $0,02 -- $0,025/seg  | Mais rápido (5/5) | Modelo legado. Lipsync rápido para vídeos simples                                                                          |

### Quando Usar Qual Modelo

| Cenário                                        | Modelo Recomendado            |
| ---------------------------------------------- | ----------------------------- |
| Propósito geral, maioria dos vídeos            | `lipsync-2`                   |
| Necessidades de qualidade profissional/premium | `lipsync-2-pro`               |
| Nível de produção, cenas complexas             | `sync-3`                      |
| Close-ups, tomadas de perfil, obstruções       | `sync-3`                      |
| Saída em 4K necessária                         | `sync-3`                      |
| Barbas, dentes, detalhes faciais finos         | `lipsync-2-pro` ou `sync-3`   |
| Sensível a custos, vídeos simples              | `lipsync-1.9.0-beta` (legado) |

### Benchmarks de Velocidade (relativos)

* lipsync-2: \~1x base
* sync-3: Rápido (4/5)
* lipsync-2-pro: 1,5--2x mais lento que lipsync-2
* lipsync-1.9.0-beta: Modelo legado

### Especificações Principais

* Resolução facial: 512x512 para lipsync-2/lipsync-2-pro, 4K nativo para sync-3
* Todos os modelos disponíveis via API (`/v2/generate`) e Studio
* Detecção de obstrução: embutida para sync-3, opcional (`occlusion_detection_enabled`) para lipsync-2/lipsync-2-pro
* Limitação de quadro estático: aplica-se a lipsync-2/lipsync-2-pro (sync-3 pode abrir lábios silenciosos)

### Opções Avançadas por Modelo

| Opção                         | lipsync-2 | lipsync-2-pro | sync-3           | lipsync-1.9.0-beta |
| ----------------------------- | --------- | ------------- | ---------------- | ------------------ |
| `temperature`                 | Sim       | Sim           | Não (nativo)     | Não                |
| `occlusion_detection_enabled` | Sim       | Sim           | Não (automático) | Sim                |
| `reasoning_enabled`           | Não       | Sim           | Não (embutido)   | Não                |
| `active_speaker_detection`    | Sim       | Sim           | Sim              | Sim                |

Opções não suportadas são ignoradas se incluídas em uma solicitação.

### IMPORTANTE: Preços Variam por Modelo

Cada modelo de lipsync tem preços DIFERENTES por segundo. NÃO assuma que todos os modelos custam o mesmo:

* lipsync-1.9.0-beta: $0,02 -- $0,025/seg (mais barato)
* lipsync-2: $0,04 -- $0,05/seg (2x mais que 1.9.0-beta)
* lipsync-2-pro: $0,067 -- $0,083/seg (lipsync de qualidade premium)
* sync-3: $0,107 -- $0,133/seg (mais poderoso, 4K nativo, detecção de obstrução embutida)
* react-1: $0,133 -- $0,167/seg (emoções expressivas, requer assinatura paga)
  Os preços são sempre por segundo de vídeo de saída a 25 fps. Tiers mais altos recebem descontos de uso.