Ir para a navegação

Modelos de Lipsync

Sync Labs oferece uma família de modelos de lipsync para diferentes necessidades de qualidade e velocidade. sync-3 é nosso modelo mais poderoso com saída nativa em 4K e detecção de obstrução embutida. lipsync-2-pro oferece super resolução baseada em difusão para detalhes faciais finos. lipsync-2 equilibra qualidade e velocidade para uso geral. Os preços variam de $0,04/seg (lipsync-2) a $0,133/seg (sync-3) a 25 fps. Explore e compare as capacidades dos diferentes modelos abaixo.

Recursolipsync-2lipsync-2-prosync-3
DescriçãoNosso modelo de lipsync mais natural até agora. O primeiro modelo que pode preservar o estilo único de fala de cada locutor.Nosso modelo de lipsync de mais alta qualidade com super resolução baseada em difusão. Preservação de detalhes aprimorada para barbas, dentes e características faciais.Nosso modelo de lipsync mais poderoso. Processa a cena completa de uma vez com detecção de obstrução embutida, saída nativa em 4K e suporte para ângulos extremos e rostos parciais.
Preço @ 25fps$0,04 - $0,05/seg$0,067 - $0,083/seg$0,107 - $0,133/seg
Precisão
Velocidade
EstiloMovimentos labiais no estilo único do locutorMovimentos labiais no estilo único do locutor com detalhes e fidelidade aprimoradosPreservação completa do estilo e emoção do locutor com compreensão espacial mais ampla
Preservação de Identidade
Dentes
Detecção Facial
Mistura Facial
Robustez de Posição
Barba
Resolução Facial512×512512×512 com preservação de detalhes aprimoradaSaída nativa em 4K com super resolução embutida
Melhor paramelhor lipsync para a maioria dos vídeosmelhor que o melhor. lipsync-2 com qualidade premium, altamente recomendado para necessidades profissionais. Gera detalhes faciais com barbas, rugas e dentes de forma perfeita.lipsync de nível de produção. Lida com close-ups, tomadas de perfil, obstruções e cenas complexas que outros modelos têm dificuldade.

Esses modelos públicos estão disponíveis tanto no Studio quanto na API.

Opções Avançadas

Nem todas as opções avançadas estão disponíveis em todos os modelos. A tabela abaixo mostra quais opções você pode configurar para cada modelo de lipsync.

Opçãolipsync-2lipsync-2-prosync-3
temperature✓✓- (gerenciado nativamente)
occlusion_detection_enabled✓✓- (automático)
reasoning_enabled-✓- (embutido)
active_speaker_detection✓✓✓

Opções marcadas com ” - ” não são suportadas ou são gerenciadas automaticamente pelo modelo. Se você incluir uma opção não suportada em sua solicitação, ela será ignorada.

  • Temperatura: Controla a expressividade dos movimentos dos lábios (0 - 1, padrão 0.5). Disponível no lipsync-2 e lipsync-2-pro. sync-3 gerencia a expressividade nativamente.
  • Detecção de Obstrução: Para conteúdo de vídeo desafiador onde os rostos podem estar parcialmente ocultos por objetos, mãos ou outros elementos, você pode habilitar a detecção de obstrução no lipsync-2 e lipsync-2-pro. Este recurso melhora a precisão da detecção facial em cenas complexas, mas vem com velocidades de geração mais lentas. sync-3 lida com obstruções automaticamente - nenhuma configuração necessária.
  • Raciocínio: Análise de quadros aprimorada para artefatos e casos extremos. Disponível no lipsync-2-pro. sync-3 inclui essa capacidade nativamente.
  • Detecção de Locutor Ativo: Detecta automaticamente e aplica lipsync apenas aos locutores ativos em vídeos com várias pessoas. Disponível em todos os modelos de lipsync.

Advertências

  • Limitação de Quadro Estático: lipsync-2 e lipsync-2-pro requerem movimento natural de fala no vídeo de entrada para funcionar corretamente. Se o seu vídeo contiver segmentos com quadros estáticos (onde o locutor não está se movendo ou falando ativamente), o lipsync não funcionará durante essas partes, mesmo que o áudio esteja presente. Esses modelos usam blocos independentes de 2 segundos para inferência e precisam detectar o estilo natural de fala para gerar movimentos dos lábios apropriados. Segmentos de vídeo estáticos ou parados não fornecem as pistas visuais necessárias para o modelo criar uma lip sync realista. sync-3 pode abrir lábios silenciosos para combinar com o áudio, embora os resultados sejam genéricos em vez de combinados com o estilo do locutor. Recomendação: Para melhores resultados com lipsync-2 e lipsync-2-pro, certifique-se de que seu vídeo de entrada mostre o locutor falando ativamente durante toda a duração que você deseja sincronizar.

Modelos Legados

lipsync-1.9.0-beta é nosso modelo legado rápido de lipsync para vídeos simples. Ele usa movimentos dos lábios genéricos padrão e é a opção mais rápida disponível a $0,02 - $0,025/seg a 25 fps. Embora ainda seja suportado, recomendamos lipsync-2 ou modelos mais novos para melhor precisão e preservação de estilo.

FAQs

O personagem no vídeo de entrada precisa parecer que está falando. Nossos modelos aprendem a imitar o estilo de fala no vídeo de entrada. Se o personagem estiver completamente estático, o modelo pode não gerar lábios que se movem também. sync-3 pode abrir lábios silenciosos, mas para os resultados mais naturais, a entrada deve mostrar algum movimento de fala.

Solução: Ao criar seu vídeo gerado por IA, adicione o prompt de texto “pessoa está falando naturalmente” à sua geração. Isso criará personagens com lábios que já estão se movendo, o que funcionará muito melhor com nossa plataforma.

Absolutamente. Para a melhor qualidade, comece com sync-3; para a maioria dos trabalhos padrão de sincronização de música com lábios, lipsync-2 é uma boa escolha. Para melhores resultados, certifique-se de isolar e fazer upload da faixa vocal, pois os sons instrumentais podem, às vezes, interferir na qualidade da lip sync.

Você pode sincronizar rostos humanóides, mas nossos modelos atualmente não suportam animais ou personagens não humanoides.

Verifique se os segmentos problemáticos têm:

  • Vários locutores no quadro
  • Rostos muito pequenos ou em vista de perfil
  • Segmentos onde o locutor no vídeo de entrada não está falando
  • Rostos parcialmente obstruídos por objetos, mãos ou outros elementos

Para várias pessoas, tente mascarar ou recortar alguns rostos usando ferramentas externas. Para problemas de obstrução, sync-3 lida com obstruções automaticamente. No lipsync-2 e lipsync-2-pro, habilite a opção occlusion_detection_enabled em sua solicitação de geração para melhor detecção facial em cenas complexas (embora isso diminua a velocidade de processamento).

Rostos em vista de perfil extrema podem levar a resultados abaixo do esperado no lipsync-2 e lipsync-2-pro. sync-3 suporta nativamente ângulos de rosto extremos, incluindo perfis, tomadas sobre o ombro e posições labiais não frontais. Se você estiver trabalhando com ângulos desafiadores, sync-3 é sua melhor opção.

lipsync-2 e lipsync-2-pro geram rostos em resolução 512×512, o que geralmente é suficiente para a maioria dos vídeos em 1080p. Se o rosto no seu vídeo de entrada for bastante grande, você pode notar algumas diferenças de resolução. lipsync-2-pro oferece preservação de detalhes aprimorada para barbas, dentes e características faciais finas. sync-3 gera em resolução nativa 4K com super resolução embutida, então a perda de resolução não é um problema.

lipsync-2-pro usa tecnologia avançada de super resolução baseada em difusão em vez de abordagens tradicionais baseadas em GAN. Isso resulta em:

  • Resolução de barba aprimorada: Melhor manuseio de pelos faciais sem borrões
  • Geração de dentes melhorada: Dentes mais consistentes e com aparência natural em todos os quadros
  • Preservação de detalhes superior: Qualidade aprimorada ao redor da região da boca e características faciais
  • Melhor manuseio de tamanho de rosto: Pode processar regiões faciais maiores (até 350×350 pixels) sem degradação de qualidade

A desvantagem é o tempo de processamento mais lento (1,5-2x mais lento que lipsync-2) e custo mais alto, tornando-o ideal para aplicações de qualidade premium onde a mais alta fidelidade é necessária.

sync-3 é uma arquitetura fundamentalmente diferente. Em vez de processar o vídeo em pequenos blocos independentes, sync-3 constrói uma compreensão global da pessoa em toda a cena e gera todos os quadros de uma vez. Isso lhe dá:

  • Consistência de longo alcance: Sem artefatos de limite de bloco ou cintilação
  • Detecção de obstrução embutida: Lida automaticamente com mãos, microfones, cachecóis e outros objetos bloqueando o rosto
  • Suporte a ângulos extremos: Tomadas de perfil, sobre o ombro e ângulos não frontais funcionam nativamente
  • Saída nativa em 4K: Super resolução embutida sem perda de qualidade
  • Preservação de emoção e estilo: Preserva a cadência, expressão e performance emocional do locutor

sync-3 oferece qualidade significativamente superior a um preço mais alto, refletindo seu pipeline de processamento avançado.

A duração máxima do vídeo depende do seu plano de assinatura - variando de 1 minuto no plano Hobbyist até 30 minutos nos planos Scale+. Veja a página de preços para o limite do seu plano.

Cada modelo de lipsync tem preços diferentes por segundo a 25 fps. Os preços não são os mesmos entre os modelos:

ModeloTaxa por segundo (a 25 fps)
lipsync-1.9.0-beta$0,02 — $0,025/seg
lipsync-2$0,04 — $0,05/seg
lipsync-2-pro$0,067 — $0,083/seg
sync-3$0,107 — $0,133/seg

lipsync-2 custa aproximadamente 2x mais que lipsync-1.9.0-beta, lipsync-2-pro custa aproximadamente 1,7x mais que lipsync-2, e sync-3 é o modelo de mais alta qualidade com o preço mais alto. Escolha com base em seus requisitos de qualidade e orçamento. Veja a página de Faturamento para detalhes completos.

Para lipsync-2 e lipsync-2-pro, vídeos longos são automaticamente divididos em blocos de 30-40 segundos para processamento. As gerações podem expirar e falhar se o seu vídeo tiver muitas mudanças de cena dentro desses blocos ou se muitas cenas não contiverem rostos detectáveis.

Isso acontece porque o pipeline de processamento precisa detectar e rastrear rostos ao longo do vídeo. Mudanças rápidas de cena ou cenas sem rostos criam complexidade adicional que pode exceder os limites de tempo de processamento.

Para corrigir isso:

  • Reduza o número de cortes de cena em seu vídeo antes de fazer o upload
  • Certifique-se de que rostos sejam visíveis na maioria dos quadros do vídeo
  • Divida vídeos muito longos com muitas cenas em segmentos mais curtos e gerenciáveis

sync-3 processa cenas de forma diferente e pode lidar melhor com alguns desses cenários, embora vídeos muito longos com mudanças frequentes de cena ainda possam ser desafiadores.