Modelos de Lipsync
Sync Labs oferece uma família de modelos de lipsync para diferentes necessidades de qualidade e velocidade. sync-3 é nosso modelo mais poderoso com saída nativa em 4K e detecção de obstrução embutida. lipsync-2-pro oferece super resolução baseada em difusão para detalhes faciais finos. lipsync-2 equilibra qualidade e velocidade para uso geral. Os preços variam de $0,04/seg (lipsync-2) a $0,133/seg (sync-3) a 25 fps. Explore e compare as capacidades dos diferentes modelos abaixo.
Esses modelos públicos estão disponíveis tanto no Studio quanto na API.
Opções Avançadas
Nem todas as opções avançadas estão disponíveis em todos os modelos. A tabela abaixo mostra quais opções você pode configurar para cada modelo de lipsync.
Opções marcadas com ” - ” não são suportadas ou são gerenciadas automaticamente pelo modelo. Se você incluir uma opção não suportada em sua solicitação, ela será ignorada.
- Temperatura: Controla a expressividade dos movimentos dos lábios (0 - 1, padrão 0.5). Disponível no lipsync-2 e lipsync-2-pro. sync-3 gerencia a expressividade nativamente.
- Detecção de Obstrução: Para conteúdo de vídeo desafiador onde os rostos podem estar parcialmente ocultos por objetos, mãos ou outros elementos, você pode habilitar a detecção de obstrução no lipsync-2 e lipsync-2-pro. Este recurso melhora a precisão da detecção facial em cenas complexas, mas vem com velocidades de geração mais lentas. sync-3 lida com obstruções automaticamente - nenhuma configuração necessária.
- Raciocínio: Análise de quadros aprimorada para artefatos e casos extremos. Disponível no lipsync-2-pro. sync-3 inclui essa capacidade nativamente.
- Detecção de Locutor Ativo: Detecta automaticamente e aplica lipsync apenas aos locutores ativos em vídeos com várias pessoas. Disponível em todos os modelos de lipsync.
Advertências
- Limitação de Quadro Estático: lipsync-2 e lipsync-2-pro requerem movimento natural de fala no vídeo de entrada para funcionar corretamente. Se o seu vídeo contiver segmentos com quadros estáticos (onde o locutor não está se movendo ou falando ativamente), o lipsync não funcionará durante essas partes, mesmo que o áudio esteja presente. Esses modelos usam blocos independentes de 2 segundos para inferência e precisam detectar o estilo natural de fala para gerar movimentos dos lábios apropriados. Segmentos de vídeo estáticos ou parados não fornecem as pistas visuais necessárias para o modelo criar uma lip sync realista. sync-3 pode abrir lábios silenciosos para combinar com o áudio, embora os resultados sejam genéricos em vez de combinados com o estilo do locutor. Recomendação: Para melhores resultados com lipsync-2 e lipsync-2-pro, certifique-se de que seu vídeo de entrada mostre o locutor falando ativamente durante toda a duração que você deseja sincronizar.
Modelos Legados
lipsync-1.9.0-beta é nosso modelo legado rápido de lipsync para vídeos simples. Ele usa movimentos dos lábios genéricos padrão e é a opção mais rápida disponível a $0,02 - $0,025/seg a 25 fps. Embora ainda seja suportado, recomendamos lipsync-2 ou modelos mais novos para melhor precisão e preservação de estilo.
FAQs
Por que o movimento labial do meu personagem gerado por IA não está funcionando corretamente?
O personagem no vídeo de entrada precisa parecer que está falando. Nossos modelos aprendem a imitar o estilo de fala no vídeo de entrada. Se o personagem estiver completamente estático, o modelo pode não gerar lábios que se movem também. sync-3 pode abrir lábios silenciosos, mas para os resultados mais naturais, a entrada deve mostrar algum movimento de fala.
Solução: Ao criar seu vídeo gerado por IA, adicione o prompt de texto “pessoa está falando naturalmente” à sua geração. Isso criará personagens com lábios que já estão se movendo, o que funcionará muito melhor com nossa plataforma.
Posso usar sync para sincronizar uma música com um personagem?
Absolutamente. Para a melhor qualidade, comece com sync-3; para a maioria dos trabalhos padrão de sincronização de música com lábios, lipsync-2 é uma boa escolha. Para melhores resultados, certifique-se de isolar e fazer upload da faixa vocal, pois os sons instrumentais podem, às vezes, interferir na qualidade da lip sync.
O sync funciona com rostos de animais ou personagens não humanos?
Você pode sincronizar rostos humanóides, mas nossos modelos atualmente não suportam animais ou personagens não humanoides.
Por que a qualidade da lip sync é ruim ou inexistente em certas partes do meu vídeo?
Verifique se os segmentos problemáticos têm:
- Vários locutores no quadro
- Rostos muito pequenos ou em vista de perfil
- Segmentos onde o locutor no vídeo de entrada não está falando
- Rostos parcialmente obstruídos por objetos, mãos ou outros elementos
Para várias pessoas, tente mascarar ou recortar alguns rostos usando ferramentas externas. Para problemas de obstrução, sync-3 lida com obstruções automaticamente. No lipsync-2 e lipsync-2-pro, habilite a opção occlusion_detection_enabled em sua solicitação de geração para melhor detecção facial em cenas complexas (embora isso diminua a velocidade de processamento).
Por que meu vídeo tem qualidade de lip sync ruim quando os rostos estão em vista de perfil?
Rostos em vista de perfil extrema podem levar a resultados abaixo do esperado no lipsync-2 e lipsync-2-pro. sync-3 suporta nativamente ângulos de rosto extremos, incluindo perfis, tomadas sobre o ombro e posições labiais não frontais. Se você estiver trabalhando com ângulos desafiadores, sync-3 é sua melhor opção.
Por que o rosto gerado parece ter resolução inferior ao meu vídeo de entrada?
lipsync-2 e lipsync-2-pro geram rostos em resolução 512×512, o que geralmente é suficiente para a maioria dos vídeos em 1080p. Se o rosto no seu vídeo de entrada for bastante grande, você pode notar algumas diferenças de resolução. lipsync-2-pro oferece preservação de detalhes aprimorada para barbas, dentes e características faciais finas. sync-3 gera em resolução nativa 4K com super resolução embutida, então a perda de resolução não é um problema.
O que torna o lipsync-2-pro diferente de outros modelos?
lipsync-2-pro usa tecnologia avançada de super resolução baseada em difusão em vez de abordagens tradicionais baseadas em GAN. Isso resulta em:
- Resolução de barba aprimorada: Melhor manuseio de pelos faciais sem borrões
- Geração de dentes melhorada: Dentes mais consistentes e com aparência natural em todos os quadros
- Preservação de detalhes superior: Qualidade aprimorada ao redor da região da boca e características faciais
- Melhor manuseio de tamanho de rosto: Pode processar regiões faciais maiores (até 350×350 pixels) sem degradação de qualidade
A desvantagem é o tempo de processamento mais lento (1,5-2x mais lento que lipsync-2) e custo mais alto, tornando-o ideal para aplicações de qualidade premium onde a mais alta fidelidade é necessária.
O que torna o sync-3 diferente do lipsync-2-pro?
sync-3 é uma arquitetura fundamentalmente diferente. Em vez de processar o vídeo em pequenos blocos independentes, sync-3 constrói uma compreensão global da pessoa em toda a cena e gera todos os quadros de uma vez. Isso lhe dá:
- Consistência de longo alcance: Sem artefatos de limite de bloco ou cintilação
- Detecção de obstrução embutida: Lida automaticamente com mãos, microfones, cachecóis e outros objetos bloqueando o rosto
- Suporte a ângulos extremos: Tomadas de perfil, sobre o ombro e ângulos não frontais funcionam nativamente
- Saída nativa em 4K: Super resolução embutida sem perda de qualidade
- Preservação de emoção e estilo: Preserva a cadência, expressão e performance emocional do locutor
sync-3 oferece qualidade significativamente superior a um preço mais alto, refletindo seu pipeline de processamento avançado.
Qual é a duração máxima do vídeo?
A duração máxima do vídeo depende do seu plano de assinatura - variando de 1 minuto no plano Hobbyist até 30 minutos nos planos Scale+. Veja a página de preços para o limite do seu plano.
Quanto custa cada modelo de lipsync?
Cada modelo de lipsync tem preços diferentes por segundo a 25 fps. Os preços não são os mesmos entre os modelos:
lipsync-2 custa aproximadamente 2x mais que lipsync-1.9.0-beta, lipsync-2-pro custa aproximadamente 1,7x mais que lipsync-2, e sync-3 é o modelo de mais alta qualidade com o preço mais alto. Escolha com base em seus requisitos de qualidade e orçamento. Veja a página de Faturamento para detalhes completos.
Por que a geração do meu vídeo longo falhou após processar por muito tempo?
Para lipsync-2 e lipsync-2-pro, vídeos longos são automaticamente divididos em blocos de 30-40 segundos para processamento. As gerações podem expirar e falhar se o seu vídeo tiver muitas mudanças de cena dentro desses blocos ou se muitas cenas não contiverem rostos detectáveis.
Isso acontece porque o pipeline de processamento precisa detectar e rastrear rostos ao longo do vídeo. Mudanças rápidas de cena ou cenas sem rostos criam complexidade adicional que pode exceder os limites de tempo de processamento.
Para corrigir isso:
- Reduza o número de cortes de cena em seu vídeo antes de fazer o upload
- Certifique-se de que rostos sejam visíveis na maioria dos quadros do vídeo
- Divida vídeos muito longos com muitas cenas em segmentos mais curtos e gerenciáveis
sync-3 processa cenas de forma diferente e pode lidar melhor com alguns desses cenários, embora vídeos muito longos com mudanças frequentes de cena ainda possam ser desafiadores.

