Ir para a navegação

Modelos React

react-1 introduz o primeiro primitivo de controle de desempenho para edição de vídeo. Como um modelo de cabeça falante de IA expressivo, react-1 pode sincronizar os movimentos dos lábios, expressões faciais e movimentos de cabeça para corresponder a um áudio alvo, enquanto segue um comando emocional. Descrevemos abaixo alguns fluxos de trabalho que são possíveis apenas usando react-1.

Principais Características

  • Modos do Modelo: Você pode escolher qual região facial editar: apenas a boca, ou as expressões faciais, ou até mesmo os movimentos de cabeça
  • Sincronização labial expressiva: react-1 opera em uma região facial muito maior, proporcionando os movimentos dos lábios mais expressivos que correspondem à fala
  • Expressões Faciais: expressões faciais reescritas usando um comando emocional, e cada microexpressão está perfeitamente sincronizada com a fala.
  • Movimentos de Cabeça: react-1 também pode sincronizar seus movimentos de cabeça para corresponder ao ritmo, prosódia e entonação do novo diálogo.

Modos do Modelo

O modelo pode ser controlado com três modos de operação: lips, face e head.

Isso permite que você especifique a região espacial que deseja editar. Você pode optar apenas pela lip sync, ou adicionalmente escolher expressões faciais ou movimentos de cabeça também. O padrão é face.

ModoLip syncExpressões FaciaisMovimentos de Cabeça
lips✅❌❌
face✅✅❌
head✅✅✅

Comandos Emocionais

Você pode guiar as expressões faciais especificando os comandos emocionais. Você também pode optar por não especificar um, nesse caso, o modelo seguirá o contexto emocional do vídeo de entrada. Veja o uso abaixo para mais detalhes.

Uso

react-1 está disponível através do mesmo endpoint da API /v2/generate usado para lip sync padrão, com parâmetros adicionais para controlar os efeitos emocionais e de movimento.

Para usar react-1 com a API, defina o parâmetro model como react-1 e configure as opções adicionais:

from sync import Sync
from sync.common import Audio, Video, GenerationOptions
sync = Sync()
response = sync.generations.create(
input=[
Video(url="https://assets.sync.so/docs/example-video.mp4"),
Audio(url="https://assets.sync.so/docs/example-audio.wav")
],
model="react-1",
options=GenerationOptions(
prompt="happy",
model_mode="face"
)
)

Parâmetros da API

model

Defina como react-1 para usar o modelo react-1.

options.model_mode

Controla a região de edição e o escopo de movimento para o modelo. Opções disponíveis:

  • lips: Apenas lip sync usando react-1 (mudanças faciais mínimas)
  • face (padrão): Sincronização labial + expressões faciais sem movimentos de cabeça
  • head: Sincronização labial + expressões faciais + movimentos naturais de cabeça falante

O parâmetro model_mode só funciona com o modelo react-1. Para outros modelos, este parâmetro é ignorado.

options.prompt

Comando emocional para a geração. Atualmente suporta apenas emoções de uma palavra.

Opções disponíveis:

  • happy
  • angry
  • sad
  • neutral
  • disgusted
  • surprised

O parâmetro prompt só funciona com o modelo react-1. Para outros modelos, este parâmetro é ignorado.

react-1 está disponível no Sync Labs Studio com uma interface intuitiva para controlar expressões emocionais e movimentos de cabeça.

2

Selecione seus ativos

Envie ou selecione seus vídeos e áudios de entrada. Lembre-se de que react-1 suporta entradas de até 15 segundos de duração.

3

Escolha o modelo react-1

Selecione react-1 no menu suspenso de modelos nas configurações de geração.

4

Configure o modo do modelo

Escolha o modo de modelo desejado:

  • Lips: Apenas para lip sync
  • Face: Para lip sync com expressões faciais (padrão)
  • Head: Para lip sync com expressões faciais e movimentos naturais de cabeça
5

Mude a expressão

Selecione uma expressão na roda de emoções clicando nos controles do player de vídeo.

6

Gerar

Clique em gerar para criar sua lip sync com expressões emocionais e movimentos de cabeça opcionais.

Melhores Práticas

Escolha o Modo Certo
  • Use o modo lips quando você só precisar de lip sync sem mudanças emocionais
  • Use o modo face (padrão) para a maioria dos casos de uso onde você deseja expressões naturais
  • Use o modo head quando você quiser os movimentos de cabeça falante mais dinâmicos e naturais
Selecione Emoções Apropriadas

Escolha comandos emocionais que correspondam ao tom e contexto do seu áudio. O modelo gerará expressões faciais que se alinham com a emoção selecionada ao longo da geração.

Duração da Entrada

Mantenha suas entradas com menos de 15 segundos. Para conteúdos mais longos, divida seu vídeo em segmentos e processe-os separadamente, ou use os modelos de lip sync padrão para durações mais longas.

Limitações Atuais

Os seguintes recursos ainda não são suportados para react-1:

  • Duração da Entrada: react-1 suporta entradas de até 15 segundos de duração. Para conteúdos mais longos, considere dividir seu vídeo em segmentos.
  • Segmentos: Geração multi-segmento com diferentes entradas de áudio não está disponível. Processe cada segmento separadamente, se necessário.
  • Seleção de Falante: A opção active_speaker_detection não é suportada, incluindo tanto a detecção automática (auto_detect) quanto a seleção manual via caixa delimitadora ou número de quadro. Certifique-se de que seu vídeo de entrada contenha um único falante claramente visível.
  • Detecção de Oclusão: A opção occlusion_detection_enabled para lidar com rostos parcialmente ocultos não está disponível para react-1.

Quando usar react-1

react-1 é ideal para:

  • Conteúdos de curta duração (≤ 15 segundos) que exigem expressões emocionais
  • Vídeos onde movimentos naturais de cabeça melhoram o resultado
  • Conteúdos que se beneficiam de expressões faciais conscientes de emoções
  • Projetos onde você deseja resultados de lip sync mais dinâmicos e expressivos

Para conteúdos mais longos (> 15 segundos) ou quando você só precisa de lip sync padrão, considere usar lipsync-2 ou lipsync-2-pro.

Preços

react-1 está disponível em planos de assinatura pagos (Creator e acima). O preço é baseado no uso a 25 fps e difere dos modelos de lip sync - cada modelo Sync Labs tem sua própria taxa por segundo.

PlanoTaxa por segundo (a 25 fps)
Hobbyist / Creator$0.167/seg
Growth (5% de desconto)$0.158/seg
Scale (20% de desconto)$0.133/seg

react-1 é o modelo mais expressivo e tem um preço mais alto do que os modelos de lip sync. Veja a página de preços para uma comparação completa.

Os preços dos modelos Sync Labs variam por modelo. react-1 ($0.133 - $0.167/seg) custa significativamente mais do que lipsync-2 ($0.04 - $0.05/seg) ou lipsync-2-pro ($0.067 - $0.083/seg). Não assuma que os preços são os mesmos entre os modelos.

Perguntas Frequentes

react-1 custa $0.133 - $0.167 por segundo de vídeo de saída a 25 fps, dependendo do seu plano de assinatura. Os planos Hobbyist e Creator pagam $0.167/seg, Growth paga $0.158/seg (5% de desconto), e Scale paga $0.133/seg (20% de desconto). Requer uma assinatura paga (plano Creator ou superior).

Não. react-1 é significativamente mais caro do que os modelos de lip sync. Na taxa base, react-1 ($0.167/seg) custa mais de 3 vezes mais do que lipsync-2 ($0.05/seg) e cerca de 2 vezes mais do que lipsync-2-pro ($0.083/seg). Cada modelo Sync Labs tem preços independentes por segundo.

Não. react-1 requer uma assinatura paga (plano Creator ou superior). O teste gratuito inclui apenas modelos da família lipsync (lipsync-1.9.0-beta, lipsync-2, lipsync-2-pro).