Saltar a la navegación

Modelos React

react-1 introduce el primer control primitivo de performance para edición de video. Como modelo de AI talking head expresivo, react-1 puede sincronizar los movimientos de labios, las expresiones faciales y los movimientos de cabeza para que coincidan con un audio de destino, mientras sigue un prompt emocional. A continuación describimos un par de workflows que solo son posibles con react-1.

Funciones clave

  • Modos del modelo: puedes elegir qué región facial editar: solo la boca, las expresiones faciales o incluso los movimientos de cabeza
  • Expressive lipsync: react-1 opera sobre una región facial mucho más grande, lo que te da los movimientos de boca más expresivos que coinciden con el habla
  • Expresiones faciales: las expresiones faciales se reescriben usando un prompt de emoción, y cada microexpresión queda perfectamente sincronizada con el habla.
  • Movimientos de cabeza: react-1 también puede sincronizar tus movimientos de cabeza para que coincidan con el ritmo, la prosodia y la entonación del diálogo nuevo.

Modos del modelo

El modelo se puede controlar con tres modos de operación: lips, face y head.

Esto te permite especificar la región espacial que quieres editar. Puedes optar solo por lipsync, o también elegir expresiones faciales o movimientos de cabeza. El valor predeterminado es face.

ModoLipsyncExpresiones facialesMovimientos de cabeza
lips✅❌❌
face✅✅❌
head✅✅✅

Prompts de emoción

Puedes guiar las expresiones faciales especificando prompts de emoción. También puedes no especificar ninguno, en cuyo caso el modelo seguirá el contexto emocional del video de input. Consulta el uso a continuación para ver más detalles.

Uso

react-1 está disponible mediante el mismo endpoint de API /v2/generate que se usa para lipsync estándar, con parámetros adicionales para controlar los efectos emocionales y de movimiento.

Para usar react-1 con la API, configura el parámetro model como react-1 y define las opciones adicionales:

from sync import Sync
from sync.common import Audio, Video, GenerationOptions
sync = Sync()
response = sync.generations.create(
input=[
Video(url="https://assets.sync.so/docs/example-video.mp4"),
Audio(url="https://assets.sync.so/docs/example-audio.wav")
],
model="react-1",
options=GenerationOptions(
prompt="happy",
model_mode="face"
)
)

Parámetros de API

model

Configúralo como react-1 para usar el modelo react-1.

options.model_mode

Controla la región de edición y el alcance de movimiento para el modelo. Opciones disponibles:

  • lips: solo lipsync con react-1 (cambios faciales mínimos)
  • face (predeterminado): lipsync + expresiones faciales sin movimientos de cabeza
  • head: lipsync + expresiones faciales + movimientos naturales de talking head

El parámetro model_mode solo funciona con el modelo react-1. Para otros modelos, este parámetro se ignora.

options.prompt

Prompt de emoción para la generación. Actualmente solo admite emociones de una palabra.

Opciones disponibles:

  • happy
  • angry
  • sad
  • neutral
  • disgusted
  • surprised

El parámetro prompt solo funciona con el modelo react-1. Para otros modelos, este parámetro se ignora.

react-1 está disponible en Sync Labs Studio con una interfaz intuitiva para controlar expresiones emocionales y movimientos de cabeza.

1

Ir a Studio

Ve a Studio y crea un proyecto nuevo o abre uno existente.

2

Selecciona tus assets

Sube o selecciona tus inputs de video y audio. Recuerda que react-1 admite inputs de hasta 15 segundos de duración.

3

Elige el modelo react-1

Selecciona react-1 en el menú desplegable de modelo dentro de la configuración de generación.

4

Configura el modo del modelo

Elige el modo del modelo que quieras:

  • Lips: solo para lipsync
  • Face: para lipsync con expresiones faciales (predeterminado)
  • Head: para lipsync con expresiones faciales y movimientos naturales de cabeza
5

Cambia la expresión

Selecciona una expresión en la rueda de emociones haciendo clic en en los controles del reproductor de video.

6

Genera

Haz clic en generate para crear tu lipsync con expresiones emocionales y movimientos de cabeza opcionales.

Buenas prácticas

Elige el modo correcto
  • Usa el modo lips cuando solo necesites lipsync sin cambios emocionales
  • Usa el modo face (predeterminado) para la mayoría de los casos de uso donde quieres expresiones naturales
  • Usa el modo head cuando quieras los movimientos de talking head más dinámicos y naturales
Selecciona emociones adecuadas

Elige prompts de emoción que coincidan con el tono y el contexto de tu audio. El modelo generará expresiones faciales alineadas con la emoción seleccionada durante toda la generación.

Duración del input

Mantén tus inputs por debajo de 15 segundos. Para contenido más largo, divide tu video en segmentos y procésalos por separado, o usa los modelos de lipsync estándar para duraciones más largas.

Limitaciones actuales

Las siguientes funciones todavía no son compatibles con react-1:

  • Duración del input: react-1 admite inputs de hasta 15 segundos de duración. Para contenido más largo, considera dividir tu video en segmentos.
  • Segmentos: la generación multisegmento con diferentes inputs de audio no está disponible. Procesa cada segmento por separado si es necesario.
  • selección de hablante: la opción active_speaker_detection no es compatible, incluida la detección automática (auto_detect) y la selección manual mediante bounding box o número de frame. Asegúrate de que tu video de input contenga un solo speaker claramente visible.
  • Occlusion detection: la opción occlusion_detection_enabled para manejar rostros parcialmente ocultos no está disponible para react-1.

Cuándo usar react-1

react-1 es ideal para:

  • Contenido corto (≤ 15 segundos) que requiere expresiones emocionales
  • Videos donde los movimientos naturales de cabeza mejoran el resultado
  • Contenido que se beneficia de expresiones faciales conscientes de la emoción
  • Proyectos donde quieres resultados de lipsync más dinámicos y expresivos

Para contenido más largo (> 15 segundos) o cuando solo necesites lipsync estándar, considera usar lipsync-2 o lipsync-2-pro en su lugar.

Precios

react-1 está disponible en planes de suscripción de pago (Creator y superiores). El precio se basa en uso a 25 fps y difiere de los modelos de lipsync. Cada modelo de Sync Labs tiene su propia tarifa por segundo.

PlanTarifa por segundo (a 25 fps)
Hobbyist / Creator$0.167/sec
Growth (5% de descuento)$0.158/sec
Scale (20% de descuento)$0.133/sec

react-1 es el modelo más expresivo y tiene un precio más alto que los modelos de lipsync. Consulta la página de precios para ver una comparación completa.

Los precios de los modelos de Sync Labs varían por modelo. react-1 ($0.133-$0.167/sec) cuesta bastante más que lipsync-2 ($0.04-$0.05/sec) o lipsync-2-pro ($0.067-$0.083/sec). No asumas que el precio es el mismo entre modelos.

FAQs

react-1 cuesta $0.133-$0.167 por segundo de video de output a 25 fps, según tu plan de suscripción. Los planes Hobbyist y Creator pagan $0.167/sec, Growth paga $0.158/sec (5% de descuento) y Scale paga $0.133/sec (20% de descuento). Requiere una suscripción de pago (plan Creator o superior).

No. react-1 tiene un precio bastante más alto que los modelos de lipsync. A la tarifa base, react-1 ($0.167/sec) cuesta más de 3x que lipsync-2 ($0.05/sec) y cerca de 2x que lipsync-2-pro ($0.083/sec). Cada modelo de Sync Labs tiene precios por segundo independientes.

No. react-1 requiere una suscripción de pago (plan Creator o superior). La prueba gratuita solo incluye modelos de la familia lipsync (lipsync-1.9.0-beta, lipsync-2, lipsync-2-pro).