auto stud
APIAPI de Síntesis de Voz

Dale voz al vídeo
y una banda sonora, con una sola clave

Una llamada pronuncia una línea de tu línea de tiempo y vuelve alineada palabra a palabra por Whisper, así los subtítulos caen en la sílaba. Otra escribe la canción de debajo. Cuatro proveedores de voz, un endpoint cada uno.

POSThttps://autostud.ai/api/v1/actions/timeline.generate_audio

Tres llamadas, del silencio a la banda sonora

Pon voz al bloque, añade una canción si quieres y luego renderiza todo.

  1. 1

    Pon voz a un bloque

    Apunta la llamada a un bloque de la línea de tiempo y a la voz que quieras. Recibes el audio, su duración exacta y los tiempos de Whisper palabra a palabra que hacen caer los subtítulos en la sílaba.

    export AUTOSTUD_API_KEY="sk_live_xxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxx"
    
    curl -X POST https://autostud.ai/api/v1/actions/timeline.generate_audio \
      -H "Authorization: Bearer $AUTOSTUD_API_KEY" \
      -H "Content-Type: application/json" \
      -d '{
        "video_id": "0f4c8b71-2d95-47a3-9e6c-15b8ad7f3c20",
        "block_id": "block_2",
        "voice_settings": {
          "voice_provider": "elevenlabs",
          "voice_id": "rachel",
          "playback_speed": 1
        }
      }'
  2. 2

    Escribe la canción

    Un brief, un estilo o tu propia letra. La música es asíncrona: la llamada devuelve una tarea y music.completed trae las pistas alojadas.

    curl -X POST https://autostud.ai/api/v1/actions/music.generate \
      -H "Authorization: Bearer $AUTOSTUD_API_KEY" \
      -H "Content-Type: application/json" \
      -d '{
        "title": "Lighthouse",
        "style": "warm lo-fi, slow, no drums",
        "prompt": "A calm bed under a voice-over about the sea",
        "instrumental": true
      }'
    
    # Already wrote the words? Send lyrics instead of prompt.
  3. 3

    Renderízalo todo junto

    El audio decide la duración de un bloque, así que una vez puesta la voz, renders.create convierte la línea de tiempo en un mp4 con todo sincronizado.

    curl -X POST https://autostud.ai/api/v1/webhooks \
      -H "Authorization: Bearer $AUTOSTUD_API_KEY" \
      -H "Content-Type: application/json" \
      -d '{
        "url": "https://your-app.com/hooks/autostud",
        "events": ["music.completed", "music.failed"],
        "description": "Audio"
      }'

Qué puedes enviar

Tres campos para hablar un bloque, uno para briefear una canción.

video_id

El vídeo cuya línea de tiempo contiene el bloque al que pones voz.

block_id

Qué bloque recibe la voz. Su duración sigue al audio, no al revés.

voice_settings

La voz en sí: proveedor, referencia de voz, velocidad. Con tu propia clave de proveedor la generación no cuesta nada.

prompt

Para music.generate: el brief de la canción. Envía lyrics en su lugar si ya la escribiste.

Cuatro proveedores, una sola forma de llamada

Las voces son un catálogo, no una lista fija. Trae tu clave de proveedor y las generaciones son gratis; usa la nuestra y se facturan en créditos como todo lo demás.

ElevenLabsGoogleCartesiaFish Audio

Las canciones se anuncian solas

El habla vuelve en la respuesta. Una canción tarda más, así que dispara un evento: registra un webhook una vez y las pistas llegan alojadas, con los créditos ya conciliados.

generation.completedmusic.completedmusic.failed

Lo que preguntan primero los desarrolladores

¿Obtengo tiempos por palabra?

Sí. La alineación de Whisper corre sobre lo recién generado, así que la respuesta lleva tiempos por palabra con precisión completa, nunca redondeados al segundo.

¿Puedo usar mi propia clave de ElevenLabs?

Sí, y es justo el sentido del modo dual: con tu clave la generación cuesta cero créditos, y el audio se aloja, se alinea y se coloca en el bloque igualmente.

¿Cuánto tarda una canción?

Minutos, no milisegundos, y por eso la música es asíncrona. Vuelve a leerla con music.get_task si un webhook no es opción en tu stack.

¿Qué pasa con la duración del bloque?

La decide el audio. Un bloque dura exactamente el habla que contiene más los silencios configurados, así que no hay que cuadrar nada a mano después.

¿Listo para crear?

Comienza a generar videos virales en minutos. No se requiere tarjeta de crédito para la prueba gratuita.

Pagos seguros
Acceso instantáneo
Cancela cuando quieras