APIAPI for talesyntese

Gi videoen en stemme
og et lydspor, fra én nøkkel

Ett kall leser opp en linje fra tidslinjen din og kommer tilbake ordrett justert av Whisper, slik at undertekster lander på stavelsen. Et annet skriver låten under. Fire stemmeleverandører, ett endepunkt hver.

POSThttps://autostud.ai/api/v1/actions/timeline.generate_audio

Tre kall, fra stillhet til lydspor

Gi blokken stemme, legg til en låt om du vil, og render så det hele.

  1. 1

    Gi en blokk stemme

    Pek kallet mot en blokk i tidslinjen og stemmen du vil ha. Tilbake kommer lyden, den nøyaktige lengden og Whisper-ordtimingene som får undertekster til å lande på stavelsen.

    export AUTOSTUD_API_KEY="sk_live_xxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxx"
    
    curl -X POST https://autostud.ai/api/v1/actions/timeline.generate_audio \
      -H "Authorization: Bearer $AUTOSTUD_API_KEY" \
      -H "Content-Type: application/json" \
      -d '{
        "video_id": "0f4c8b71-2d95-47a3-9e6c-15b8ad7f3c20",
        "block_id": "block_2",
        "voice_settings": {
          "voice_provider": "elevenlabs",
          "voice_id": "rachel",
          "playback_speed": 1
        }
      }'
  2. 2

    Skriv låten

    En brief, en stil eller din egen tekst. Musikk er asynkron: kallet returnerer en oppgave, og music.completed henter de hostede sporene.

    curl -X POST https://autostud.ai/api/v1/actions/music.generate \
      -H "Authorization: Bearer $AUTOSTUD_API_KEY" \
      -H "Content-Type: application/json" \
      -d '{
        "title": "Lighthouse",
        "style": "warm lo-fi, slow, no drums",
        "prompt": "A calm bed under a voice-over about the sea",
        "instrumental": true
      }'
    
    # Already wrote the words? Send lyrics instead of prompt.
  3. 3

    Render alt sammen

    Lyden bestemmer lengden på en blokk, så når stemmen er på plass gjør renders.create tidslinjen om til en mp4 med alt i synk.

    curl -X POST https://autostud.ai/api/v1/webhooks \
      -H "Authorization: Bearer $AUTOSTUD_API_KEY" \
      -H "Content-Type: application/json" \
      -d '{
        "url": "https://your-app.com/hooks/autostud",
        "events": ["music.completed", "music.failed"],
        "description": "Audio"
      }'

Hva du kan sende med

Tre felter for å lese opp en blokk, ett for å bestille en låt.

video_id

Videoen hvis tidslinje inneholder blokken du gir stemme.

block_id

Hvilken blokk som får stemmen. Lengden følger lyden, ikke omvendt.

voice_settings

Selve stemmen: leverandør, stemmereferanse, hastighet. Med din egen leverandørnøkkel koster genereringen ingenting.

prompt

Til music.generate: briefen for låten. Send lyrics i stedet hvis teksten allerede er skrevet.

Fire leverandører, én kalleform

Stemmer er en katalog, ikke en hardkodet liste. Ta med din egen leverandørnøkkel, så er genereringene gratis; bruk vår, og de faktureres i kreditter som alt annet.

ElevenLabsGoogleCartesiaFish Audio

Låtene melder fra selv

Tale kommer tilbake i svaret. En låt tar lengre tid og utløser derfor en hendelse: registrer ett webhook, og sporene ankommer hostet, med kredittene allerede avstemt.

generation.completedmusic.completedmusic.failed

Det utviklere spør om først

Får jeg timing på ordnivå?

Ja. Whisper-justeringen kjører på det som nettopp ble generert, så svaret bærer ordtiming i full presisjon, aldri rundet av til nærmeste sekund.

Kan jeg bruke min egen ElevenLabs-nøkkel?

Ja, og det er nettopp poenget med dobbeltmodusen: med din nøkkel koster genereringen null kreditter, og lyden blir likevel hostet, justert og lagt på blokken.

Hvor lang tid tar en låt?

Minutter, ikke millisekunder, og derfor er musikk asynkron. Les den tilbake med music.get_task hvis et webhook ikke er et alternativ i stacken din.

Hva skjer med lengden på blokken?

Lyden avgjør den. En blokk varer nøyaktig så lenge som talen i den pluss pausene du har satt opp, så ingenting må times for hånd i etterkant.

Klar til å skape?

Lag virale videoer på få minutter. Du trenger ikke kort for å prøve gratis.

Trygge betalinger
Tilgang med én gang
Avslutt når du vil