auto stud
APIText-to-Speech-API

Gib dem Video eine Stimme
und einen Soundtrack, mit einem Key

Ein Aufruf spricht eine Zeile deiner Timeline und kommt von Whisper wortgenau ausgerichtet zurück, damit Untertitel auf der Silbe landen. Ein zweiter schreibt den Song darunter. Vier Stimmanbieter, je ein Endpunkt.

POSThttps://autostud.ai/api/v1/actions/timeline.generate_audio

Drei Aufrufe, von Stille zum Soundtrack

Block vertonen, bei Bedarf einen Song dazu, dann das Ganze rendern.

  1. 1

    Einen Block vertonen

    Richte den Aufruf auf einen Block der Timeline und die gewünschte Stimme. Zurück kommen das Audio, seine exakte Dauer und die Whisper-Worttimings, die Untertitel auf der Silbe landen lassen.

    export AUTOSTUD_API_KEY="sk_live_xxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxx"
    
    curl -X POST https://autostud.ai/api/v1/actions/timeline.generate_audio \
      -H "Authorization: Bearer $AUTOSTUD_API_KEY" \
      -H "Content-Type: application/json" \
      -d '{
        "video_id": "0f4c8b71-2d95-47a3-9e6c-15b8ad7f3c20",
        "block_id": "block_2",
        "voice_settings": {
          "voice_provider": "elevenlabs",
          "voice_id": "rachel",
          "playback_speed": 1
        }
      }'
  2. 2

    Den Song schreiben

    Ein Briefing, ein Stil oder dein eigener Text. Musik läuft asynchron: Der Aufruf liefert einen Task, und music.completed bringt die gehosteten Tracks zurück.

    curl -X POST https://autostud.ai/api/v1/actions/music.generate \
      -H "Authorization: Bearer $AUTOSTUD_API_KEY" \
      -H "Content-Type: application/json" \
      -d '{
        "title": "Lighthouse",
        "style": "warm lo-fi, slow, no drums",
        "prompt": "A calm bed under a voice-over about the sea",
        "instrumental": true
      }'
    
    # Already wrote the words? Send lyrics instead of prompt.
  3. 3

    Alles zusammen rendern

    Das Audio bestimmt die Länge eines Blocks, also macht renders.create aus der Timeline eine mp4, sobald die Stimme drin ist, alles synchron.

    curl -X POST https://autostud.ai/api/v1/webhooks \
      -H "Authorization: Bearer $AUTOSTUD_API_KEY" \
      -H "Content-Type: application/json" \
      -d '{
        "url": "https://your-app.com/hooks/autostud",
        "events": ["music.completed", "music.failed"],
        "description": "Audio"
      }'

Was du übergeben kannst

Drei Felder, um einen Block zu sprechen, eins, um einen Song zu briefen.

video_id

Das Video, dessen Timeline den zu vertonenden Block enthält.

block_id

Welcher Block die Stimme bekommt. Seine Dauer folgt dem Audio, nicht umgekehrt.

voice_settings

Die Stimme selbst: Anbieter, Stimmreferenz, Tempo. Mit deinem eigenen Anbieter-Key kostet die Generierung nichts.

prompt

Für music.generate: das Briefing des Songs. Schick stattdessen lyrics, wenn du den Text schon hast.

Vier Anbieter, eine Aufrufform

Stimmen sind ein Katalog, keine fest verdrahtete Liste. Bring deinen Anbieter-Key mit und Generierungen sind kostenlos; nimm unseren und sie werden wie alles andere in Credits abgerechnet.

ElevenLabsGoogleCartesiaFish Audio

Songs melden sich selbst

Sprache kommt in der Antwort zurück. Ein Song dauert länger und feuert deshalb ein Event: Webhook einmal registrieren, und die Tracks treffen gehostet ein, Credits bereits verrechnet.

generation.completedmusic.completedmusic.failed

Was Entwickler zuerst fragen

Bekomme ich Timings auf Wortebene?

Ja. Die Whisper-Ausrichtung läuft auf dem gerade Generierten, die Antwort trägt also Worttimings in voller Präzision, nie auf die Sekunde gerundet.

Kann ich meinen eigenen ElevenLabs-Key nutzen?

Ja, und genau darum geht es beim Dual-Modus: Mit deinem Key kostet die Generierung null Credits, und das Audio wird trotzdem gehostet, ausgerichtet und auf den Block gelegt.

Wie lange dauert ein Song?

Minuten, keine Millisekunden, deshalb ist Musik asynchron. Lies ihn mit music.get_task zurück, wenn ein Webhook in deinem Stack nicht geht.

Was passiert mit der Blockdauer?

Das Audio entscheidet sie. Ein Block ist so lang wie die Sprache darin plus die konfigurierten Pausen, es muss also nichts nachträglich von Hand getimt werden.

Bereit zu erstellen?

Beginnen Sie in Minuten mit der Generierung viraler Videos. Keine Kreditkarte für die kostenlose Testversion erforderlich.

Sichere Zahlungen
Sofortiger Zugang
Jederzeit kündbar