auto stud
APIAPI Synthèse Vocale

Donnez une voix à la vidéo
et une bande-son, avec une seule clé

Un appel prononce une ligne de votre timeline et revient aligné mot à mot par Whisper : les sous-titres tombent sur la syllabe. Un autre écrit la chanson en dessous. Quatre fournisseurs de voix, un endpoint chacun.

POSThttps://autostud.ai/api/v1/actions/timeline.generate_audio

Trois appels, du silence à la bande-son

Voix sur le bloc, chanson si vous en voulez une, puis rendu de l'ensemble.

  1. 1

    Faites parler un bloc

    Pointez l'appel sur un bloc de la timeline et la voix voulue. Vous récupérez l'audio, sa durée exacte, et les timings Whisper mot à mot qui font tomber les sous-titres sur la syllabe.

    export AUTOSTUD_API_KEY="sk_live_xxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxx"
    
    curl -X POST https://autostud.ai/api/v1/actions/timeline.generate_audio \
      -H "Authorization: Bearer $AUTOSTUD_API_KEY" \
      -H "Content-Type: application/json" \
      -d '{
        "video_id": "0f4c8b71-2d95-47a3-9e6c-15b8ad7f3c20",
        "block_id": "block_2",
        "voice_settings": {
          "voice_provider": "elevenlabs",
          "voice_id": "rachel",
          "playback_speed": 1
        }
      }'
  2. 2

    Écrivez la chanson

    Un brief, un style, ou vos propres paroles. La musique est asynchrone : l'appel renvoie une tâche et music.completed ramène les pistes hébergées.

    curl -X POST https://autostud.ai/api/v1/actions/music.generate \
      -H "Authorization: Bearer $AUTOSTUD_API_KEY" \
      -H "Content-Type: application/json" \
      -d '{
        "title": "Lighthouse",
        "style": "warm lo-fi, slow, no drums",
        "prompt": "A calm bed under a voice-over about the sea",
        "instrumental": true
      }'
    
    # Already wrote the words? Send lyrics instead of prompt.
  3. 3

    Rendez le tout

    L'audio décide de la durée d'un bloc : une fois la voix posée, renders.create transforme la timeline en mp4 avec tout en place.

    curl -X POST https://autostud.ai/api/v1/webhooks \
      -H "Authorization: Bearer $AUTOSTUD_API_KEY" \
      -H "Content-Type: application/json" \
      -d '{
        "url": "https://your-app.com/hooks/autostud",
        "events": ["music.completed", "music.failed"],
        "description": "Audio"
      }'

Ce que vous pouvez passer

Trois champs pour faire parler un bloc, un pour briefer une chanson.

video_id

La vidéo dont la timeline contient le bloc à sonoriser.

block_id

Quel bloc reçoit la voix. Sa durée suit l'audio, et non l'inverse.

voice_settings

La voix elle-même : fournisseur, référence de voix, vitesse. Avec votre propre clé fournisseur, la génération ne coûte rien.

prompt

Pour music.generate : le brief de la chanson. Passez plutôt lyrics si vous avez déjà écrit les paroles.

Quatre fournisseurs, une seule forme d'appel

Les voix sont un catalogue, pas une liste en dur. Apportez votre clé fournisseur et les générations sont gratuites ; utilisez la nôtre et elles sont facturées en crédits comme le reste.

ElevenLabsGoogleCartesiaFish Audio

Les chansons se signalent seules

La parole revient dans la réponse. Une chanson prend plus de temps : elle déclenche un événement. Enregistrez un webhook une fois et les pistes arrivent hébergées, crédits déjà réconciliés.

generation.completedmusic.completedmusic.failed

Les questions que les développeurs posent en premier

Ai-je les timings au mot ?

Oui. L'alignement Whisper tourne sur ce qui vient d'être généré : la réponse porte les timings mot à mot en précision complète, jamais arrondis à la seconde.

Puis-je utiliser ma propre clé ElevenLabs ?

Oui, c'est tout l'intérêt du double mode : avec votre clé la génération coûte zéro crédit, et l'audio est quand même hébergé, aligné et posé sur le bloc.

Combien de temps prend une chanson ?

Des minutes, pas des millisecondes : c'est pourquoi la musique est asynchrone. Relisez-la avec music.get_task si le webhook n'est pas une option chez vous.

Que devient la durée du bloc ?

C'est l'audio qui la décide. Un bloc dure exactement la parole qu'il contient plus les silences configurés : rien à caler à la main après coup.

Prêt à créer ?

Commencez à générer des vidéos virales en quelques minutes. Pas de carte bancaire requise pour l'essai gratuit.

Paiements sécurisés
Accès instantané
Annulation à tout moment