Modèles audio

Générez de la parole, composez de la musique et transcrivez des enregistrements via un seul point de terminaison Atlas Cloud. Couvre Seed Audio, ElevenLabs, MiniMax, Gemini TTS, Suno, Seed ASR et xAI STT.

Atlas Cloud expose trois capacités audio différentes — synthèse vocale, génération musicale et reconnaissance vocale — via un point de terminaison unique. C'est le modèle que vous choisissez qui détermine laquelle vous obtenez, pas l'URL.

POST https://api.atlascloud.ai/api/v1/model/generateAudio

Il n'existe pas de point de terminaison /v1/audio/speech ou /v1/audio/transcriptions. Si vous portez du code depuis le SDK OpenAI, les appels audio ne se transposent pas un pour un — ils passent par le flux de prédiction asynchrone décrit ci-dessous.

Fonctionnement

Les requêtes audio sont asynchrones, comme la génération d'images et de vidéos :

Soumettez une tâche. Envoyez un POST à generateAudio avec un model et les paramètres propres au modèle aplatis au niveau racine.

Récupérez un ID de prédiction. La réponse renvoie data.id et data.status.

Interrogez le résultat. GET /api/v1/model/prediction/{id} jusqu'à ce que status atteigne un état terminal, ou enregistrez un webhook et recevez plutôt l'événement audio.task.terminal.

Voir Prédictions pour la machine à états complète et Webhooks pour la configuration des callbacks.

Les résultats de transcription et de paroles sont du texte, pas des URL. Pour la plupart des modèles audio, outputs[0] est un lien vers un fichier généré. Pour les modèles de reconnaissance vocale et de génération de paroles, outputs[0] contient le texte lui-même — qui peut parfois ressembler à une URL. Ne traitez jamais aveuglément outputs[0] comme quelque chose à télécharger ; branchez selon le type de modèle.

Synthèse vocale

Synthétisez de la parole à partir de texte. Les modèles disponibles incluent Seed Audio, ElevenLabs, MiniMax Speech, Gemini TTS et xAI TTS.

Exemple : Seed Audio 1.0

curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
  -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "bytedance/seed-audio-1.0",
    "text": "Welcome to Atlas Cloud.",
    "format": "mp3",
    "sample_rate": 24000
  }'
ParamètreRequisDéfautRemarques
textOuiLe texte à synthétiser
referencesNonJusqu'à 3 références vocales, ou une seule référence image. Chaque entrée utilise exactement une source, et les références audio et image ne peuvent pas être mélangées
formatNonmp3mp3, wav, pcm, ogg_opus
sample_rateNon240008000, 16000, 24000, 32000, 44100, 48000
pitch_rateNon0−12 à 12
speech_rateNon0−50 à 100 (100 = 2,0x, −50 = 0,5x)
loudness_rateNon0−50 à 100

Pour cloner ou référencer une voix, joignez un extrait de référence et pointez dessus depuis le texte :

{
  "model": "bytedance/seed-audio-1.0",
  "text": "Use the voice of @audio1 and say: your order has shipped.",
  "references": [{ "audio_url": "https://example.com/sample-voice.mp3" }]
}

Les extraits de référence doivent durer 30 secondes ou moins et peser moins de 10 Mo.

Génération musicale

Composez des morceaux complets, avec ou sans voix. Suno Chirp et MiniMax Music sont disponibles, ainsi qu'un modèle dédié à l'écriture de paroles.

Exemple : Suno Chirp v5

curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
  -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "suno/chirp-v5",
    "prompt": "an upbeat indie pop song about summer road trips",
    "vocal_gender": "Female"
  }'
ParamètreRequisDéfautRemarques
promptGénéralementAvec custom: false, il s'agit d'une description du morceau. Avec custom: true, ce sont les paroles
customNonfalsefalse = décrire le morceau, true = fournir vos propres paroles
instrumentalNonfalseGénérer sans voix
vocal_genderNonMale ou Female. S'applique dans les deux modes
title, style, negative_tags, style_weight et champs associésNonN'ont d'effet qu'avec custom: true — sinon ils sont ignorés silencieusement

Chirp v5 renvoie deux morceaux par requête, plus une pochette générée dans thumbnail. prompt est requis sauf si vous définissez à la fois custom: true et instrumental: true.

Pour écrire les paroles d'abord et composer ensuite, appelez un modèle de paroles tel que minimax/lyrics-generation, puis passez sa sortie dans le champ lyrics du modèle musical.

Reconnaissance vocale

Transcrivez des enregistrements, avec séparation optionnelle des locuteurs et horodatage au mot près.

Les deux modèles de transcription utilisent des noms de champ différents pour l'entrée audio : Seed ASR attend audio_url, xAI STT attend audio. Passer le mauvais champ fait échouer la validation.

Exemple : Seed ASR 2.0

curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
  -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "bytedance/seed-asr-2.0",
    "audio_url": "https://example.com/interview.mp3",
    "enable_punc": true,
    "enable_speaker_info": true,
    "show_utterances": true
  }'
ParamètreRequisDéfautRemarques
audio_urlOuiURL publique ou Base64. wav/mp3/ogg/raw
formatNonmp3mp3, wav, ogg, raw
languageNonautoLaissez vide pour la détection automatique. Prend en charge 51 langues
enable_itnNontrueNormalisation inverse du texte (« cent » devient « 100 »)
enable_puncNonfalseAjouter la ponctuation
enable_ddcNonfalseLisser les mots de remplissage et les répétitions
enable_speaker_infoNonfalseSéparation des locuteurs, jusqu'à 10 locuteurs
show_utterancesNonfalseRenvoyer des segments horodatés
contextNonMots-clés prioritaires en ligne. Doit être une chaîne JSON : {"hotwords":[{"word":"Atlas"}]}. Du texte brut ici fait échouer la tâche

Exemple : xAI STT v1

curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
  -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "xai/stt-v1",
    "audio": "https://example.com/interview.mp3",
    "diarize": true,
    "text_normalization": true
  }'
ParamètreRequisDéfautRemarques
audioOuiURL publique ou Base64. Les formats de conteneur sont détectés automatiquement
languageNonautoISO 639-1. Prend en charge 24 langues
text_normalizationNonfalse« cent dollars » devient « 100 $ »
keytermNon[]Jusqu'à 100 termes de biais, 50 caractères chacun
diarizeNonfalseSéparation des locuteurs, ajoute speaker_id par mot
filler_wordsNonfalseConserver les « euh » et « hum » (supprimés par défaut)
multichannelNonfalseTranscrire chaque canal séparément

Lire le résultat

{
  "code": 200,
  "data": {
    "id": "…",
    "status": "completed",
    "outputs": ["Thanks for joining the call today…"],
    "stt_result": {
      "text": "Thanks for joining the call today…",
      "duration": 184.2,
      "words": [
        { "text": "Thanks", "start": 0.12, "end": 0.41, "speaker_id": "1" }
      ]
    }
  }
}

outputs[0] contient la transcription brute. La sortie structurée — timings, locuteurs, langue détectée — se trouve dans stt_result.

Fournir une entrée audio

Les champs d'entrée audio acceptent soit une URL HTTPS publique, soit une data URI en Base64. Les entrées Base64 sont stockées automatiquement et remplacées par une URL avant que la requête n'atteigne le modèle.

Pour les fichiers locaux, téléversez-les d'abord et utilisez l'URL renvoyée :

curl -X POST https://api.atlascloud.ai/api/v1/model/uploadMedia \
  -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
  -F "[email protected]"

Voir Téléverser des fichiers pour les limites et les détails.

Facturation

Les modèles audio sont facturés de trois manières, selon le modèle :

MéthodeS'applique àBase
Par tranche de 1 000 caractèresLa plupart des modèles de synthèse vocaleLongueur du text d'entrée
Par seconde de sortieCertains modèles vocaux, dont Seed Audio 1.0Durée réellement générée, arrondie au supérieur
Par minute d'entréeModèles de reconnaissance vocaleDurée de l'audio soumis

Les tâches en échec ne sont pas facturées. Pour les modèles facturés à la durée de sortie, un montant est retenu à la soumission puis régularisé sur la durée réelle à l'achèvement.

Utilisez le point de terminaison de tarification pour obtenir un devis exact avant de générer, et consultez Facturation des modèles pour des exemples chiffrés.

Trouver des modèles audio

Le catalogue de modèles change fréquemment. Plutôt que de coder une liste en dur, filtrez le catalogue par type :

  • Parcourez la Bibliothèque de modèles et filtrez par Text-to-Audio ou Audio-to-Text
  • Ou listez-les depuis un agent avec le Serveur MCP en utilisant atlas_list_models avec type="Audio"

Les paramètres exacts de chaque modèle sont publiés sur sa propre page de référence API, sous Model endpoints.

Voir aussi

Last updated on

On this page