Modèles audio
Générez de la parole, composez de la musique et transcrivez des enregistrements via un seul point de terminaison Atlas Cloud. Couvre Seed Audio, ElevenLabs, MiniMax, Gemini TTS, Suno, Seed ASR et xAI STT.
Atlas Cloud expose trois capacités audio différentes — synthèse vocale, génération musicale et reconnaissance vocale — via un point de terminaison unique. C'est le modèle que vous choisissez qui détermine laquelle vous obtenez, pas l'URL.
POST https://api.atlascloud.ai/api/v1/model/generateAudioIl n'existe pas de point de terminaison /v1/audio/speech ou /v1/audio/transcriptions. Si vous portez du code depuis le SDK OpenAI, les appels audio ne se transposent pas un pour un — ils passent par le flux de prédiction asynchrone décrit ci-dessous.
Fonctionnement
Les requêtes audio sont asynchrones, comme la génération d'images et de vidéos :
Soumettez une tâche. Envoyez un POST à generateAudio avec un model et les paramètres propres au modèle aplatis au niveau racine.
Récupérez un ID de prédiction. La réponse renvoie data.id et data.status.
Interrogez le résultat. GET /api/v1/model/prediction/{id} jusqu'à ce que status atteigne un état terminal, ou enregistrez un webhook et recevez plutôt l'événement audio.task.terminal.
Voir Prédictions pour la machine à états complète et Webhooks pour la configuration des callbacks.
Les résultats de transcription et de paroles sont du texte, pas des URL. Pour la plupart des modèles audio, outputs[0] est un lien vers un fichier généré. Pour les modèles de reconnaissance vocale et de génération de paroles, outputs[0] contient le texte lui-même — qui peut parfois ressembler à une URL. Ne traitez jamais aveuglément outputs[0] comme quelque chose à télécharger ; branchez selon le type de modèle.
Synthèse vocale
Synthétisez de la parole à partir de texte. Les modèles disponibles incluent Seed Audio, ElevenLabs, MiniMax Speech, Gemini TTS et xAI TTS.
Exemple : Seed Audio 1.0
curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
-H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "bytedance/seed-audio-1.0",
"text": "Welcome to Atlas Cloud.",
"format": "mp3",
"sample_rate": 24000
}'| Paramètre | Requis | Défaut | Remarques |
|---|---|---|---|
text | Oui | — | Le texte à synthétiser |
references | Non | — | Jusqu'à 3 références vocales, ou une seule référence image. Chaque entrée utilise exactement une source, et les références audio et image ne peuvent pas être mélangées |
format | Non | mp3 | mp3, wav, pcm, ogg_opus |
sample_rate | Non | 24000 | 8000, 16000, 24000, 32000, 44100, 48000 |
pitch_rate | Non | 0 | −12 à 12 |
speech_rate | Non | 0 | −50 à 100 (100 = 2,0x, −50 = 0,5x) |
loudness_rate | Non | 0 | −50 à 100 |
Pour cloner ou référencer une voix, joignez un extrait de référence et pointez dessus depuis le texte :
{
"model": "bytedance/seed-audio-1.0",
"text": "Use the voice of @audio1 and say: your order has shipped.",
"references": [{ "audio_url": "https://example.com/sample-voice.mp3" }]
}Les extraits de référence doivent durer 30 secondes ou moins et peser moins de 10 Mo.
Génération musicale
Composez des morceaux complets, avec ou sans voix. Suno Chirp et MiniMax Music sont disponibles, ainsi qu'un modèle dédié à l'écriture de paroles.
Exemple : Suno Chirp v5
curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
-H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "suno/chirp-v5",
"prompt": "an upbeat indie pop song about summer road trips",
"vocal_gender": "Female"
}'| Paramètre | Requis | Défaut | Remarques |
|---|---|---|---|
prompt | Généralement | — | Avec custom: false, il s'agit d'une description du morceau. Avec custom: true, ce sont les paroles |
custom | Non | false | false = décrire le morceau, true = fournir vos propres paroles |
instrumental | Non | false | Générer sans voix |
vocal_gender | Non | — | Male ou Female. S'applique dans les deux modes |
title, style, negative_tags, style_weight et champs associés | Non | — | N'ont d'effet qu'avec custom: true — sinon ils sont ignorés silencieusement |
Chirp v5 renvoie deux morceaux par requête, plus une pochette générée dans thumbnail. prompt est requis sauf si vous définissez à la fois custom: true et instrumental: true.
Pour écrire les paroles d'abord et composer ensuite, appelez un modèle de paroles tel que minimax/lyrics-generation, puis passez sa sortie dans le champ lyrics du modèle musical.
Reconnaissance vocale
Transcrivez des enregistrements, avec séparation optionnelle des locuteurs et horodatage au mot près.
Les deux modèles de transcription utilisent des noms de champ différents pour l'entrée audio : Seed ASR attend audio_url, xAI STT attend audio. Passer le mauvais champ fait échouer la validation.
Exemple : Seed ASR 2.0
curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
-H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "bytedance/seed-asr-2.0",
"audio_url": "https://example.com/interview.mp3",
"enable_punc": true,
"enable_speaker_info": true,
"show_utterances": true
}'| Paramètre | Requis | Défaut | Remarques |
|---|---|---|---|
audio_url | Oui | — | URL publique ou Base64. wav/mp3/ogg/raw |
format | Non | mp3 | mp3, wav, ogg, raw |
language | Non | auto | Laissez vide pour la détection automatique. Prend en charge 51 langues |
enable_itn | Non | true | Normalisation inverse du texte (« cent » devient « 100 ») |
enable_punc | Non | false | Ajouter la ponctuation |
enable_ddc | Non | false | Lisser les mots de remplissage et les répétitions |
enable_speaker_info | Non | false | Séparation des locuteurs, jusqu'à 10 locuteurs |
show_utterances | Non | false | Renvoyer des segments horodatés |
context | Non | — | Mots-clés prioritaires en ligne. Doit être une chaîne JSON : {"hotwords":[{"word":"Atlas"}]}. Du texte brut ici fait échouer la tâche |
Exemple : xAI STT v1
curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
-H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "xai/stt-v1",
"audio": "https://example.com/interview.mp3",
"diarize": true,
"text_normalization": true
}'| Paramètre | Requis | Défaut | Remarques |
|---|---|---|---|
audio | Oui | — | URL publique ou Base64. Les formats de conteneur sont détectés automatiquement |
language | Non | auto | ISO 639-1. Prend en charge 24 langues |
text_normalization | Non | false | « cent dollars » devient « 100 $ » |
keyterm | Non | [] | Jusqu'à 100 termes de biais, 50 caractères chacun |
diarize | Non | false | Séparation des locuteurs, ajoute speaker_id par mot |
filler_words | Non | false | Conserver les « euh » et « hum » (supprimés par défaut) |
multichannel | Non | false | Transcrire chaque canal séparément |
Lire le résultat
{
"code": 200,
"data": {
"id": "…",
"status": "completed",
"outputs": ["Thanks for joining the call today…"],
"stt_result": {
"text": "Thanks for joining the call today…",
"duration": 184.2,
"words": [
{ "text": "Thanks", "start": 0.12, "end": 0.41, "speaker_id": "1" }
]
}
}
}outputs[0] contient la transcription brute. La sortie structurée — timings, locuteurs, langue détectée — se trouve dans stt_result.
Fournir une entrée audio
Les champs d'entrée audio acceptent soit une URL HTTPS publique, soit une data URI en Base64. Les entrées Base64 sont stockées automatiquement et remplacées par une URL avant que la requête n'atteigne le modèle.
Pour les fichiers locaux, téléversez-les d'abord et utilisez l'URL renvoyée :
curl -X POST https://api.atlascloud.ai/api/v1/model/uploadMedia \
-H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
-F "[email protected]"Voir Téléverser des fichiers pour les limites et les détails.
Facturation
Les modèles audio sont facturés de trois manières, selon le modèle :
| Méthode | S'applique à | Base |
|---|---|---|
| Par tranche de 1 000 caractères | La plupart des modèles de synthèse vocale | Longueur du text d'entrée |
| Par seconde de sortie | Certains modèles vocaux, dont Seed Audio 1.0 | Durée réellement générée, arrondie au supérieur |
| Par minute d'entrée | Modèles de reconnaissance vocale | Durée de l'audio soumis |
Les tâches en échec ne sont pas facturées. Pour les modèles facturés à la durée de sortie, un montant est retenu à la soumission puis régularisé sur la durée réelle à l'achèvement.
Utilisez le point de terminaison de tarification pour obtenir un devis exact avant de générer, et consultez Facturation des modèles pour des exemples chiffrés.
Trouver des modèles audio
Le catalogue de modèles change fréquemment. Plutôt que de coder une liste en dur, filtrez le catalogue par type :
- Parcourez la Bibliothèque de modèles et filtrez par Text-to-Audio ou Audio-to-Text
- Ou listez-les depuis un agent avec le Serveur MCP en utilisant
atlas_list_modelsavectype="Audio"
Les paramètres exacts de chaque modèle sont publiés sur sa propre page de référence API, sous Model endpoints.
Voir aussi
Last updated on