Audio-Modelle
Sprache erzeugen, Musik komponieren und Aufnahmen transkribieren — über einen einzigen Atlas Cloud Endpunkt. Behandelt Seed Audio, ElevenLabs, MiniMax, Gemini TTS, Suno, Seed ASR und xAI STT.
Atlas Cloud stellt drei verschiedene Audio-Fähigkeiten bereit — Text-to-Speech, Musikgenerierung und Speech-to-Text — über einen einzigen Endpunkt. Welche davon Sie erhalten, bestimmt das gewählte Modell, nicht die URL.
POST https://api.atlascloud.ai/api/v1/model/generateAudioEs gibt keinen Endpunkt /v1/audio/speech oder /v1/audio/transcriptions. Wenn Sie Code vom OpenAI SDK portieren, lassen sich Audio-Aufrufe nicht eins zu eins übertragen — sie laufen über den unten beschriebenen asynchronen Vorhersage-Ablauf.
So funktioniert es
Audio-Anfragen sind asynchron, wie die Bild- und Videogenerierung:
Aufgabe einreichen. Senden Sie ein POST an generateAudio mit einem model und den modelleigenen Parametern flach auf oberster Ebene.
Vorhersage-ID erhalten. Die Antwort enthält data.id und data.status.
Auf das Ergebnis pollen. GET /api/v1/model/prediction/{id}, bis status einen Endzustand erreicht — oder registrieren Sie einen Webhook und empfangen Sie stattdessen das Ereignis audio.task.terminal.
Den vollständigen Statusautomaten finden Sie unter Vorhersagen, die Callback-Einrichtung unter Webhooks.
Transkriptions- und Songtext-Ergebnisse sind Text, keine URLs. Bei den meisten Audio-Modellen ist outputs[0] ein Link zu einer erzeugten Datei. Bei Speech-to-Text- und Songtext-Modellen enthält outputs[0] den Text selbst — der gelegentlich wie eine URL aussehen kann. Behandeln Sie outputs[0] niemals blind als etwas zum Herunterladen; verzweigen Sie nach Modelltyp.
Text-to-Speech
Sprache aus Text synthetisieren. Verfügbare Modelle sind unter anderem Seed Audio, ElevenLabs, MiniMax Speech, Gemini TTS und xAI TTS.
Beispiel: Seed Audio 1.0
curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
-H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "bytedance/seed-audio-1.0",
"text": "Welcome to Atlas Cloud.",
"format": "mp3",
"sample_rate": 24000
}'| Parameter | Erforderlich | Standard | Hinweise |
|---|---|---|---|
text | Ja | — | Der zu synthetisierende Text |
references | Nein | — | Bis zu 3 Stimmreferenzen oder eine einzelne Bildreferenz. Jeder Eintrag nutzt genau eine Quelle; Audio- und Bildreferenzen können nicht gemischt werden |
format | Nein | mp3 | mp3, wav, pcm, ogg_opus |
sample_rate | Nein | 24000 | 8000, 16000, 24000, 32000, 44100, 48000 |
pitch_rate | Nein | 0 | −12 bis 12 |
speech_rate | Nein | 0 | −50 bis 100 (100 = 2,0x, −50 = 0,5x) |
loudness_rate | Nein | 0 | −50 bis 100 |
Um eine Stimme zu klonen oder zu referenzieren, hängen Sie einen Referenzclip an und verweisen Sie im Text darauf:
{
"model": "bytedance/seed-audio-1.0",
"text": "Use the voice of @audio1 and say: your order has shipped.",
"references": [{ "audio_url": "https://example.com/sample-voice.mp3" }]
}Referenzclips dürfen höchstens 30 Sekunden lang und kleiner als 10 MB sein.
Musikgenerierung
Komplette Tracks komponieren, mit oder ohne Gesang. Suno Chirp und MiniMax Music sind verfügbar, dazu ein eigenes Modell zum Schreiben von Songtexten.
Beispiel: Suno Chirp v5
curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
-H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "suno/chirp-v5",
"prompt": "an upbeat indie pop song about summer road trips",
"vocal_gender": "Female"
}'| Parameter | Erforderlich | Standard | Hinweise |
|---|---|---|---|
prompt | Meistens | — | Mit custom: false ist dies eine Beschreibung des Songs. Mit custom: true sind es die Songtexte |
custom | Nein | false | false = Song beschreiben, true = eigene Songtexte liefern |
instrumental | Nein | false | Ohne Gesang generieren |
vocal_gender | Nein | — | Male oder Female. Gilt in beiden Modi |
title, style, negative_tags, style_weight und verwandte Felder | Nein | — | Wirken nur bei custom: true — andernfalls werden sie stillschweigend ignoriert |
Chirp v5 liefert zwei Tracks pro Anfrage sowie ein generiertes Coverbild in thumbnail. prompt ist erforderlich, außer Sie setzen sowohl custom: true als auch instrumental: true.
Wenn Sie zuerst Songtexte schreiben und dann komponieren möchten, rufen Sie ein Songtext-Modell wie minimax/lyrics-generation auf und übergeben dessen Ausgabe an das Feld lyrics des Musikmodells.
Speech-to-Text
Aufnahmen transkribieren, optional mit Sprechertrennung und Zeitstempeln auf Wortebene.
Die beiden Transkriptionsmodelle verwenden unterschiedliche Feldnamen für die Audio-Eingabe: Seed ASR erwartet audio_url, xAI STT erwartet audio. Wird das falsche Feld übergeben, scheitert die Validierung.
Beispiel: Seed ASR 2.0
curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
-H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "bytedance/seed-asr-2.0",
"audio_url": "https://example.com/interview.mp3",
"enable_punc": true,
"enable_speaker_info": true,
"show_utterances": true
}'| Parameter | Erforderlich | Standard | Hinweise |
|---|---|---|---|
audio_url | Ja | — | Öffentliche URL oder Base64. wav/mp3/ogg/raw |
format | Nein | mp3 | mp3, wav, ogg, raw |
language | Nein | automatisch | Leer lassen für automatische Erkennung. Unterstützt 51 Sprachen |
enable_itn | Nein | true | Inverse Textnormalisierung („einhundert" wird zu „100") |
enable_punc | Nein | false | Satzzeichen ergänzen |
enable_ddc | Nein | false | Füllwörter und Wiederholungen glätten |
enable_speaker_info | Nein | false | Sprechertrennung, bis zu 10 Sprecher |
show_utterances | Nein | false | Segmente mit Zeitstempeln zurückgeben |
context | Nein | — | Inline-Hotwords. Muss ein JSON-String sein: {"hotwords":[{"word":"Atlas"}]}. Reiner Text lässt die Aufgabe fehlschlagen |
Beispiel: xAI STT v1
curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
-H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "xai/stt-v1",
"audio": "https://example.com/interview.mp3",
"diarize": true,
"text_normalization": true
}'| Parameter | Erforderlich | Standard | Hinweise |
|---|---|---|---|
audio | Ja | — | Öffentliche URL oder Base64. Containerformate werden automatisch erkannt |
language | Nein | automatisch | ISO 639-1. Unterstützt 24 Sprachen |
text_normalization | Nein | false | „einhundert Dollar" wird zu „100 $" |
keyterm | Nein | [] | Bis zu 100 Bias-Begriffe mit je 50 Zeichen |
diarize | Nein | false | Sprechertrennung, ergänzt speaker_id pro Wort |
filler_words | Nein | false | „ähm" und „öh" beibehalten (standardmäßig entfernt) |
multichannel | Nein | false | Jeden Kanal einzeln transkribieren |
Das Ergebnis lesen
{
"code": 200,
"data": {
"id": "…",
"status": "completed",
"outputs": ["Thanks for joining the call today…"],
"stt_result": {
"text": "Thanks for joining the call today…",
"duration": 184.2,
"words": [
{ "text": "Thanks", "start": 0.12, "end": 0.41, "speaker_id": "1" }
]
}
}
}outputs[0] enthält das reine Transkript. Die strukturierte Ausgabe — Zeitangaben, Sprecher, erkannte Sprache — steht in stt_result.
Audio-Eingaben bereitstellen
Audio-Eingabefelder akzeptieren entweder eine öffentliche HTTPS-URL oder einen Base64-Data-URI. Base64-Eingaben werden automatisch gespeichert und durch eine URL ersetzt, bevor die Anfrage das Modell erreicht.
Laden Sie lokale Dateien zuerst hoch und verwenden Sie die zurückgegebene URL:
curl -X POST https://api.atlascloud.ai/api/v1/model/uploadMedia \
-H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
-F "[email protected]"Limits und Details finden Sie unter Dateien hochladen.
Abrechnung
Audio-Modelle werden je nach Modell auf eine von drei Arten abgerechnet:
| Methode | Gilt für | Grundlage |
|---|---|---|
| Pro 1.000 Zeichen | Die meisten Text-to-Speech-Modelle | Länge des Eingabetexts text |
| Pro Sekunde Ausgabe | Einige Sprachmodelle, darunter Seed Audio 1.0 | Tatsächlich erzeugte Dauer, aufgerundet |
| Pro Minute Eingabe | Speech-to-Text-Modelle | Dauer des eingereichten Audios |
Fehlgeschlagene Aufgaben werden nicht abgerechnet. Bei Modellen, die nach Ausgabedauer abgerechnet werden, wird bei Einreichung ein Betrag reserviert und bei Abschluss gegen die tatsächliche Dauer verrechnet.
Nutzen Sie den Preis-Endpunkt, um vor der Generierung ein exaktes Angebot zu erhalten; ausgearbeitete Beispiele finden Sie unter Modellabrechnung.
Audio-Modelle finden
Der Modellkatalog ändert sich häufig. Anstatt eine Liste fest zu verdrahten, filtern Sie den Katalog nach Typ:
- Durchsuchen Sie die Modellbibliothek und filtern Sie nach Text-to-Audio oder Audio-to-Text
- Oder lassen Sie sie von einem Agenten über den MCP-Server mit
atlas_list_modelsundtype="Audio"auflisten
Die genauen Parameter jedes Modells sind auf seiner eigenen API-Referenzseite unter Model endpoints veröffentlicht.
Verwandte Themen
Last updated on