Audio-Modelle

Sprache erzeugen, Musik komponieren und Aufnahmen transkribieren — über einen einzigen Atlas Cloud Endpunkt. Behandelt Seed Audio, ElevenLabs, MiniMax, Gemini TTS, Suno, Seed ASR und xAI STT.

Atlas Cloud stellt drei verschiedene Audio-Fähigkeiten bereit — Text-to-Speech, Musikgenerierung und Speech-to-Text — über einen einzigen Endpunkt. Welche davon Sie erhalten, bestimmt das gewählte Modell, nicht die URL.

POST https://api.atlascloud.ai/api/v1/model/generateAudio

Es gibt keinen Endpunkt /v1/audio/speech oder /v1/audio/transcriptions. Wenn Sie Code vom OpenAI SDK portieren, lassen sich Audio-Aufrufe nicht eins zu eins übertragen — sie laufen über den unten beschriebenen asynchronen Vorhersage-Ablauf.

So funktioniert es

Audio-Anfragen sind asynchron, wie die Bild- und Videogenerierung:

Aufgabe einreichen. Senden Sie ein POST an generateAudio mit einem model und den modelleigenen Parametern flach auf oberster Ebene.

Vorhersage-ID erhalten. Die Antwort enthält data.id und data.status.

Auf das Ergebnis pollen. GET /api/v1/model/prediction/{id}, bis status einen Endzustand erreicht — oder registrieren Sie einen Webhook und empfangen Sie stattdessen das Ereignis audio.task.terminal.

Den vollständigen Statusautomaten finden Sie unter Vorhersagen, die Callback-Einrichtung unter Webhooks.

Transkriptions- und Songtext-Ergebnisse sind Text, keine URLs. Bei den meisten Audio-Modellen ist outputs[0] ein Link zu einer erzeugten Datei. Bei Speech-to-Text- und Songtext-Modellen enthält outputs[0] den Text selbst — der gelegentlich wie eine URL aussehen kann. Behandeln Sie outputs[0] niemals blind als etwas zum Herunterladen; verzweigen Sie nach Modelltyp.

Text-to-Speech

Sprache aus Text synthetisieren. Verfügbare Modelle sind unter anderem Seed Audio, ElevenLabs, MiniMax Speech, Gemini TTS und xAI TTS.

Beispiel: Seed Audio 1.0

curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
  -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "bytedance/seed-audio-1.0",
    "text": "Welcome to Atlas Cloud.",
    "format": "mp3",
    "sample_rate": 24000
  }'
ParameterErforderlichStandardHinweise
textJaDer zu synthetisierende Text
referencesNeinBis zu 3 Stimmreferenzen oder eine einzelne Bildreferenz. Jeder Eintrag nutzt genau eine Quelle; Audio- und Bildreferenzen können nicht gemischt werden
formatNeinmp3mp3, wav, pcm, ogg_opus
sample_rateNein240008000, 16000, 24000, 32000, 44100, 48000
pitch_rateNein0−12 bis 12
speech_rateNein0−50 bis 100 (100 = 2,0x, −50 = 0,5x)
loudness_rateNein0−50 bis 100

Um eine Stimme zu klonen oder zu referenzieren, hängen Sie einen Referenzclip an und verweisen Sie im Text darauf:

{
  "model": "bytedance/seed-audio-1.0",
  "text": "Use the voice of @audio1 and say: your order has shipped.",
  "references": [{ "audio_url": "https://example.com/sample-voice.mp3" }]
}

Referenzclips dürfen höchstens 30 Sekunden lang und kleiner als 10 MB sein.

Musikgenerierung

Komplette Tracks komponieren, mit oder ohne Gesang. Suno Chirp und MiniMax Music sind verfügbar, dazu ein eigenes Modell zum Schreiben von Songtexten.

Beispiel: Suno Chirp v5

curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
  -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "suno/chirp-v5",
    "prompt": "an upbeat indie pop song about summer road trips",
    "vocal_gender": "Female"
  }'
ParameterErforderlichStandardHinweise
promptMeistensMit custom: false ist dies eine Beschreibung des Songs. Mit custom: true sind es die Songtexte
customNeinfalsefalse = Song beschreiben, true = eigene Songtexte liefern
instrumentalNeinfalseOhne Gesang generieren
vocal_genderNeinMale oder Female. Gilt in beiden Modi
title, style, negative_tags, style_weight und verwandte FelderNeinWirken nur bei custom: true — andernfalls werden sie stillschweigend ignoriert

Chirp v5 liefert zwei Tracks pro Anfrage sowie ein generiertes Coverbild in thumbnail. prompt ist erforderlich, außer Sie setzen sowohl custom: true als auch instrumental: true.

Wenn Sie zuerst Songtexte schreiben und dann komponieren möchten, rufen Sie ein Songtext-Modell wie minimax/lyrics-generation auf und übergeben dessen Ausgabe an das Feld lyrics des Musikmodells.

Speech-to-Text

Aufnahmen transkribieren, optional mit Sprechertrennung und Zeitstempeln auf Wortebene.

Die beiden Transkriptionsmodelle verwenden unterschiedliche Feldnamen für die Audio-Eingabe: Seed ASR erwartet audio_url, xAI STT erwartet audio. Wird das falsche Feld übergeben, scheitert die Validierung.

Beispiel: Seed ASR 2.0

curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
  -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "bytedance/seed-asr-2.0",
    "audio_url": "https://example.com/interview.mp3",
    "enable_punc": true,
    "enable_speaker_info": true,
    "show_utterances": true
  }'
ParameterErforderlichStandardHinweise
audio_urlJaÖffentliche URL oder Base64. wav/mp3/ogg/raw
formatNeinmp3mp3, wav, ogg, raw
languageNeinautomatischLeer lassen für automatische Erkennung. Unterstützt 51 Sprachen
enable_itnNeintrueInverse Textnormalisierung („einhundert" wird zu „100")
enable_puncNeinfalseSatzzeichen ergänzen
enable_ddcNeinfalseFüllwörter und Wiederholungen glätten
enable_speaker_infoNeinfalseSprechertrennung, bis zu 10 Sprecher
show_utterancesNeinfalseSegmente mit Zeitstempeln zurückgeben
contextNeinInline-Hotwords. Muss ein JSON-String sein: {"hotwords":[{"word":"Atlas"}]}. Reiner Text lässt die Aufgabe fehlschlagen

Beispiel: xAI STT v1

curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
  -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "xai/stt-v1",
    "audio": "https://example.com/interview.mp3",
    "diarize": true,
    "text_normalization": true
  }'
ParameterErforderlichStandardHinweise
audioJaÖffentliche URL oder Base64. Containerformate werden automatisch erkannt
languageNeinautomatischISO 639-1. Unterstützt 24 Sprachen
text_normalizationNeinfalse„einhundert Dollar" wird zu „100 $"
keytermNein[]Bis zu 100 Bias-Begriffe mit je 50 Zeichen
diarizeNeinfalseSprechertrennung, ergänzt speaker_id pro Wort
filler_wordsNeinfalse„ähm" und „öh" beibehalten (standardmäßig entfernt)
multichannelNeinfalseJeden Kanal einzeln transkribieren

Das Ergebnis lesen

{
  "code": 200,
  "data": {
    "id": "…",
    "status": "completed",
    "outputs": ["Thanks for joining the call today…"],
    "stt_result": {
      "text": "Thanks for joining the call today…",
      "duration": 184.2,
      "words": [
        { "text": "Thanks", "start": 0.12, "end": 0.41, "speaker_id": "1" }
      ]
    }
  }
}

outputs[0] enthält das reine Transkript. Die strukturierte Ausgabe — Zeitangaben, Sprecher, erkannte Sprache — steht in stt_result.

Audio-Eingaben bereitstellen

Audio-Eingabefelder akzeptieren entweder eine öffentliche HTTPS-URL oder einen Base64-Data-URI. Base64-Eingaben werden automatisch gespeichert und durch eine URL ersetzt, bevor die Anfrage das Modell erreicht.

Laden Sie lokale Dateien zuerst hoch und verwenden Sie die zurückgegebene URL:

curl -X POST https://api.atlascloud.ai/api/v1/model/uploadMedia \
  -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
  -F "[email protected]"

Limits und Details finden Sie unter Dateien hochladen.

Abrechnung

Audio-Modelle werden je nach Modell auf eine von drei Arten abgerechnet:

MethodeGilt fürGrundlage
Pro 1.000 ZeichenDie meisten Text-to-Speech-ModelleLänge des Eingabetexts text
Pro Sekunde AusgabeEinige Sprachmodelle, darunter Seed Audio 1.0Tatsächlich erzeugte Dauer, aufgerundet
Pro Minute EingabeSpeech-to-Text-ModelleDauer des eingereichten Audios

Fehlgeschlagene Aufgaben werden nicht abgerechnet. Bei Modellen, die nach Ausgabedauer abgerechnet werden, wird bei Einreichung ein Betrag reserviert und bei Abschluss gegen die tatsächliche Dauer verrechnet.

Nutzen Sie den Preis-Endpunkt, um vor der Generierung ein exaktes Angebot zu erhalten; ausgearbeitete Beispiele finden Sie unter Modellabrechnung.

Audio-Modelle finden

Der Modellkatalog ändert sich häufig. Anstatt eine Liste fest zu verdrahten, filtern Sie den Katalog nach Typ:

  • Durchsuchen Sie die Modellbibliothek und filtern Sie nach Text-to-Audio oder Audio-to-Text
  • Oder lassen Sie sie von einem Agenten über den MCP-Server mit atlas_list_models und type="Audio" auflisten

Die genauen Parameter jedes Modells sind auf seiner eigenen API-Referenzseite unter Model endpoints veröffentlicht.

Verwandte Themen

Last updated on

On this page