音訊模型

透過同一個 Atlas Cloud 端點合成語音、創作音樂、轉寫錄音。涵蓋 Seed Audio、ElevenLabs、MiniMax、Gemini TTS、Suno、Seed ASR 與 xAI STT。

Atlas Cloud 透過單一端點提供三種音訊能力——語音合成音樂生成語音轉文字。實際走哪一種取決於您選擇的模型,而不是 URL。

POST https://api.atlascloud.ai/api/v1/model/generateAudio

平台上並沒有 /v1/audio/speech/v1/audio/transcriptions 端點。如果您要從 OpenAI SDK 移植程式碼,音訊呼叫無法一一對應——它們走的是下方說明的非同步預測流程。

運作方式

音訊請求與圖片、影片生成一樣是非同步的:

提交任務。generateAudio 發出 POST 請求,帶上 model,並將該模型自身的參數平鋪在最上層。

取得 prediction ID。 回應會返回 data.iddata.status

輪詢取得結果。 呼叫 GET /api/v1/model/prediction/{id},直到 status 進入最終狀態;也可以註冊 webhook,改為接收 audio.task.terminal 事件。

完整的狀態機請參閱預測,回呼設定請參閱 Webhook

轉寫結果與歌詞結果是文字,不是 URL。 對大多數音訊模型而言,outputs[0] 是生成檔案的連結。但對語音轉文字與歌詞生成模型,outputs[0] 裡裝的就是文字本身——而且偶爾看起來很像一個 URL。切勿不加判斷就把 outputs[0] 當成可下載的位址;請依模型類型分別處理。

語音合成

從文字合成語音。可用模型包括 Seed Audio、ElevenLabs、MiniMax Speech、Gemini TTS 與 xAI TTS。

範例:Seed Audio 1.0

curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
  -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "bytedance/seed-audio-1.0",
    "text": "Welcome to Atlas Cloud.",
    "format": "mp3",
    "sample_rate": 24000
  }'
參數必填預設值說明
text要合成的文字
references最多 3 段音色參考,或者單張圖片參考。每一項只能使用一種來源,音訊參考與圖片參考不可混用
formatmp3mp3wavpcmogg_opus
sample_rate240008000、16000、24000、32000、44100、48000
pitch_rate0−12 到 12
speech_rate0−50 到 100(100 = 2.0 倍速,−50 = 0.5 倍速)
loudness_rate0−50 到 100

若要複製或引用某個音色,請附上參考音訊片段,並在文字中指向它:

{
  "model": "bytedance/seed-audio-1.0",
  "text": "Use the voice of @audio1 and say: your order has shipped.",
  "references": [{ "audio_url": "https://example.com/sample-voice.mp3" }]
}

參考音訊片段不得超過 30 秒,且需小於 10 MB。

音樂生成

創作完整曲目,可帶人聲也可不帶。平台提供 Suno Chirp 與 MiniMax Music,另有專門的作詞模型。

範例:Suno Chirp v5

curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
  -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "suno/chirp-v5",
    "prompt": "an upbeat indie pop song about summer road trips",
    "vocal_gender": "Female"
  }'
參數必填預設值說明
prompt通常需要custom: false 時,這是對歌曲的描述;當 custom: true 時,這裡放的是歌詞
customfalsefalse = 描述歌曲,true = 提供您自己的歌詞
instrumentalfalse生成純演奏版(無人聲)
vocal_genderMaleFemale。兩種模式下都生效
titlestylenegative_tagsstyle_weight 及相關欄位僅在 custom: true 時生效——否則會被靜默忽略

Chirp v5 每次請求會返回兩首曲目,並在 thumbnail 中附上一張生成的封面圖。除非同時設定 custom: trueinstrumental: true,否則 prompt 為必填。

若想先作詞再作曲,可以先呼叫 minimax/lyrics-generation 這類作詞模型,再把它的輸出傳入音樂模型的 lyrics 欄位。

語音轉文字

轉寫錄音,可選擇開啟說話者分離與逐字時間戳記。

兩個轉寫模型使用不同的音訊輸入欄位名稱:Seed ASR 用 audio_url,xAI STT 用 audio。傳錯會導致參數驗證失敗。

範例:Seed ASR 2.0

curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
  -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "bytedance/seed-asr-2.0",
    "audio_url": "https://example.com/interview.mp3",
    "enable_punc": true,
    "enable_speaker_info": true,
    "show_utterances": true
  }'
參數必填預設值說明
audio_url公開 URL 或 Base64。支援 wav/mp3/ogg/raw
formatmp3mp3wavoggraw
language自動留空則自動偵測。支援 51 種語言
enable_itntrue逆文字正規化(把「一百」轉成「100」)
enable_puncfalse加上標點符號
enable_ddcfalse平滑處理語助詞與重複內容
enable_speaker_infofalse說話者分離,最多 10 人
show_utterancesfalse返回帶時間戳記的分句
context內嵌熱詞。必須是 JSON 字串{"hotwords":[{"word":"Atlas"}]}。這裡傳純文字會導致任務失敗

範例:xAI STT v1

curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
  -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "xai/stt-v1",
    "audio": "https://example.com/interview.mp3",
    "diarize": true,
    "text_normalization": true
  }'
參數必填預設值說明
audio公開 URL 或 Base64。容器格式會自動偵測
language自動ISO 639-1。支援 24 種語言
text_normalizationfalse把「one hundred dollars」轉成「$100」
keyterm[]最多 100 個偏好詞,每個不超過 50 個字元
diarizefalse說話者分離,為每個詞加上 speaker_id
filler_wordsfalse保留「um」「uh」等語助詞(預設會移除)
multichannelfalse各聲道分別轉寫

讀取結果

{
  "code": 200,
  "data": {
    "id": "…",
    "status": "completed",
    "outputs": ["Thanks for joining the call today…"],
    "stt_result": {
      "text": "Thanks for joining the call today…",
      "duration": 184.2,
      "words": [
        { "text": "Thanks", "start": 0.12, "end": 0.41, "speaker_id": "1" }
      ]
    }
  }
}

outputs[0] 是純文字的逐字稿。結構化輸出——時間軸、說話者、偵測到的語言——都放在 stt_result 中。

提供音訊輸入

音訊輸入欄位可接受公開的 HTTPS URL,也可接受 Base64 data URI。Base64 輸入會被自動儲存,並在請求送達模型之前替換成 URL。

若是本機檔案,請先上傳再使用返回的 URL:

curl -X POST https://api.atlascloud.ai/api/v1/model/uploadMedia \
  -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
  -F "[email protected]"

限制與細節請參閱上傳檔案

計費

音訊模型有三種計費方式,取決於模型:

計費方式適用範圍計費依據
每 1,000 字元大多數語音合成模型輸入 text 的長度
每秒輸出部分語音模型,包含 Seed Audio 1.0實際生成時長,無條件進位
每分鐘輸入語音轉文字模型提交音訊的時長

失敗的任務不計費。對以輸出時長計費的模型,提交任務時會先凍結一筆金額,完成後再依實際時長結算。

生成前可以呼叫定價端點取得精確報價,實際算例請參閱模型如何計費

尋找音訊模型

模型庫更新頻繁。與其把模型清單寫死在程式碼中,不如依類型篩選:

  • 開啟模型庫,以 Text-to-AudioAudio-to-Text 篩選
  • 或在助手中透過 MCP Server 呼叫 atlas_list_models,傳入 type="Audio"

每個模型的確切參數都發布在模型端點下各自的 API 參考頁面中。

相關內容

Last updated on

On this page