音频模型
通过同一个 Atlas Cloud 端点合成语音、创作音乐、转写录音。涵盖 Seed Audio、ElevenLabs、MiniMax、Gemini TTS、Suno、Seed ASR 与 xAI STT。
Atlas Cloud 通过单一端点提供三类音频能力——语音合成、音乐生成和语音转文本。具体走哪一类由你选择的模型决定,而不是由 URL 决定。
POST https://api.atlascloud.ai/api/v1/model/generateAudio平台上没有 /v1/audio/speech 或 /v1/audio/transcriptions 端点。如果你要从 OpenAI SDK 迁移代码,音频调用不能一一对应——它们走的是下面介绍的异步预测任务流程。
工作方式
音频请求和图像、视频生成一样是异步的:
提交任务。 向 generateAudio 发起 POST 请求,带上 model,并把该模型自己的参数平铺在顶层。
拿到 prediction ID。 响应会返回 data.id 和 data.status。
轮询获取结果。 调用 GET /api/v1/model/prediction/{id},直到 status 进入终态;也可以注册 webhook,改为接收 audio.task.terminal 事件。
转写结果和歌词结果是文本,不是 URL。 对大多数音频模型来说,outputs[0] 是生成文件的链接。但对语音转文本和歌词生成模型,outputs[0] 里装的就是文本本身——而且偶尔看起来会很像一个 URL。不要不加判断地把 outputs[0] 当作可下载的地址;请按模型类型分支处理。
语音合成
从文本合成语音。可用模型包括 Seed Audio、ElevenLabs、MiniMax Speech、Gemini TTS 和 xAI TTS。
示例:Seed Audio 1.0
curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
-H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "bytedance/seed-audio-1.0",
"text": "Welcome to Atlas Cloud.",
"format": "mp3",
"sample_rate": 24000
}'| 参数 | 必填 | 默认值 | 说明 |
|---|---|---|---|
text | 是 | — | 要合成的文本 |
references | 否 | — | 最多 3 段音色参考,或者单张图片参考。每一项只能使用一个来源,音频参考和图片参考不能混用 |
format | 否 | mp3 | mp3、wav、pcm、ogg_opus |
sample_rate | 否 | 24000 | 8000、16000、24000、32000、44100、48000 |
pitch_rate | 否 | 0 | −12 到 12 |
speech_rate | 否 | 0 | −50 到 100(100 = 2.0 倍速,−50 = 0.5 倍速) |
loudness_rate | 否 | 0 | −50 到 100 |
要克隆或引用某个音色,附上参考音频片段,并在文本中指向它:
{
"model": "bytedance/seed-audio-1.0",
"text": "Use the voice of @audio1 and say: your order has shipped.",
"references": [{ "audio_url": "https://example.com/sample-voice.mp3" }]
}参考音频片段不得超过 30 秒,且小于 10 MB。
音乐生成
创作完整曲目,可带人声也可不带。平台提供 Suno Chirp 和 MiniMax Music,另有专门的歌词写作模型。
示例:Suno Chirp v5
curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
-H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "suno/chirp-v5",
"prompt": "an upbeat indie pop song about summer road trips",
"vocal_gender": "Female"
}'| 参数 | 必填 | 默认值 | 说明 |
|---|---|---|---|
prompt | 通常需要 | — | 当 custom: false 时,这是对歌曲的描述;当 custom: true 时,这里放的是歌词 |
custom | 否 | false | false = 描述歌曲,true = 提供你自己的歌词 |
instrumental | 否 | false | 生成纯伴奏(无人声) |
vocal_gender | 否 | — | Male 或 Female。两种模式下都生效 |
title、style、negative_tags、style_weight 及相关字段 | 否 | — | 仅在 custom: true 时生效——否则会被静默忽略 |
Chirp v5 每次请求返回两条曲目,并在 thumbnail 中附带一张生成的封面图。除非同时设置 custom: true 和 instrumental: true,否则 prompt 是必填的。
如果想先写词再作曲,可以先调用 minimax/lyrics-generation 这类歌词模型,再把它的输出传给音乐模型的 lyrics 字段。
语音转文本
转写录音,可选择开启说话人分离和词级时间戳。
两个转写模型使用不同的音频输入字段名:Seed ASR 用 audio_url,xAI STT 用 audio。传错会导致参数校验失败。
示例:Seed ASR 2.0
curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
-H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "bytedance/seed-asr-2.0",
"audio_url": "https://example.com/interview.mp3",
"enable_punc": true,
"enable_speaker_info": true,
"show_utterances": true
}'| 参数 | 必填 | 默认值 | 说明 |
|---|---|---|---|
audio_url | 是 | — | 公开 URL 或 Base64。支持 wav/mp3/ogg/raw |
format | 否 | mp3 | mp3、wav、ogg、raw |
language | 否 | 自动 | 留空则自动检测。支持 51 种语言 |
enable_itn | 否 | true | 逆文本正则化(把“一百”转成“100”) |
enable_punc | 否 | false | 添加标点符号 |
enable_ddc | 否 | false | 平滑处理语气词和重复内容 |
enable_speaker_info | 否 | false | 说话人分离,最多 10 人 |
show_utterances | 否 | false | 返回带时间戳的分句 |
context | 否 | — | 内联热词。必须是 JSON 字符串:{"hotwords":[{"word":"Atlas"}]}。这里传纯文本会导致任务失败 |
示例:xAI STT v1
curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
-H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "xai/stt-v1",
"audio": "https://example.com/interview.mp3",
"diarize": true,
"text_normalization": true
}'| 参数 | 必填 | 默认值 | 说明 |
|---|---|---|---|
audio | 是 | — | 公开 URL 或 Base64。容器格式会自动识别 |
language | 否 | 自动 | ISO 639-1。支持 24 种语言 |
text_normalization | 否 | false | 把“one hundred dollars”转成“$100” |
keyterm | 否 | [] | 最多 100 个偏置词,每个不超过 50 个字符 |
diarize | 否 | false | 说话人分离,为每个词添加 speaker_id |
filler_words | 否 | false | 保留“um”“uh”等语气词(默认会移除) |
multichannel | 否 | false | 分声道独立转写 |
读取结果
{
"code": 200,
"data": {
"id": "…",
"status": "completed",
"outputs": ["Thanks for joining the call today…"],
"stt_result": {
"text": "Thanks for joining the call today…",
"duration": 184.2,
"words": [
{ "text": "Thanks", "start": 0.12, "end": 0.41, "speaker_id": "1" }
]
}
}
}outputs[0] 里是纯文本转写结果。结构化输出——时间轴、说话人、识别出的语言——都在 stt_result 中。
提供音频输入
音频输入字段既接受公开的 HTTPS URL,也接受 Base64 data URI。Base64 输入会被自动存储,并在请求到达模型之前替换为 URL。
对于本地文件,请先上传再使用返回的 URL:
curl -X POST https://api.atlascloud.ai/api/v1/model/uploadMedia \
-H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
-F "[email protected]"限制和细节参见 上传文件。
计费
音频模型有三种计费方式,具体取决于模型:
| 计费方式 | 适用范围 | 计费依据 |
|---|---|---|
| 按每 1,000 字符 | 大多数语音合成模型 | 输入 text 的长度 |
| 按输出秒数 | 部分语音模型,包括 Seed Audio 1.0 | 实际生成时长,向上取整 |
| 按输入分钟数 | 语音转文本模型 | 提交音频的时长 |
失败的任务不计费。对按输出时长计费的模型,提交任务时会先冻结一笔金额,完成后再按真实时长结算。
生成前可以调用定价端点获取准确报价,具体算例参见 模型如何计费。
查找音频模型
模型库更新频繁。与其把模型列表写死在代码里,不如按类型筛选:
- 打开 模型库,按 Text-to-Audio 或 Audio-to-Text 筛选
- 或者在助手中通过 MCP Server 调用
atlas_list_models,传入type="Audio"
每个模型的确切参数都发布在 模型端点 下各自的 API 参考页面中。
相关内容
Last updated on