Model Audio

Hasilkan suara, susun musik, dan transkripsikan rekaman melalui satu endpoint Atlas Cloud. Mencakup Seed Audio, ElevenLabs, MiniMax, Gemini TTS, Suno, Seed ASR, dan xAI STT.

Atlas Cloud menyediakan tiga kemampuan audio yang berbeda — text-to-speech, pembuatan musik, dan speech-to-text — melalui satu endpoint. Kemampuan mana yang Anda peroleh ditentukan oleh model yang dipilih, bukan oleh URL-nya.

POST https://api.atlascloud.ai/api/v1/model/generateAudio

Tidak ada endpoint /v1/audio/speech maupun /v1/audio/transcriptions. Jika Anda memindahkan kode dari OpenAI SDK, panggilan audio tidak dipetakan satu lawan satu — panggilan tersebut melewati alur prediksi asinkron yang dijelaskan di bawah ini.

Cara kerjanya

Permintaan audio bersifat asinkron, sama seperti pembuatan gambar dan video:

Kirim tugas. Lakukan POST ke generateAudio dengan model beserta parameter khas model tersebut yang diletakkan langsung di tingkat teratas.

Dapatkan prediction ID. Respons mengembalikan data.id dan data.status.

Lakukan polling untuk hasilnya. Panggil GET /api/v1/model/prediction/{id} sampai status mencapai kondisi akhir, atau daftarkan webhook dan terima event audio.task.terminal sebagai gantinya.

Lihat Prediksi untuk diagram status lengkap dan Webhook untuk pengaturan callback.

Hasil transkripsi dan lirik berupa teks, bukan URL. Pada sebagian besar model audio, outputs[0] adalah tautan ke berkas yang dihasilkan. Untuk model speech-to-text dan pembuatan lirik, outputs[0] berisi teksnya sendiri — yang kadang terlihat seperti URL. Jangan pernah langsung memperlakukan outputs[0] sebagai berkas untuk diunduh; percabangkan logika berdasarkan tipe model.

Text-to-speech

Sintesiskan suara dari teks. Model yang tersedia mencakup Seed Audio, ElevenLabs, MiniMax Speech, Gemini TTS, dan xAI TTS.

Contoh: Seed Audio 1.0

curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
  -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "bytedance/seed-audio-1.0",
    "text": "Welcome to Atlas Cloud.",
    "format": "mp3",
    "sample_rate": 24000
  }'
ParameterWajibBawaanCatatan
textYa—Teks yang akan disintesiskan
referencesTidak—Hingga 3 referensi suara, atau satu referensi gambar. Setiap entri memakai tepat satu sumber, dan referensi audio tidak boleh dicampur dengan referensi gambar
formatTidakmp3mp3, wav, pcm, ogg_opus
sample_rateTidak240008000, 16000, 24000, 32000, 44100, 48000
pitch_rateTidak0−12 sampai 12
speech_rateTidak0−50 sampai 100 (100 = 2.0x, −50 = 0.5x)
loudness_rateTidak0−50 sampai 100

Untuk mengkloning atau mereferensikan sebuah suara, lampirkan klip referensi dan tunjuk klip tersebut dari dalam teks:

{
  "model": "bytedance/seed-audio-1.0",
  "text": "Use the voice of @audio1 and say: your order has shipped.",
  "references": [{ "audio_url": "https://example.com/sample-voice.mp3" }]
}

Klip referensi harus berdurasi maksimal 30 detik dan berukuran di bawah 10 MB.

Pembuatan musik

Susun lagu utuh, dengan atau tanpa vokal. Suno Chirp dan MiniMax Music tersedia, ditambah satu model khusus penulis lirik.

Contoh: Suno Chirp v5

curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
  -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "suno/chirp-v5",
    "prompt": "an upbeat indie pop song about summer road trips",
    "vocal_gender": "Female"
  }'
ParameterWajibBawaanCatatan
promptUmumnya ya—Dengan custom: false, ini adalah deskripsi lagu. Dengan custom: true, ini adalah liriknya
customTidakfalsefalse = mendeskripsikan lagu, true = memasok lirik Anda sendiri
instrumentalTidakfalseMembuat lagu tanpa vokal
vocal_genderTidak—Male atau Female. Berlaku pada kedua mode
title, style, negative_tags, style_weight, dan bidang terkaitTidak—Hanya berpengaruh saat custom: true — jika tidak, semuanya diabaikan tanpa peringatan

Chirp v5 mengembalikan dua lagu per permintaan, ditambah gambar sampul yang dihasilkan pada bidang thumbnail. prompt bersifat wajib kecuali Anda menetapkan custom: true dan instrumental: true sekaligus.

Untuk menulis lirik lebih dulu lalu menyusun musiknya, panggil model lirik seperti minimax/lyrics-generation, kemudian teruskan keluarannya ke bidang lyrics pada model musik.

Speech-to-text

Transkripsikan rekaman, dengan opsi pemisahan pembicara dan penanda waktu tingkat kata.

Kedua model transkripsi memakai nama bidang yang berbeda untuk masukan audio: Seed ASR menerima audio_url, sedangkan xAI STT menerima audio. Mengirim bidang yang salah akan gagal validasi.

Contoh: Seed ASR 2.0

curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
  -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "bytedance/seed-asr-2.0",
    "audio_url": "https://example.com/interview.mp3",
    "enable_punc": true,
    "enable_speaker_info": true,
    "show_utterances": true
  }'
ParameterWajibBawaanCatatan
audio_urlYa—URL publik atau Base64. wav/mp3/ogg/raw
formatTidakmp3mp3, wav, ogg, raw
languageTidakotomatisBiarkan kosong untuk deteksi otomatis. Mendukung 51 bahasa
enable_itnTidaktrueNormalisasi teks terbalik ("seratus" menjadi "100")
enable_puncTidakfalseMenambahkan tanda baca
enable_ddcTidakfalseMerapikan kata pengisi dan pengulangan
enable_speaker_infoTidakfalsePemisahan pembicara, hingga 10 pembicara
show_utterancesTidakfalseMengembalikan segmen bertanda waktu
contextTidak—Hotword sebaris. Harus berupa string JSON: {"hotwords":[{"word":"Atlas"}]}. Teks biasa di sini akan menggagalkan tugas

Contoh: xAI STT v1

curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
  -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "xai/stt-v1",
    "audio": "https://example.com/interview.mp3",
    "diarize": true,
    "text_normalization": true
  }'
ParameterWajibBawaanCatatan
audioYa—URL publik atau Base64. Format kontainer dideteksi otomatis
languageTidakotomatisISO 639-1. Mendukung 24 bahasa
text_normalizationTidakfalse"seratus dolar" menjadi "$100"
keytermTidak[]Hingga 100 istilah pengarah, masing-masing 50 karakter
diarizeTidakfalsePemisahan pembicara, menambahkan speaker_id pada tiap kata
filler_wordsTidakfalseMempertahankan "um" dan "uh" (dihapus secara bawaan)
multichannelTidakfalseMentranskripsikan setiap kanal secara terpisah

Membaca hasilnya

{
  "code": 200,
  "data": {
    "id": "…",
    "status": "completed",
    "outputs": ["Thanks for joining the call today…"],
    "stt_result": {
      "text": "Thanks for joining the call today…",
      "duration": 184.2,
      "words": [
        { "text": "Thanks", "start": 0.12, "end": 0.41, "speaker_id": "1" }
      ]
    }
  }
}

outputs[0] memuat transkrip polos. Keluaran terstruktur — penanda waktu, pembicara, bahasa yang terdeteksi — berada di stt_result.

Menyediakan masukan audio

Bidang masukan audio menerima URL HTTPS publik atau data URI Base64. Masukan Base64 disimpan secara otomatis dan diganti dengan URL sebelum permintaan sampai ke model.

Untuk berkas lokal, unggah terlebih dahulu lalu gunakan URL yang dikembalikan:

curl -X POST https://api.atlascloud.ai/api/v1/model/uploadMedia \
  -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
  -F "[email protected]"

Lihat Upload File untuk batasan dan detailnya.

Penagihan

Model audio ditagih dengan salah satu dari tiga cara, bergantung pada modelnya:

MetodeBerlaku untukDasar perhitungan
Per 1.000 karakterSebagian besar model text-to-speechPanjang masukan text
Per detik keluaranBeberapa model suara, termasuk Seed Audio 1.0Durasi hasil sebenarnya, dibulatkan ke atas
Per menit masukanModel speech-to-textDurasi audio yang dikirimkan

Tugas yang gagal tidak ditagih. Untuk model yang ditagih berdasarkan durasi keluaran, sejumlah dana ditahan saat tugas dikirim lalu diselesaikan berdasarkan durasi sebenarnya setelah tugas rampung.

Gunakan endpoint harga untuk memperoleh estimasi yang tepat sebelum membuat konten, dan lihat Cara Model Ditagih untuk contoh perhitungannya.

Menemukan model audio

Katalog model sering berubah. Alih-alih menuliskan daftar secara permanen di kode, saring katalog berdasarkan tipe:

  • Telusuri Model Library lalu saring dengan Text-to-Audio atau Audio-to-Text
  • Atau tampilkan daftarnya dari sebuah agen melalui MCP Server dengan atlas_list_models dan type="Audio"

Parameter persis setiap model diterbitkan pada halaman referensi API masing-masing di bagian Model endpoints.

Terkait

Last updated on

On this page