Model Audio
Hasilkan suara, susun musik, dan transkripsikan rekaman melalui satu endpoint Atlas Cloud. Mencakup Seed Audio, ElevenLabs, MiniMax, Gemini TTS, Suno, Seed ASR, dan xAI STT.
Atlas Cloud menyediakan tiga kemampuan audio yang berbeda — text-to-speech, pembuatan musik, dan speech-to-text — melalui satu endpoint. Kemampuan mana yang Anda peroleh ditentukan oleh model yang dipilih, bukan oleh URL-nya.
POST https://api.atlascloud.ai/api/v1/model/generateAudioTidak ada endpoint /v1/audio/speech maupun /v1/audio/transcriptions. Jika Anda memindahkan kode dari OpenAI SDK, panggilan audio tidak dipetakan satu lawan satu — panggilan tersebut melewati alur prediksi asinkron yang dijelaskan di bawah ini.
Cara kerjanya
Permintaan audio bersifat asinkron, sama seperti pembuatan gambar dan video:
Kirim tugas. Lakukan POST ke generateAudio dengan model beserta parameter khas model tersebut yang diletakkan langsung di tingkat teratas.
Dapatkan prediction ID. Respons mengembalikan data.id dan data.status.
Lakukan polling untuk hasilnya. Panggil GET /api/v1/model/prediction/{id} sampai status mencapai kondisi akhir, atau daftarkan webhook dan terima event audio.task.terminal sebagai gantinya.
Lihat Prediksi untuk diagram status lengkap dan Webhook untuk pengaturan callback.
Hasil transkripsi dan lirik berupa teks, bukan URL. Pada sebagian besar model audio, outputs[0] adalah tautan ke berkas yang dihasilkan. Untuk model speech-to-text dan pembuatan lirik, outputs[0] berisi teksnya sendiri — yang kadang terlihat seperti URL. Jangan pernah langsung memperlakukan outputs[0] sebagai berkas untuk diunduh; percabangkan logika berdasarkan tipe model.
Text-to-speech
Sintesiskan suara dari teks. Model yang tersedia mencakup Seed Audio, ElevenLabs, MiniMax Speech, Gemini TTS, dan xAI TTS.
Contoh: Seed Audio 1.0
curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
-H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "bytedance/seed-audio-1.0",
"text": "Welcome to Atlas Cloud.",
"format": "mp3",
"sample_rate": 24000
}'| Parameter | Wajib | Bawaan | Catatan |
|---|---|---|---|
text | Ya | — | Teks yang akan disintesiskan |
references | Tidak | — | Hingga 3 referensi suara, atau satu referensi gambar. Setiap entri memakai tepat satu sumber, dan referensi audio tidak boleh dicampur dengan referensi gambar |
format | Tidak | mp3 | mp3, wav, pcm, ogg_opus |
sample_rate | Tidak | 24000 | 8000, 16000, 24000, 32000, 44100, 48000 |
pitch_rate | Tidak | 0 | −12 sampai 12 |
speech_rate | Tidak | 0 | −50 sampai 100 (100 = 2.0x, −50 = 0.5x) |
loudness_rate | Tidak | 0 | −50 sampai 100 |
Untuk mengkloning atau mereferensikan sebuah suara, lampirkan klip referensi dan tunjuk klip tersebut dari dalam teks:
{
"model": "bytedance/seed-audio-1.0",
"text": "Use the voice of @audio1 and say: your order has shipped.",
"references": [{ "audio_url": "https://example.com/sample-voice.mp3" }]
}Klip referensi harus berdurasi maksimal 30 detik dan berukuran di bawah 10 MB.
Pembuatan musik
Susun lagu utuh, dengan atau tanpa vokal. Suno Chirp dan MiniMax Music tersedia, ditambah satu model khusus penulis lirik.
Contoh: Suno Chirp v5
curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
-H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "suno/chirp-v5",
"prompt": "an upbeat indie pop song about summer road trips",
"vocal_gender": "Female"
}'| Parameter | Wajib | Bawaan | Catatan |
|---|---|---|---|
prompt | Umumnya ya | — | Dengan custom: false, ini adalah deskripsi lagu. Dengan custom: true, ini adalah liriknya |
custom | Tidak | false | false = mendeskripsikan lagu, true = memasok lirik Anda sendiri |
instrumental | Tidak | false | Membuat lagu tanpa vokal |
vocal_gender | Tidak | — | Male atau Female. Berlaku pada kedua mode |
title, style, negative_tags, style_weight, dan bidang terkait | Tidak | — | Hanya berpengaruh saat custom: true — jika tidak, semuanya diabaikan tanpa peringatan |
Chirp v5 mengembalikan dua lagu per permintaan, ditambah gambar sampul yang dihasilkan pada bidang thumbnail. prompt bersifat wajib kecuali Anda menetapkan custom: true dan instrumental: true sekaligus.
Untuk menulis lirik lebih dulu lalu menyusun musiknya, panggil model lirik seperti minimax/lyrics-generation, kemudian teruskan keluarannya ke bidang lyrics pada model musik.
Speech-to-text
Transkripsikan rekaman, dengan opsi pemisahan pembicara dan penanda waktu tingkat kata.
Kedua model transkripsi memakai nama bidang yang berbeda untuk masukan audio: Seed ASR menerima audio_url, sedangkan xAI STT menerima audio. Mengirim bidang yang salah akan gagal validasi.
Contoh: Seed ASR 2.0
curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
-H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "bytedance/seed-asr-2.0",
"audio_url": "https://example.com/interview.mp3",
"enable_punc": true,
"enable_speaker_info": true,
"show_utterances": true
}'| Parameter | Wajib | Bawaan | Catatan |
|---|---|---|---|
audio_url | Ya | — | URL publik atau Base64. wav/mp3/ogg/raw |
format | Tidak | mp3 | mp3, wav, ogg, raw |
language | Tidak | otomatis | Biarkan kosong untuk deteksi otomatis. Mendukung 51 bahasa |
enable_itn | Tidak | true | Normalisasi teks terbalik ("seratus" menjadi "100") |
enable_punc | Tidak | false | Menambahkan tanda baca |
enable_ddc | Tidak | false | Merapikan kata pengisi dan pengulangan |
enable_speaker_info | Tidak | false | Pemisahan pembicara, hingga 10 pembicara |
show_utterances | Tidak | false | Mengembalikan segmen bertanda waktu |
context | Tidak | — | Hotword sebaris. Harus berupa string JSON: {"hotwords":[{"word":"Atlas"}]}. Teks biasa di sini akan menggagalkan tugas |
Contoh: xAI STT v1
curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
-H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "xai/stt-v1",
"audio": "https://example.com/interview.mp3",
"diarize": true,
"text_normalization": true
}'| Parameter | Wajib | Bawaan | Catatan |
|---|---|---|---|
audio | Ya | — | URL publik atau Base64. Format kontainer dideteksi otomatis |
language | Tidak | otomatis | ISO 639-1. Mendukung 24 bahasa |
text_normalization | Tidak | false | "seratus dolar" menjadi "$100" |
keyterm | Tidak | [] | Hingga 100 istilah pengarah, masing-masing 50 karakter |
diarize | Tidak | false | Pemisahan pembicara, menambahkan speaker_id pada tiap kata |
filler_words | Tidak | false | Mempertahankan "um" dan "uh" (dihapus secara bawaan) |
multichannel | Tidak | false | Mentranskripsikan setiap kanal secara terpisah |
Membaca hasilnya
{
"code": 200,
"data": {
"id": "…",
"status": "completed",
"outputs": ["Thanks for joining the call today…"],
"stt_result": {
"text": "Thanks for joining the call today…",
"duration": 184.2,
"words": [
{ "text": "Thanks", "start": 0.12, "end": 0.41, "speaker_id": "1" }
]
}
}
}outputs[0] memuat transkrip polos. Keluaran terstruktur — penanda waktu, pembicara, bahasa yang terdeteksi — berada di stt_result.
Menyediakan masukan audio
Bidang masukan audio menerima URL HTTPS publik atau data URI Base64. Masukan Base64 disimpan secara otomatis dan diganti dengan URL sebelum permintaan sampai ke model.
Untuk berkas lokal, unggah terlebih dahulu lalu gunakan URL yang dikembalikan:
curl -X POST https://api.atlascloud.ai/api/v1/model/uploadMedia \
-H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
-F "[email protected]"Lihat Upload File untuk batasan dan detailnya.
Penagihan
Model audio ditagih dengan salah satu dari tiga cara, bergantung pada modelnya:
| Metode | Berlaku untuk | Dasar perhitungan |
|---|---|---|
| Per 1.000 karakter | Sebagian besar model text-to-speech | Panjang masukan text |
| Per detik keluaran | Beberapa model suara, termasuk Seed Audio 1.0 | Durasi hasil sebenarnya, dibulatkan ke atas |
| Per menit masukan | Model speech-to-text | Durasi audio yang dikirimkan |
Tugas yang gagal tidak ditagih. Untuk model yang ditagih berdasarkan durasi keluaran, sejumlah dana ditahan saat tugas dikirim lalu diselesaikan berdasarkan durasi sebenarnya setelah tugas rampung.
Gunakan endpoint harga untuk memperoleh estimasi yang tepat sebelum membuat konten, dan lihat Cara Model Ditagih untuk contoh perhitungannya.
Menemukan model audio
Katalog model sering berubah. Alih-alih menuliskan daftar secara permanen di kode, saring katalog berdasarkan tipe:
- Telusuri Model Library lalu saring dengan Text-to-Audio atau Audio-to-Text
- Atau tampilkan daftarnya dari sebuah agen melalui MCP Server dengan
atlas_list_modelsdantype="Audio"
Parameter persis setiap model diterbitkan pada halaman referensi API masing-masing di bagian Model endpoints.
Terkait
Last updated on