音訊模型
透過同一個 Atlas Cloud 端點合成語音、創作音樂、轉寫錄音。涵蓋 Seed Audio、ElevenLabs、MiniMax、Gemini TTS、Suno、Seed ASR 與 xAI STT。
Atlas Cloud 透過單一端點提供三種音訊能力——語音合成、音樂生成與語音轉文字。實際走哪一種取決於您選擇的模型,而不是 URL。
POST https://api.atlascloud.ai/api/v1/model/generateAudio平台上並沒有 /v1/audio/speech 或 /v1/audio/transcriptions 端點。如果您要從 OpenAI SDK 移植程式碼,音訊呼叫無法一一對應——它們走的是下方說明的非同步預測流程。
運作方式
音訊請求與圖片、影片生成一樣是非同步的:
提交任務。 對 generateAudio 發出 POST 請求,帶上 model,並將該模型自身的參數平鋪在最上層。
取得 prediction ID。 回應會返回 data.id 與 data.status。
輪詢取得結果。 呼叫 GET /api/v1/model/prediction/{id},直到 status 進入最終狀態;也可以註冊 webhook,改為接收 audio.task.terminal 事件。
轉寫結果與歌詞結果是文字,不是 URL。 對大多數音訊模型而言,outputs[0] 是生成檔案的連結。但對語音轉文字與歌詞生成模型,outputs[0] 裡裝的就是文字本身——而且偶爾看起來很像一個 URL。切勿不加判斷就把 outputs[0] 當成可下載的位址;請依模型類型分別處理。
語音合成
從文字合成語音。可用模型包括 Seed Audio、ElevenLabs、MiniMax Speech、Gemini TTS 與 xAI TTS。
範例:Seed Audio 1.0
curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
-H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "bytedance/seed-audio-1.0",
"text": "Welcome to Atlas Cloud.",
"format": "mp3",
"sample_rate": 24000
}'| 參數 | 必填 | 預設值 | 說明 |
|---|---|---|---|
text | 是 | — | 要合成的文字 |
references | 否 | — | 最多 3 段音色參考,或者單張圖片參考。每一項只能使用一種來源,音訊參考與圖片參考不可混用 |
format | 否 | mp3 | mp3、wav、pcm、ogg_opus |
sample_rate | 否 | 24000 | 8000、16000、24000、32000、44100、48000 |
pitch_rate | 否 | 0 | −12 到 12 |
speech_rate | 否 | 0 | −50 到 100(100 = 2.0 倍速,−50 = 0.5 倍速) |
loudness_rate | 否 | 0 | −50 到 100 |
若要複製或引用某個音色,請附上參考音訊片段,並在文字中指向它:
{
"model": "bytedance/seed-audio-1.0",
"text": "Use the voice of @audio1 and say: your order has shipped.",
"references": [{ "audio_url": "https://example.com/sample-voice.mp3" }]
}參考音訊片段不得超過 30 秒,且需小於 10 MB。
音樂生成
創作完整曲目,可帶人聲也可不帶。平台提供 Suno Chirp 與 MiniMax Music,另有專門的作詞模型。
範例:Suno Chirp v5
curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
-H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "suno/chirp-v5",
"prompt": "an upbeat indie pop song about summer road trips",
"vocal_gender": "Female"
}'| 參數 | 必填 | 預設值 | 說明 |
|---|---|---|---|
prompt | 通常需要 | — | 當 custom: false 時,這是對歌曲的描述;當 custom: true 時,這裡放的是歌詞 |
custom | 否 | false | false = 描述歌曲,true = 提供您自己的歌詞 |
instrumental | 否 | false | 生成純演奏版(無人聲) |
vocal_gender | 否 | — | Male 或 Female。兩種模式下都生效 |
title、style、negative_tags、style_weight 及相關欄位 | 否 | — | 僅在 custom: true 時生效——否則會被靜默忽略 |
Chirp v5 每次請求會返回兩首曲目,並在 thumbnail 中附上一張生成的封面圖。除非同時設定 custom: true 與 instrumental: true,否則 prompt 為必填。
若想先作詞再作曲,可以先呼叫 minimax/lyrics-generation 這類作詞模型,再把它的輸出傳入音樂模型的 lyrics 欄位。
語音轉文字
轉寫錄音,可選擇開啟說話者分離與逐字時間戳記。
兩個轉寫模型使用不同的音訊輸入欄位名稱:Seed ASR 用 audio_url,xAI STT 用 audio。傳錯會導致參數驗證失敗。
範例:Seed ASR 2.0
curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
-H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "bytedance/seed-asr-2.0",
"audio_url": "https://example.com/interview.mp3",
"enable_punc": true,
"enable_speaker_info": true,
"show_utterances": true
}'| 參數 | 必填 | 預設值 | 說明 |
|---|---|---|---|
audio_url | 是 | — | 公開 URL 或 Base64。支援 wav/mp3/ogg/raw |
format | 否 | mp3 | mp3、wav、ogg、raw |
language | 否 | 自動 | 留空則自動偵測。支援 51 種語言 |
enable_itn | 否 | true | 逆文字正規化(把「一百」轉成「100」) |
enable_punc | 否 | false | 加上標點符號 |
enable_ddc | 否 | false | 平滑處理語助詞與重複內容 |
enable_speaker_info | 否 | false | 說話者分離,最多 10 人 |
show_utterances | 否 | false | 返回帶時間戳記的分句 |
context | 否 | — | 內嵌熱詞。必須是 JSON 字串:{"hotwords":[{"word":"Atlas"}]}。這裡傳純文字會導致任務失敗 |
範例:xAI STT v1
curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
-H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "xai/stt-v1",
"audio": "https://example.com/interview.mp3",
"diarize": true,
"text_normalization": true
}'| 參數 | 必填 | 預設值 | 說明 |
|---|---|---|---|
audio | 是 | — | 公開 URL 或 Base64。容器格式會自動偵測 |
language | 否 | 自動 | ISO 639-1。支援 24 種語言 |
text_normalization | 否 | false | 把「one hundred dollars」轉成「$100」 |
keyterm | 否 | [] | 最多 100 個偏好詞,每個不超過 50 個字元 |
diarize | 否 | false | 說話者分離,為每個詞加上 speaker_id |
filler_words | 否 | false | 保留「um」「uh」等語助詞(預設會移除) |
multichannel | 否 | false | 各聲道分別轉寫 |
讀取結果
{
"code": 200,
"data": {
"id": "…",
"status": "completed",
"outputs": ["Thanks for joining the call today…"],
"stt_result": {
"text": "Thanks for joining the call today…",
"duration": 184.2,
"words": [
{ "text": "Thanks", "start": 0.12, "end": 0.41, "speaker_id": "1" }
]
}
}
}outputs[0] 是純文字的逐字稿。結構化輸出——時間軸、說話者、偵測到的語言——都放在 stt_result 中。
提供音訊輸入
音訊輸入欄位可接受公開的 HTTPS URL,也可接受 Base64 data URI。Base64 輸入會被自動儲存,並在請求送達模型之前替換成 URL。
若是本機檔案,請先上傳再使用返回的 URL:
curl -X POST https://api.atlascloud.ai/api/v1/model/uploadMedia \
-H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
-F "[email protected]"限制與細節請參閱上傳檔案。
計費
音訊模型有三種計費方式,取決於模型:
| 計費方式 | 適用範圍 | 計費依據 |
|---|---|---|
| 每 1,000 字元 | 大多數語音合成模型 | 輸入 text 的長度 |
| 每秒輸出 | 部分語音模型,包含 Seed Audio 1.0 | 實際生成時長,無條件進位 |
| 每分鐘輸入 | 語音轉文字模型 | 提交音訊的時長 |
失敗的任務不計費。對以輸出時長計費的模型,提交任務時會先凍結一筆金額,完成後再依實際時長結算。
生成前可以呼叫定價端點取得精確報價,實際算例請參閱模型如何計費。
尋找音訊模型
模型庫更新頻繁。與其把模型清單寫死在程式碼中,不如依類型篩選:
- 開啟模型庫,以 Text-to-Audio 或 Audio-to-Text 篩選
- 或在助手中透過 MCP Server 呼叫
atlas_list_models,傳入type="Audio"
每個模型的確切參數都發布在模型端點下各自的 API 參考頁面中。
相關內容
Last updated on