音频模型

通过同一个 Atlas Cloud 端点合成语音、创作音乐、转写录音。涵盖 Seed Audio、ElevenLabs、MiniMax、Gemini TTS、Suno、Seed ASR 与 xAI STT。

Atlas Cloud 通过单一端点提供三类音频能力——语音合成、音乐生成和语音转文本。具体走哪一类由你选择的模型决定,而不是由 URL 决定。

POST https://api.atlascloud.ai/api/v1/model/generateAudio

平台上没有 /v1/audio/speech 或 /v1/audio/transcriptions 端点。如果你要从 OpenAI SDK 迁移代码,音频调用不能一一对应——它们走的是下面介绍的异步预测任务流程。

工作方式

音频请求和图像、视频生成一样是异步的:

提交任务。 向 generateAudio 发起 POST 请求,带上 model,并把该模型自己的参数平铺在顶层。

拿到 prediction ID。 响应会返回 data.id 和 data.status。

轮询获取结果。 调用 GET /api/v1/model/prediction/{id},直到 status 进入终态;也可以注册 webhook,改为接收 audio.task.terminal 事件。

完整的状态机参见 预测任务,回调配置参见 Webhook。

转写结果和歌词结果是文本,不是 URL。 对大多数音频模型来说,outputs[0] 是生成文件的链接。但对语音转文本和歌词生成模型,outputs[0] 里装的就是文本本身——而且偶尔看起来会很像一个 URL。不要不加判断地把 outputs[0] 当作可下载的地址;请按模型类型分支处理。

语音合成

从文本合成语音。可用模型包括 Seed Audio、ElevenLabs、MiniMax Speech、Gemini TTS 和 xAI TTS。

示例:Seed Audio 1.0

curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
  -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "bytedance/seed-audio-1.0",
    "text": "Welcome to Atlas Cloud.",
    "format": "mp3",
    "sample_rate": 24000
  }'
参数必填默认值说明
text是—要合成的文本
references否—最多 3 段音色参考,或者单张图片参考。每一项只能使用一个来源,音频参考和图片参考不能混用
format否mp3mp3、wav、pcm、ogg_opus
sample_rate否240008000、16000、24000、32000、44100、48000
pitch_rate否0−12 到 12
speech_rate否0−50 到 100(100 = 2.0 倍速,−50 = 0.5 倍速)
loudness_rate否0−50 到 100

要克隆或引用某个音色,附上参考音频片段,并在文本中指向它:

{
  "model": "bytedance/seed-audio-1.0",
  "text": "Use the voice of @audio1 and say: your order has shipped.",
  "references": [{ "audio_url": "https://example.com/sample-voice.mp3" }]
}

参考音频片段不得超过 30 秒,且小于 10 MB。

音乐生成

创作完整曲目,可带人声也可不带。平台提供 Suno Chirp 和 MiniMax Music,另有专门的歌词写作模型。

示例:Suno Chirp v5

curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
  -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "suno/chirp-v5",
    "prompt": "an upbeat indie pop song about summer road trips",
    "vocal_gender": "Female"
  }'
参数必填默认值说明
prompt通常需要—当 custom: false 时,这是对歌曲的描述;当 custom: true 时,这里放的是歌词
custom否falsefalse = 描述歌曲,true = 提供你自己的歌词
instrumental否false生成纯伴奏(无人声)
vocal_gender否—Male 或 Female。两种模式下都生效
title、style、negative_tags、style_weight 及相关字段否—仅在 custom: true 时生效——否则会被静默忽略

Chirp v5 每次请求返回两条曲目,并在 thumbnail 中附带一张生成的封面图。除非同时设置 custom: true 和 instrumental: true,否则 prompt 是必填的。

如果想先写词再作曲,可以先调用 minimax/lyrics-generation 这类歌词模型,再把它的输出传给音乐模型的 lyrics 字段。

语音转文本

转写录音,可选择开启说话人分离和词级时间戳。

两个转写模型使用不同的音频输入字段名:Seed ASR 用 audio_url,xAI STT 用 audio。传错会导致参数校验失败。

示例:Seed ASR 2.0

curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
  -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "bytedance/seed-asr-2.0",
    "audio_url": "https://example.com/interview.mp3",
    "enable_punc": true,
    "enable_speaker_info": true,
    "show_utterances": true
  }'
参数必填默认值说明
audio_url是—公开 URL 或 Base64。支持 wav/mp3/ogg/raw
format否mp3mp3、wav、ogg、raw
language否自动留空则自动检测。支持 51 种语言
enable_itn否true逆文本正则化(把“一百”转成“100”)
enable_punc否false添加标点符号
enable_ddc否false平滑处理语气词和重复内容
enable_speaker_info否false说话人分离,最多 10 人
show_utterances否false返回带时间戳的分句
context否—内联热词。必须是 JSON 字符串:{"hotwords":[{"word":"Atlas"}]}。这里传纯文本会导致任务失败

示例:xAI STT v1

curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
  -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "xai/stt-v1",
    "audio": "https://example.com/interview.mp3",
    "diarize": true,
    "text_normalization": true
  }'
参数必填默认值说明
audio是—公开 URL 或 Base64。容器格式会自动识别
language否自动ISO 639-1。支持 24 种语言
text_normalization否false把“one hundred dollars”转成“$100”
keyterm否[]最多 100 个偏置词,每个不超过 50 个字符
diarize否false说话人分离,为每个词添加 speaker_id
filler_words否false保留“um”“uh”等语气词(默认会移除)
multichannel否false分声道独立转写

读取结果

{
  "code": 200,
  "data": {
    "id": "…",
    "status": "completed",
    "outputs": ["Thanks for joining the call today…"],
    "stt_result": {
      "text": "Thanks for joining the call today…",
      "duration": 184.2,
      "words": [
        { "text": "Thanks", "start": 0.12, "end": 0.41, "speaker_id": "1" }
      ]
    }
  }
}

outputs[0] 里是纯文本转写结果。结构化输出——时间轴、说话人、识别出的语言——都在 stt_result 中。

提供音频输入

音频输入字段既接受公开的 HTTPS URL,也接受 Base64 data URI。Base64 输入会被自动存储,并在请求到达模型之前替换为 URL。

对于本地文件,请先上传再使用返回的 URL:

curl -X POST https://api.atlascloud.ai/api/v1/model/uploadMedia \
  -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
  -F "[email protected]"

限制和细节参见 上传文件。

计费

音频模型有三种计费方式,具体取决于模型:

计费方式适用范围计费依据
按每 1,000 字符大多数语音合成模型输入 text 的长度
按输出秒数部分语音模型,包括 Seed Audio 1.0实际生成时长,向上取整
按输入分钟数语音转文本模型提交音频的时长

失败的任务不计费。对按输出时长计费的模型,提交任务时会先冻结一笔金额,完成后再按真实时长结算。

生成前可以调用定价端点获取准确报价,具体算例参见 模型如何计费。

查找音频模型

模型库更新频繁。与其把模型列表写死在代码里,不如按类型筛选:

  • 打开 模型库,按 Text-to-Audio 或 Audio-to-Text 筛选
  • 或者在助手中通过 MCP Server 调用 atlas_list_models,传入 type="Audio"

每个模型的确切参数都发布在 模型端点 下各自的 API 参考页面中。

相关内容

Last updated on

On this page