音声モデル

1 つの Atlas Cloud エンドポイントで音声合成、作曲、文字起こしを実行します。Seed Audio、ElevenLabs、MiniMax、Gemini TTS、Suno、Seed ASR、xAI STT に対応。

Atlas Cloud は 音声合成、音楽生成、音声認識 という 3 つの音声機能を、単一のエンドポイントで提供します。どの機能が実行されるかは URL ではなく、選択したモデルによって決まります。

POST https://api.atlascloud.ai/api/v1/model/generateAudio

/v1/audio/speech や /v1/audio/transcriptions というエンドポイントは存在しません。OpenAI SDK からコードを移植する場合、音声関連の呼び出しは 一対一では対応しません — 以下で説明する非同期の予測フローを経由します。

仕組み

音声リクエストは、画像や動画の生成と同じく非同期です:

タスクを送信する。 model と、そのモデル固有のパラメータをトップレベルにフラットに並べて generateAudio に POST します。

予測 ID を受け取る。 レスポンスには data.id と data.status が含まれます。

結果をポーリングする。 status が終了状態になるまで GET /api/v1/model/prediction/{id} を呼び出します。あるいは Webhook を登録して audio.task.terminal イベントを受け取ることもできます。

ステータスの遷移全体は 予測 を、コールバックの設定は Webhook をご覧ください。

文字起こしと歌詞の結果は URL ではなくテキストです。 ほとんどの音声モデルでは outputs[0] は生成されたファイルへのリンクです。しかし音声認識モデルと歌詞生成モデルでは、outputs[0] にテキストそのものが入り、まれに URL のように見えることがあります。outputs[0] を無条件にダウンロード対象として扱わず、モデルのタイプで分岐してください。

音声合成

テキストから音声を合成します。Seed Audio、ElevenLabs、MiniMax Speech、Gemini TTS、xAI TTS などのモデルが利用できます。

例: Seed Audio 1.0

curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
  -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "bytedance/seed-audio-1.0",
    "text": "Welcome to Atlas Cloud.",
    "format": "mp3",
    "sample_rate": 24000
  }'
パラメータ必須デフォルト備考
textはい—合成するテキスト
referencesいいえ—音声リファレンス最大 3 件、または 画像リファレンス 1 件。各エントリで使えるソースは 1 つだけで、音声リファレンスと画像リファレンスは混在できません
formatいいえmp3mp3、wav、pcm、ogg_opus
sample_rateいいえ240008000、16000、24000、32000、44100、48000
pitch_rateいいえ0−12 〜 12
speech_rateいいえ0−50 〜 100(100 = 2.0 倍、−50 = 0.5 倍)
loudness_rateいいえ0−50 〜 100

声をクローンまたは参照するには、リファレンス用のクリップを添付し、テキスト内から参照します:

{
  "model": "bytedance/seed-audio-1.0",
  "text": "Use the voice of @audio1 and say: your order has shipped.",
  "references": [{ "audio_url": "https://example.com/sample-voice.mp3" }]
}

リファレンスクリップは 30 秒以内かつ 10 MB 未満である必要があります。

音楽生成

ボーカルの有無を問わず、楽曲をまるごと生成します。Suno Chirp と MiniMax Music に加えて、作詞専用のモデルも利用できます。

例: Suno Chirp v5

curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
  -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "suno/chirp-v5",
    "prompt": "an upbeat indie pop song about summer road trips",
    "vocal_gender": "Female"
  }'
パラメータ必須デフォルト備考
promptほぼ必須—custom: false では曲の説明。custom: true では 歌詞 そのもの
customいいえfalsefalse = 曲を説明する、true = 自分の歌詞を渡す
instrumentalいいえfalseボーカルなしで生成する
vocal_genderいいえ—Male または Female。どちらのモードでも有効
title、style、negative_tags、style_weight などの関連フィールドいいえ—custom: true のときのみ有効 — それ以外では警告なく無視されます

Chirp v5 は 1 リクエストにつき 2 つのトラック と、thumbnail に生成されたカバー画像を返します。custom: true と instrumental: true の両方を設定した場合を除き、prompt は必須です。

先に作詞してから作曲する場合は、minimax/lyrics-generation などの歌詞モデルを呼び出し、その出力を音楽モデルの lyrics フィールドに渡してください。

音声認識

録音を文字起こしします。話者分離や単語単位のタイムスタンプにも対応しています。

2 つの文字起こしモデルでは、音声入力のフィールド名が異なります。Seed ASR は audio_url、xAI STT は audio を使います。誤ったフィールドを渡すとバリデーションに失敗します。

例: Seed ASR 2.0

curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
  -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "bytedance/seed-asr-2.0",
    "audio_url": "https://example.com/interview.mp3",
    "enable_punc": true,
    "enable_speaker_info": true,
    "show_utterances": true
  }'
パラメータ必須デフォルト備考
audio_urlはい—公開 URL または Base64。wav/mp3/ogg/raw
formatいいえmp3mp3、wav、ogg、raw
languageいいえ自動空にすると自動検出。51 言語に対応
enable_itnいいえtrue逆テキスト正規化(「one hundred」が「100」になる)
enable_puncいいえfalse句読点を付与する
enable_ddcいいえfalseフィラーや言い直しを整える
enable_speaker_infoいいえfalse話者分離。最大 10 名
show_utterancesいいえfalseタイムスタンプ付きのセグメントを返す
contextいいえ—インラインのホットワード。JSON 文字列 である必要があります: {"hotwords":[{"word":"Atlas"}]}。プレーンテキストを渡すとタスクが失敗します

例: xAI STT v1

curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
  -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "xai/stt-v1",
    "audio": "https://example.com/interview.mp3",
    "diarize": true,
    "text_normalization": true
  }'
パラメータ必須デフォルト備考
audioはい—公開 URL または Base64。コンテナ形式は自動検出されます
languageいいえ自動ISO 639-1。24 言語に対応
text_normalizationいいえfalse「one hundred dollars」が「$100」になる
keytermいいえ[]バイアス用語を最大 100 件、各 50 文字まで
diarizeいいえfalse話者分離。単語ごとに speaker_id を付与します
filler_wordsいいえfalse「um」「uh」を残す(デフォルトでは削除されます)
multichannelいいえfalseチャンネルごとに個別に文字起こしする

結果の読み取り方

{
  "code": 200,
  "data": {
    "id": "…",
    "status": "completed",
    "outputs": ["Thanks for joining the call today…"],
    "stt_result": {
      "text": "Thanks for joining the call today…",
      "duration": 184.2,
      "words": [
        { "text": "Thanks", "start": 0.12, "end": 0.41, "speaker_id": "1" }
      ]
    }
  }
}

outputs[0] にはプレーンな文字起こしテキストが入ります。タイミング、話者、検出言語といった構造化された出力は stt_result に格納されます。

音声入力の渡し方

音声入力フィールドは、公開 HTTPS URL または Base64 のデータ URI を受け付けます。Base64 で渡した入力は自動的に保存され、リクエストがモデルに届く前に URL へ置き換えられます。

ローカルファイルの場合は、先にアップロードして返された URL を使ってください:

curl -X POST https://api.atlascloud.ai/api/v1/model/uploadMedia \
  -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
  -F "[email protected]"

制限や詳細は ファイルのアップロード をご覧ください。

課金

音声モデルの課金方法は、モデルに応じて次の 3 種類のいずれかです:

方式対象基準
1,000 文字あたりほとんどの音声合成モデル入力 text の長さ
出力 1 秒あたりSeed Audio 1.0 を含む一部の音声モデル実際に生成された長さ(切り上げ)
入力 1 分あたり音声認識モデル送信した音声の長さ

失敗したタスクは課金されません。出力の長さで課金されるモデルでは、タスク送信時に一定額が仮押さえされ、完了時に実際の長さで精算されます。

生成前に正確な見積もりを得るには料金エンドポイントを利用してください。計算例は モデル課金 をご覧ください。

音声モデルの探し方

モデルカタログは頻繁に更新されます。一覧をハードコードするのではなく、タイプでカタログを絞り込んでください:

  • モデルライブラリ を開き、Text-to-Audio または Audio-to-Text でフィルタする
  • あるいは MCP Server の atlas_list_models を type="Audio" で呼び出し、エージェントから一覧を取得する

各モデルの正確なパラメータは、モデルエンドポイント 配下にあるそれぞれの API リファレンスページに掲載されています。

関連ドキュメント

Last updated on

On this page