Аудиомодели

Синтезируйте речь, сочиняйте музыку и расшифровывайте записи через один эндпоинт Atlas Cloud. Описаны Seed Audio, ElevenLabs, MiniMax, Gemini TTS, Suno, Seed ASR и xAI STT.

Atlas Cloud предоставляет три разные аудиовозможности — синтез речи, генерацию музыки и распознавание речи — через единый эндпоинт. Какую из них вы получите, определяет выбранная модель, а не URL.

POST https://api.atlascloud.ai/api/v1/model/generateAudio

Эндпоинтов /v1/audio/speech и /v1/audio/transcriptions не существует. Если вы переносите код с OpenAI SDK, аудиовызовы не отображаются один в один — они идут через асинхронный процесс предсказаний, описанный ниже.

Как это работает

Аудиозапросы асинхронны, как генерация изображений и видео:

Отправьте задачу. Выполните POST на generateAudio, указав model и собственные параметры модели на верхнем уровне тела запроса.

Получите ID предсказания. В ответе возвращаются data.id и data.status.

Опрашивайте результат. Вызывайте GET /api/v1/model/prediction/{id}, пока status не достигнет терминального состояния, либо зарегистрируйте вебхук и получите событие audio.task.terminal вместо опроса.

Полная схема статусов описана в разделе Предсказания, настройка обратных вызовов — в разделе Вебхуки.

Результаты транскрипции и текстов песен — это текст, а не URL. Для большинства аудиомоделей outputs[0] содержит ссылку на сгенерированный файл. Для моделей распознавания речи и генерации текстов песен outputs[0] содержит сам текст — который иногда может выглядеть как URL. Никогда не считайте outputs[0] файлом для скачивания вслепую: ветвите логику по типу модели.

Синтез речи

Синтезируйте речь из текста. Доступны Seed Audio, ElevenLabs, MiniMax Speech, Gemini TTS и xAI TTS.

Пример: Seed Audio 1.0

curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
  -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "bytedance/seed-audio-1.0",
    "text": "Welcome to Atlas Cloud.",
    "format": "mp3",
    "sample_rate": 24000
  }'
ПараметрОбязателенПо умолчаниюПримечания
textДаТекст для синтеза
referencesНетДо 3 голосовых референсов или один референс-изображение. В каждой записи используется ровно один источник; смешивать аудио- и графические референсы нельзя
formatНетmp3mp3, wav, pcm, ogg_opus
sample_rateНет240008000, 16000, 24000, 32000, 44100, 48000
pitch_rateНет0от −12 до 12
speech_rateНет0от −50 до 100 (100 = 2.0x, −50 = 0.5x)
loudness_rateНет0от −50 до 100

Чтобы клонировать голос или сослаться на него, приложите референсный фрагмент и укажите на него из текста:

{
  "model": "bytedance/seed-audio-1.0",
  "text": "Use the voice of @audio1 and say: your order has shipped.",
  "references": [{ "audio_url": "https://example.com/sample-voice.mp3" }]
}

Референсные фрагменты должны быть не длиннее 30 секунд и меньше 10 МБ.

Генерация музыки

Сочиняйте полноценные треки — с вокалом или без. Доступны Suno Chirp и MiniMax Music, а также отдельная модель для написания текстов песен.

Пример: Suno Chirp v5

curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
  -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "suno/chirp-v5",
    "prompt": "an upbeat indie pop song about summer road trips",
    "vocal_gender": "Female"
  }'
ПараметрОбязателенПо умолчаниюПримечания
promptОбычно даПри custom: false это описание песни. При custom: true это текст песни
customНетfalsefalse = описать песню, true = передать собственный текст
instrumentalНетfalseСгенерировать без вокала
vocal_genderНетMale или Female. Работает в обоих режимах
title, style, negative_tags, style_weight и связанные поляНетДействуют только при custom: true — иначе молча игнорируются

Chirp v5 возвращает два трека на запрос, а также сгенерированную обложку в поле thumbnail. Параметр prompt обязателен, кроме случая, когда одновременно заданы custom: true и instrumental: true.

Чтобы сначала написать текст, а потом музыку, вызовите модель текстов, например minimax/lyrics-generation, и передайте её результат в поле lyrics музыкальной модели.

Распознавание речи

Расшифровывайте записи с опциональным разделением по говорящим и таймкодами на уровне слов.

Две модели транскрипции используют разные имена полей для аудиовхода: Seed ASR принимает audio_url, а xAI STT — audio. Передача неверного поля не пройдёт валидацию.

Пример: Seed ASR 2.0

curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
  -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "bytedance/seed-asr-2.0",
    "audio_url": "https://example.com/interview.mp3",
    "enable_punc": true,
    "enable_speaker_info": true,
    "show_utterances": true
  }'
ПараметрОбязателенПо умолчаниюПримечания
audio_urlДаПубличный URL или Base64. wav/mp3/ogg/raw
formatНетmp3mp3, wav, ogg, raw
languageНетавтоОставьте пустым для автоопределения. Поддерживается 51 язык
enable_itnНетtrueОбратная нормализация текста («сто» превращается в «100»)
enable_puncНетfalseРасставлять знаки препинания
enable_ddcНетfalseСглаживать слова-паразиты и повторы
enable_speaker_infoНетfalseРазделение по говорящим, до 10 человек
show_utterancesНетfalseВозвращать фрагменты с таймкодами
contextНетВстроенные ключевые слова. Должны быть строкой JSON: {"hotwords":[{"word":"Atlas"}]}. Обычный текст здесь приведёт к ошибке задачи

Пример: xAI STT v1

curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
  -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "xai/stt-v1",
    "audio": "https://example.com/interview.mp3",
    "diarize": true,
    "text_normalization": true
  }'
ПараметрОбязателенПо умолчаниюПримечания
audioДаПубличный URL или Base64. Форматы контейнеров определяются автоматически
languageНетавтоISO 639-1. Поддерживается 24 языка
text_normalizationНетfalse«сто долларов» превращается в «$100»
keytermНет[]До 100 приоритетных терминов по 50 символов каждый
diarizeНетfalseРазделение по говорящим, добавляет speaker_id к каждому слову
filler_wordsНетfalseСохранять «эм» и «ээ» (по умолчанию удаляются)
multichannelНетfalseРасшифровывать каждый канал отдельно

Чтение результата

{
  "code": 200,
  "data": {
    "id": "…",
    "status": "completed",
    "outputs": ["Thanks for joining the call today…"],
    "stt_result": {
      "text": "Thanks for joining the call today…",
      "duration": 184.2,
      "words": [
        { "text": "Thanks", "start": 0.12, "end": 0.41, "speaker_id": "1" }
      ]
    }
  }
}

В outputs[0] лежит обычная расшифровка. Структурированный вывод — тайминги, говорящие, определённый язык — находится в stt_result.

Передача аудио на вход

Поля аудиовхода принимают либо публичный HTTPS-URL, либо data URI в Base64. Данные в Base64 сохраняются автоматически и заменяются на URL до того, как запрос дойдёт до модели.

Локальные файлы сначала загрузите и используйте полученный URL:

curl -X POST https://api.atlascloud.ai/api/v1/model/uploadMedia \
  -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
  -F "[email protected]"

Ограничения и подробности — в разделе Загрузка файлов.

Тарификация

Аудиомодели тарифицируются одним из трёх способов, в зависимости от модели:

СпособПрименяется кОснова расчёта
За 1000 символовБольшинство моделей синтеза речиДлина входного поля text
За секунду выводаНекоторые речевые модели, включая Seed Audio 1.0Фактическая длительность результата, округляемая вверх
За минуту входаМодели распознавания речиДлительность отправленного аудио

Неудавшиеся задачи не тарифицируются. Для моделей с оплатой по длительности вывода сумма резервируется при отправке задачи и пересчитывается по фактической длительности при завершении.

Используйте эндпоинт цен, чтобы получить точную оценку до генерации, а разобранные примеры смотрите в разделе Тарификация моделей.

Как найти аудиомодели

Каталог моделей часто меняется. Вместо жёстко заданного списка фильтруйте каталог по типу:

  • Откройте Библиотеку моделей и отфильтруйте по Text-to-Audio или Audio-to-Text
  • Либо получите список из агента через MCP-сервер, вызвав atlas_list_models с type="Audio"

Точные параметры каждой модели опубликованы на её собственной странице справочника API в разделе Model endpoints.

Связанные материалы

Last updated on

On this page