Аудиомодели
Синтезируйте речь, сочиняйте музыку и расшифровывайте записи через один эндпоинт Atlas Cloud. Описаны Seed Audio, ElevenLabs, MiniMax, Gemini TTS, Suno, Seed ASR и xAI STT.
Atlas Cloud предоставляет три разные аудиовозможности — синтез речи, генерацию музыки и распознавание речи — через единый эндпоинт. Какую из них вы получите, определяет выбранная модель, а не URL.
POST https://api.atlascloud.ai/api/v1/model/generateAudioЭндпоинтов /v1/audio/speech и /v1/audio/transcriptions не существует. Если вы переносите код с OpenAI SDK, аудиовызовы не отображаются один в один — они идут через асинхронный процесс предсказаний, описанный ниже.
Как это работает
Аудиозапросы асинхронны, как генерация изображений и видео:
Отправьте задачу. Выполните POST на generateAudio, указав model и собственные параметры модели на верхнем уровне тела запроса.
Получите ID предсказания. В ответе возвращаются data.id и data.status.
Опрашивайте результат. Вызывайте GET /api/v1/model/prediction/{id}, пока status не достигнет терминального состояния, либо зарегистрируйте вебхук и получите событие audio.task.terminal вместо опроса.
Полная схема статусов описана в разделе Предсказания, настройка обратных вызовов — в разделе Вебхуки.
Результаты транскрипции и текстов песен — это текст, а не URL. Для большинства аудиомоделей outputs[0] содержит ссылку на сгенерированный файл. Для моделей распознавания речи и генерации текстов песен outputs[0] содержит сам текст — который иногда может выглядеть как URL. Никогда не считайте outputs[0] файлом для скачивания вслепую: ветвите логику по типу модели.
Синтез речи
Синтезируйте речь из текста. Доступны Seed Audio, ElevenLabs, MiniMax Speech, Gemini TTS и xAI TTS.
Пример: Seed Audio 1.0
curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
-H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "bytedance/seed-audio-1.0",
"text": "Welcome to Atlas Cloud.",
"format": "mp3",
"sample_rate": 24000
}'| Параметр | Обязателен | По умолчанию | Примечания |
|---|---|---|---|
text | Да | — | Текст для синтеза |
references | Нет | — | До 3 голосовых референсов или один референс-изображение. В каждой записи используется ровно один источник; смешивать аудио- и графические референсы нельзя |
format | Нет | mp3 | mp3, wav, pcm, ogg_opus |
sample_rate | Нет | 24000 | 8000, 16000, 24000, 32000, 44100, 48000 |
pitch_rate | Нет | 0 | от −12 до 12 |
speech_rate | Нет | 0 | от −50 до 100 (100 = 2.0x, −50 = 0.5x) |
loudness_rate | Нет | 0 | от −50 до 100 |
Чтобы клонировать голос или сослаться на него, приложите референсный фрагмент и укажите на него из текста:
{
"model": "bytedance/seed-audio-1.0",
"text": "Use the voice of @audio1 and say: your order has shipped.",
"references": [{ "audio_url": "https://example.com/sample-voice.mp3" }]
}Референсные фрагменты должны быть не длиннее 30 секунд и меньше 10 МБ.
Генерация музыки
Сочиняйте полноценные треки — с вокалом или без. Доступны Suno Chirp и MiniMax Music, а также отдельная модель для написания текстов песен.
Пример: Suno Chirp v5
curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
-H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "suno/chirp-v5",
"prompt": "an upbeat indie pop song about summer road trips",
"vocal_gender": "Female"
}'| Параметр | Обязателен | По умолчанию | Примечания |
|---|---|---|---|
prompt | Обычно да | — | При custom: false это описание песни. При custom: true это текст песни |
custom | Нет | false | false = описать песню, true = передать собственный текст |
instrumental | Нет | false | Сгенерировать без вокала |
vocal_gender | Нет | — | Male или Female. Работает в обоих режимах |
title, style, negative_tags, style_weight и связанные поля | Нет | — | Действуют только при custom: true — иначе молча игнорируются |
Chirp v5 возвращает два трека на запрос, а также сгенерированную обложку в поле thumbnail. Параметр prompt обязателен, кроме случая, когда одновременно заданы custom: true и instrumental: true.
Чтобы сначала написать текст, а потом музыку, вызовите модель текстов, например minimax/lyrics-generation, и передайте её результат в поле lyrics музыкальной модели.
Распознавание речи
Расшифровывайте записи с опциональным разделением по говорящим и таймкодами на уровне слов.
Две модели транскрипции используют разные имена полей для аудиовхода: Seed ASR принимает audio_url, а xAI STT — audio. Передача неверного поля не пройдёт валидацию.
Пример: Seed ASR 2.0
curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
-H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "bytedance/seed-asr-2.0",
"audio_url": "https://example.com/interview.mp3",
"enable_punc": true,
"enable_speaker_info": true,
"show_utterances": true
}'| Параметр | Обязателен | По умолчанию | Примечания |
|---|---|---|---|
audio_url | Да | — | Публичный URL или Base64. wav/mp3/ogg/raw |
format | Нет | mp3 | mp3, wav, ogg, raw |
language | Нет | авто | Оставьте пустым для автоопределения. Поддерживается 51 язык |
enable_itn | Нет | true | Обратная нормализация текста («сто» превращается в «100») |
enable_punc | Нет | false | Расставлять знаки препинания |
enable_ddc | Нет | false | Сглаживать слова-паразиты и повторы |
enable_speaker_info | Нет | false | Разделение по говорящим, до 10 человек |
show_utterances | Нет | false | Возвращать фрагменты с таймкодами |
context | Нет | — | Встроенные ключевые слова. Должны быть строкой JSON: {"hotwords":[{"word":"Atlas"}]}. Обычный текст здесь приведёт к ошибке задачи |
Пример: xAI STT v1
curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
-H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "xai/stt-v1",
"audio": "https://example.com/interview.mp3",
"diarize": true,
"text_normalization": true
}'| Параметр | Обязателен | По умолчанию | Примечания |
|---|---|---|---|
audio | Да | — | Публичный URL или Base64. Форматы контейнеров определяются автоматически |
language | Нет | авто | ISO 639-1. Поддерживается 24 языка |
text_normalization | Нет | false | «сто долларов» превращается в «$100» |
keyterm | Нет | [] | До 100 приоритетных терминов по 50 символов каждый |
diarize | Нет | false | Разделение по говорящим, добавляет speaker_id к каждому слову |
filler_words | Нет | false | Сохранять «эм» и «ээ» (по умолчанию удаляются) |
multichannel | Нет | false | Расшифровывать каждый канал отдельно |
Чтение результата
{
"code": 200,
"data": {
"id": "…",
"status": "completed",
"outputs": ["Thanks for joining the call today…"],
"stt_result": {
"text": "Thanks for joining the call today…",
"duration": 184.2,
"words": [
{ "text": "Thanks", "start": 0.12, "end": 0.41, "speaker_id": "1" }
]
}
}
}В outputs[0] лежит обычная расшифровка. Структурированный вывод — тайминги, говорящие, определённый язык — находится в stt_result.
Передача аудио на вход
Поля аудиовхода принимают либо публичный HTTPS-URL, либо data URI в Base64. Данные в Base64 сохраняются автоматически и заменяются на URL до того, как запрос дойдёт до модели.
Локальные файлы сначала загрузите и используйте полученный URL:
curl -X POST https://api.atlascloud.ai/api/v1/model/uploadMedia \
-H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
-F "[email protected]"Ограничения и подробности — в разделе Загрузка файлов.
Тарификация
Аудиомодели тарифицируются одним из трёх способов, в зависимости от модели:
| Способ | Применяется к | Основа расчёта |
|---|---|---|
| За 1000 символов | Большинство моделей синтеза речи | Длина входного поля text |
| За секунду вывода | Некоторые речевые модели, включая Seed Audio 1.0 | Фактическая длительность результата, округляемая вверх |
| За минуту входа | Модели распознавания речи | Длительность отправленного аудио |
Неудавшиеся задачи не тарифицируются. Для моделей с оплатой по длительности вывода сумма резервируется при отправке задачи и пересчитывается по фактической длительности при завершении.
Используйте эндпоинт цен, чтобы получить точную оценку до генерации, а разобранные примеры смотрите в разделе Тарификация моделей.
Как найти аудиомодели
Каталог моделей часто меняется. Вместо жёстко заданного списка фильтруйте каталог по типу:
- Откройте Библиотеку моделей и отфильтруйте по Text-to-Audio или Audio-to-Text
- Либо получите список из агента через MCP-сервер, вызвав
atlas_list_modelsсtype="Audio"
Точные параметры каждой модели опубликованы на её собственной странице справочника API в разделе Model endpoints.
Связанные материалы
Last updated on