Modelos de audio
Genera voz, compón música y transcribe grabaciones a través de un único endpoint de Atlas Cloud. Cubre Seed Audio, ElevenLabs, MiniMax, Gemini TTS, Suno, Seed ASR y xAI STT.
Atlas Cloud expone tres capacidades de audio distintas — texto a voz, generación de música y voz a texto — a través de un único endpoint. Cuál obtienes lo determina el modelo que elijas, no la URL.
POST https://api.atlascloud.ai/api/v1/model/generateAudioNo existe ningún endpoint /v1/audio/speech ni /v1/audio/transcriptions. Si estás migrando código del SDK de OpenAI, las llamadas de audio no se corresponden una a una — pasan por el flujo asíncrono de predicciones que se describe abajo.
Cómo funciona
Las solicitudes de audio son asíncronas, igual que la generación de imagen y video:
Envía una tarea. Haz un POST a generateAudio con un model y los parámetros propios del modelo aplanados en el nivel superior.
Obtén un ID de predicción. La respuesta devuelve data.id y data.status.
Consulta el resultado. GET /api/v1/model/prediction/{id} hasta que status alcance un estado terminal, o registra un webhook y recibe el evento audio.task.terminal en su lugar.
Consulta Predicciones para ver la máquina de estados completa y Webhooks para configurar los callbacks.
Los resultados de transcripción y de letras son texto, no URLs. En la mayoría de los modelos de audio, outputs[0] es un enlace a un archivo generado. En los modelos de voz a texto y de generación de letras, outputs[0] contiene el propio texto — que en ocasiones puede parecer una URL. Nunca trates outputs[0] a ciegas como algo descargable; ramifica según el tipo de modelo.
Texto a voz
Sintetiza voz a partir de texto. Entre los modelos disponibles están Seed Audio, ElevenLabs, MiniMax Speech, Gemini TTS y xAI TTS.
Ejemplo: Seed Audio 1.0
curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
-H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "bytedance/seed-audio-1.0",
"text": "Welcome to Atlas Cloud.",
"format": "mp3",
"sample_rate": 24000
}'| Parámetro | Obligatorio | Predeterminado | Notas |
|---|---|---|---|
text | Sí | — | El texto que se va a sintetizar |
references | No | — | Hasta 3 referencias de voz, o una única referencia de imagen. Cada entrada usa exactamente una fuente, y no se pueden mezclar referencias de audio e imagen |
format | No | mp3 | mp3, wav, pcm, ogg_opus |
sample_rate | No | 24000 | 8000, 16000, 24000, 32000, 44100, 48000 |
pitch_rate | No | 0 | −12 a 12 |
speech_rate | No | 0 | −50 a 100 (100 = 2.0x, −50 = 0.5x) |
loudness_rate | No | 0 | −50 a 100 |
Para clonar o referenciar una voz, adjunta un clip de referencia y apunta a él desde el texto:
{
"model": "bytedance/seed-audio-1.0",
"text": "Use the voice of @audio1 and say: your order has shipped.",
"references": [{ "audio_url": "https://example.com/sample-voice.mp3" }]
}Los clips de referencia deben durar 30 segundos o menos y pesar menos de 10 MB.
Generación de música
Compón pistas completas, con o sin voces. Están disponibles Suno Chirp y MiniMax Music, además de un modelo dedicado a escribir letras.
Ejemplo: Suno Chirp v5
curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
-H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "suno/chirp-v5",
"prompt": "an upbeat indie pop song about summer road trips",
"vocal_gender": "Female"
}'| Parámetro | Obligatorio | Predeterminado | Notas |
|---|---|---|---|
prompt | Normalmente | — | Con custom: false es una descripción de la canción. Con custom: true es la letra |
custom | No | false | false = describir la canción, true = aportar tu propia letra |
instrumental | No | false | Generar sin voces |
vocal_gender | No | — | Male o Female. Se aplica en ambos modos |
title, style, negative_tags, style_weight y campos relacionados | No | — | Solo tienen efecto con custom: true — de lo contrario se ignoran en silencio |
Chirp v5 devuelve dos pistas por solicitud, más una imagen de portada generada en thumbnail. prompt es obligatorio salvo que definas a la vez custom: true e instrumental: true.
Para escribir primero la letra y componer después, llama a un modelo de letras como minimax/lyrics-generation y pasa su salida al campo lyrics del modelo de música.
Voz a texto
Transcribe grabaciones, con separación de hablantes y marcas de tiempo por palabra opcionales.
Los dos modelos de transcripción usan nombres de campo distintos para la entrada de audio: Seed ASR toma audio_url y xAI STT toma audio. Pasar el equivocado falla la validación.
Ejemplo: Seed ASR 2.0
curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
-H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "bytedance/seed-asr-2.0",
"audio_url": "https://example.com/interview.mp3",
"enable_punc": true,
"enable_speaker_info": true,
"show_utterances": true
}'| Parámetro | Obligatorio | Predeterminado | Notas |
|---|---|---|---|
audio_url | Sí | — | URL pública o Base64. wav/mp3/ogg/raw |
format | No | mp3 | mp3, wav, ogg, raw |
language | No | auto | Déjalo vacío para detección automática. Admite 51 idiomas |
enable_itn | No | true | Normalización inversa de texto ("cien" pasa a ser "100") |
enable_punc | No | false | Añadir puntuación |
enable_ddc | No | false | Suavizar muletillas y repeticiones |
enable_speaker_info | No | false | Separación de hablantes, hasta 10 hablantes |
show_utterances | No | false | Devolver segmentos con marcas de tiempo |
context | No | — | Palabras clave en línea. Debe ser una cadena JSON: {"hotwords":[{"word":"Atlas"}]}. Texto plano aquí hace fallar la tarea |
Ejemplo: xAI STT v1
curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
-H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "xai/stt-v1",
"audio": "https://example.com/interview.mp3",
"diarize": true,
"text_normalization": true
}'| Parámetro | Obligatorio | Predeterminado | Notas |
|---|---|---|---|
audio | Sí | — | URL pública o Base64. Los formatos contenedores se detectan automáticamente |
language | No | auto | ISO 639-1. Admite 24 idiomas |
text_normalization | No | false | "cien dólares" pasa a ser "$100" |
keyterm | No | [] | Hasta 100 términos de sesgo, de 50 caracteres cada uno |
diarize | No | false | Separación de hablantes, añade speaker_id por palabra |
filler_words | No | false | Conservar los "eh" y "mmm" (se eliminan de forma predeterminada) |
multichannel | No | false | Transcribir cada canal por separado |
Leer el resultado
{
"code": 200,
"data": {
"id": "…",
"status": "completed",
"outputs": ["Thanks for joining the call today…"],
"stt_result": {
"text": "Thanks for joining the call today…",
"duration": 184.2,
"words": [
{ "text": "Thanks", "start": 0.12, "end": 0.41, "speaker_id": "1" }
]
}
}
}outputs[0] contiene la transcripción en texto plano. La salida estructurada — tiempos, hablantes, idioma detectado — vive en stt_result.
Proporcionar la entrada de audio
Los campos de entrada de audio aceptan una URL HTTPS pública o un data URI en Base64. Las entradas en Base64 se almacenan automáticamente y se sustituyen por una URL antes de que la solicitud llegue al modelo.
Para archivos locales, súbelos primero y usa la URL devuelta:
curl -X POST https://api.atlascloud.ai/api/v1/model/uploadMedia \
-H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
-F "[email protected]"Consulta Subir archivos para ver límites y detalles.
Facturación
Los modelos de audio se facturan de una de estas tres formas, según el modelo:
| Método | Se aplica a | Base de cálculo |
|---|---|---|
| Por cada 1000 caracteres | La mayoría de los modelos de texto a voz | Longitud del text de entrada |
| Por segundo de salida | Algunos modelos de voz, incluido Seed Audio 1.0 | Duración generada real, redondeada hacia arriba |
| Por minuto de entrada | Modelos de voz a texto | Duración del audio enviado |
Las tareas fallidas no se facturan. En los modelos facturados por duración de salida, se retiene un importe al enviar la tarea y se liquida contra la duración real al completarse.
Usa el endpoint de precios para obtener un presupuesto exacto antes de generar, y consulta Facturación por modelo para ver ejemplos resueltos.
Encontrar modelos de audio
El catálogo de modelos cambia con frecuencia. En lugar de fijar una lista en el código, filtra el catálogo por tipo:
- Explora la Biblioteca de modelos y filtra por Text-to-Audio o Audio-to-Text
- O bien lístalos desde un agente con el Servidor MCP usando
atlas_list_modelscontype="Audio"
Los parámetros exactos de cada modelo se publican en su propia página de referencia de API, en Model endpoints.
Relacionado
Last updated on