Modelos de audio

Genera voz, compón música y transcribe grabaciones a través de un único endpoint de Atlas Cloud. Cubre Seed Audio, ElevenLabs, MiniMax, Gemini TTS, Suno, Seed ASR y xAI STT.

Atlas Cloud expone tres capacidades de audio distintas — texto a voz, generación de música y voz a texto — a través de un único endpoint. Cuál obtienes lo determina el modelo que elijas, no la URL.

POST https://api.atlascloud.ai/api/v1/model/generateAudio

No existe ningún endpoint /v1/audio/speech ni /v1/audio/transcriptions. Si estás migrando código del SDK de OpenAI, las llamadas de audio no se corresponden una a una — pasan por el flujo asíncrono de predicciones que se describe abajo.

Cómo funciona

Las solicitudes de audio son asíncronas, igual que la generación de imagen y video:

Envía una tarea. Haz un POST a generateAudio con un model y los parámetros propios del modelo aplanados en el nivel superior.

Obtén un ID de predicción. La respuesta devuelve data.id y data.status.

Consulta el resultado. GET /api/v1/model/prediction/{id} hasta que status alcance un estado terminal, o registra un webhook y recibe el evento audio.task.terminal en su lugar.

Consulta Predicciones para ver la máquina de estados completa y Webhooks para configurar los callbacks.

Los resultados de transcripción y de letras son texto, no URLs. En la mayoría de los modelos de audio, outputs[0] es un enlace a un archivo generado. En los modelos de voz a texto y de generación de letras, outputs[0] contiene el propio texto — que en ocasiones puede parecer una URL. Nunca trates outputs[0] a ciegas como algo descargable; ramifica según el tipo de modelo.

Texto a voz

Sintetiza voz a partir de texto. Entre los modelos disponibles están Seed Audio, ElevenLabs, MiniMax Speech, Gemini TTS y xAI TTS.

Ejemplo: Seed Audio 1.0

curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
  -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "bytedance/seed-audio-1.0",
    "text": "Welcome to Atlas Cloud.",
    "format": "mp3",
    "sample_rate": 24000
  }'
ParámetroObligatorioPredeterminadoNotas
textSí—El texto que se va a sintetizar
referencesNo—Hasta 3 referencias de voz, o una única referencia de imagen. Cada entrada usa exactamente una fuente, y no se pueden mezclar referencias de audio e imagen
formatNomp3mp3, wav, pcm, ogg_opus
sample_rateNo240008000, 16000, 24000, 32000, 44100, 48000
pitch_rateNo0−12 a 12
speech_rateNo0−50 a 100 (100 = 2.0x, −50 = 0.5x)
loudness_rateNo0−50 a 100

Para clonar o referenciar una voz, adjunta un clip de referencia y apunta a él desde el texto:

{
  "model": "bytedance/seed-audio-1.0",
  "text": "Use the voice of @audio1 and say: your order has shipped.",
  "references": [{ "audio_url": "https://example.com/sample-voice.mp3" }]
}

Los clips de referencia deben durar 30 segundos o menos y pesar menos de 10 MB.

Generación de música

Compón pistas completas, con o sin voces. Están disponibles Suno Chirp y MiniMax Music, además de un modelo dedicado a escribir letras.

Ejemplo: Suno Chirp v5

curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
  -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "suno/chirp-v5",
    "prompt": "an upbeat indie pop song about summer road trips",
    "vocal_gender": "Female"
  }'
ParámetroObligatorioPredeterminadoNotas
promptNormalmente—Con custom: false es una descripción de la canción. Con custom: true es la letra
customNofalsefalse = describir la canción, true = aportar tu propia letra
instrumentalNofalseGenerar sin voces
vocal_genderNo—Male o Female. Se aplica en ambos modos
title, style, negative_tags, style_weight y campos relacionadosNo—Solo tienen efecto con custom: true — de lo contrario se ignoran en silencio

Chirp v5 devuelve dos pistas por solicitud, más una imagen de portada generada en thumbnail. prompt es obligatorio salvo que definas a la vez custom: true e instrumental: true.

Para escribir primero la letra y componer después, llama a un modelo de letras como minimax/lyrics-generation y pasa su salida al campo lyrics del modelo de música.

Voz a texto

Transcribe grabaciones, con separación de hablantes y marcas de tiempo por palabra opcionales.

Los dos modelos de transcripción usan nombres de campo distintos para la entrada de audio: Seed ASR toma audio_url y xAI STT toma audio. Pasar el equivocado falla la validación.

Ejemplo: Seed ASR 2.0

curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
  -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "bytedance/seed-asr-2.0",
    "audio_url": "https://example.com/interview.mp3",
    "enable_punc": true,
    "enable_speaker_info": true,
    "show_utterances": true
  }'
ParámetroObligatorioPredeterminadoNotas
audio_urlSí—URL pública o Base64. wav/mp3/ogg/raw
formatNomp3mp3, wav, ogg, raw
languageNoautoDéjalo vacío para detección automática. Admite 51 idiomas
enable_itnNotrueNormalización inversa de texto ("cien" pasa a ser "100")
enable_puncNofalseAñadir puntuación
enable_ddcNofalseSuavizar muletillas y repeticiones
enable_speaker_infoNofalseSeparación de hablantes, hasta 10 hablantes
show_utterancesNofalseDevolver segmentos con marcas de tiempo
contextNo—Palabras clave en línea. Debe ser una cadena JSON: {"hotwords":[{"word":"Atlas"}]}. Texto plano aquí hace fallar la tarea

Ejemplo: xAI STT v1

curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
  -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "xai/stt-v1",
    "audio": "https://example.com/interview.mp3",
    "diarize": true,
    "text_normalization": true
  }'
ParámetroObligatorioPredeterminadoNotas
audioSí—URL pública o Base64. Los formatos contenedores se detectan automáticamente
languageNoautoISO 639-1. Admite 24 idiomas
text_normalizationNofalse"cien dólares" pasa a ser "$100"
keytermNo[]Hasta 100 términos de sesgo, de 50 caracteres cada uno
diarizeNofalseSeparación de hablantes, añade speaker_id por palabra
filler_wordsNofalseConservar los "eh" y "mmm" (se eliminan de forma predeterminada)
multichannelNofalseTranscribir cada canal por separado

Leer el resultado

{
  "code": 200,
  "data": {
    "id": "…",
    "status": "completed",
    "outputs": ["Thanks for joining the call today…"],
    "stt_result": {
      "text": "Thanks for joining the call today…",
      "duration": 184.2,
      "words": [
        { "text": "Thanks", "start": 0.12, "end": 0.41, "speaker_id": "1" }
      ]
    }
  }
}

outputs[0] contiene la transcripción en texto plano. La salida estructurada — tiempos, hablantes, idioma detectado — vive en stt_result.

Proporcionar la entrada de audio

Los campos de entrada de audio aceptan una URL HTTPS pública o un data URI en Base64. Las entradas en Base64 se almacenan automáticamente y se sustituyen por una URL antes de que la solicitud llegue al modelo.

Para archivos locales, súbelos primero y usa la URL devuelta:

curl -X POST https://api.atlascloud.ai/api/v1/model/uploadMedia \
  -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
  -F "[email protected]"

Consulta Subir archivos para ver límites y detalles.

Facturación

Los modelos de audio se facturan de una de estas tres formas, según el modelo:

MétodoSe aplica aBase de cálculo
Por cada 1000 caracteresLa mayoría de los modelos de texto a vozLongitud del text de entrada
Por segundo de salidaAlgunos modelos de voz, incluido Seed Audio 1.0Duración generada real, redondeada hacia arriba
Por minuto de entradaModelos de voz a textoDuración del audio enviado

Las tareas fallidas no se facturan. En los modelos facturados por duración de salida, se retiene un importe al enviar la tarea y se liquida contra la duración real al completarse.

Usa el endpoint de precios para obtener un presupuesto exacto antes de generar, y consulta Facturación por modelo para ver ejemplos resueltos.

Encontrar modelos de audio

El catálogo de modelos cambia con frecuencia. En lugar de fijar una lista en el código, filtra el catálogo por tipo:

  • Explora la Biblioteca de modelos y filtra por Text-to-Audio o Audio-to-Text
  • O bien lístalos desde un agente con el Servidor MCP usando atlas_list_models con type="Audio"

Los parámetros exactos de cada modelo se publican en su propia página de referencia de API, en Model endpoints.

Relacionado

Last updated on

On this page