Modelli audio

Genera voce, componi musica e trascrivi registrazioni tramite un unico endpoint di Atlas Cloud. Copre Seed Audio, ElevenLabs, MiniMax, Gemini TTS, Suno, Seed ASR e xAI STT.

Atlas Cloud espone tre diverse capacità audio — sintesi vocale, generazione musicale e trascrizione vocale — attraverso un unico endpoint. Quale ottieni dipende dal modello che scegli, non dall'URL.

POST https://api.atlascloud.ai/api/v1/model/generateAudio

Non esiste un endpoint /v1/audio/speech o /v1/audio/transcriptions. Se stai portando codice dall'SDK OpenAI, le chiamate audio non si mappano uno a uno: passano dal flusso di predizione asincrono descritto qui sotto.

Come funziona

Le richieste audio sono asincrone, come la generazione di immagini e video:

Invia un'attività. Esegui un POST verso generateAudio con un model e i parametri specifici del modello appiattiti al livello principale.

Ottieni un ID di predizione. La risposta restituisce data.id e data.status.

Interroga il risultato. GET /api/v1/model/prediction/{id} finché status non raggiunge uno stato terminale, oppure registra un webhook e ricevi invece l'evento audio.task.terminal.

Vedi Predizioni per la macchina a stati completa e Webhook per la configurazione dei callback.

I risultati di trascrizione e testi delle canzoni sono testo, non URL. Per la maggior parte dei modelli audio outputs[0] è un link a un file generato. Per i modelli di trascrizione vocale e di generazione di testi, outputs[0] contiene il testo stesso — che a volte può somigliare a un URL. Non trattare mai ciecamente outputs[0] come qualcosa da scaricare: ramifica in base al tipo di modello.

Sintesi vocale

Sintetizza voce a partire dal testo. Tra i modelli disponibili ci sono Seed Audio, ElevenLabs, MiniMax Speech, Gemini TTS e xAI TTS.

Esempio: Seed Audio 1.0

curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
  -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "bytedance/seed-audio-1.0",
    "text": "Welcome to Atlas Cloud.",
    "format": "mp3",
    "sample_rate": 24000
  }'
ParametroObbligatorioPredefinitoNote
textSì—Il testo da sintetizzare
referencesNo—Fino a 3 riferimenti vocali oppure un singolo riferimento immagine. Ogni voce usa esattamente una sorgente e i riferimenti audio e immagine non possono essere mescolati
formatNomp3mp3, wav, pcm, ogg_opus
sample_rateNo240008000, 16000, 24000, 32000, 44100, 48000
pitch_rateNo0Da −12 a 12
speech_rateNo0Da −50 a 100 (100 = 2,0x, −50 = 0,5x)
loudness_rateNo0Da −50 a 100

Per clonare o richiamare una voce, allega una clip di riferimento e puntaci dal testo:

{
  "model": "bytedance/seed-audio-1.0",
  "text": "Use the voice of @audio1 and say: your order has shipped.",
  "references": [{ "audio_url": "https://example.com/sample-voice.mp3" }]
}

Le clip di riferimento devono durare al massimo 30 secondi e pesare meno di 10 MB.

Generazione musicale

Componi brani completi, con o senza voce. Sono disponibili Suno Chirp e MiniMax Music, oltre a un modello dedicato alla scrittura dei testi.

Esempio: Suno Chirp v5

curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
  -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "suno/chirp-v5",
    "prompt": "an upbeat indie pop song about summer road trips",
    "vocal_gender": "Female"
  }'
ParametroObbligatorioPredefinitoNote
promptDi solito—Con custom: false è una descrizione del brano. Con custom: true sono i testi
customNofalsefalse = descrivi il brano, true = fornisci i tuoi testi
instrumentalNofalseGenera senza voce
vocal_genderNo—Male o Female. Vale in entrambe le modalità
title, style, negative_tags, style_weight e campi correlatiNo—Hanno effetto solo con custom: true — altrimenti vengono ignorati silenziosamente

Chirp v5 restituisce due brani per richiesta, più una copertina generata in thumbnail. prompt è obbligatorio a meno che tu non imposti sia custom: true sia instrumental: true.

Per scrivere prima i testi e comporre dopo, chiama un modello di testi come minimax/lyrics-generation, poi passa il suo output nel campo lyrics del modello musicale.

Trascrizione vocale

Trascrivi registrazioni, con separazione dei parlanti e marcatori temporali a livello di parola opzionali.

I due modelli di trascrizione usano nomi di campo diversi per l'input audio: Seed ASR richiede audio_url, xAI STT richiede audio. Passare quello sbagliato fa fallire la validazione.

Esempio: Seed ASR 2.0

curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
  -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "bytedance/seed-asr-2.0",
    "audio_url": "https://example.com/interview.mp3",
    "enable_punc": true,
    "enable_speaker_info": true,
    "show_utterances": true
  }'
ParametroObbligatorioPredefinitoNote
audio_urlSì—URL pubblico o Base64. wav/mp3/ogg/raw
formatNomp3mp3, wav, ogg, raw
languageNoautoLascia vuoto per il rilevamento automatico. Supporta 51 lingue
enable_itnNotrueNormalizzazione inversa del testo («cento» diventa «100»)
enable_puncNofalseAggiungi la punteggiatura
enable_ddcNofalseAttenua intercalari e ripetizioni
enable_speaker_infoNofalseSeparazione dei parlanti, fino a 10 parlanti
show_utterancesNofalseRestituisci segmenti con marcatori temporali
contextNo—Hotword inline. Deve essere una stringa JSON: {"hotwords":[{"word":"Atlas"}]}. Del testo semplice qui fa fallire l'attività

Esempio: xAI STT v1

curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
  -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "xai/stt-v1",
    "audio": "https://example.com/interview.mp3",
    "diarize": true,
    "text_normalization": true
  }'
ParametroObbligatorioPredefinitoNote
audioSì—URL pubblico o Base64. I formati contenitore vengono rilevati automaticamente
languageNoautoISO 639-1. Supporta 24 lingue
text_normalizationNofalse«cento dollari» diventa «100 $»
keytermNo[]Fino a 100 termini di bias, 50 caratteri ciascuno
diarizeNofalseSeparazione dei parlanti, aggiunge speaker_id per ogni parola
filler_wordsNofalseMantieni «ehm» e «uhm» (rimossi per impostazione predefinita)
multichannelNofalseTrascrivi ogni canale separatamente

Leggere il risultato

{
  "code": 200,
  "data": {
    "id": "…",
    "status": "completed",
    "outputs": ["Thanks for joining the call today…"],
    "stt_result": {
      "text": "Thanks for joining the call today…",
      "duration": 184.2,
      "words": [
        { "text": "Thanks", "start": 0.12, "end": 0.41, "speaker_id": "1" }
      ]
    }
  }
}

outputs[0] contiene la trascrizione in chiaro. L'output strutturato — tempi, parlanti, lingua rilevata — si trova in stt_result.

Fornire input audio

I campi di input audio accettano un URL HTTPS pubblico oppure un data URI in Base64. Gli input Base64 vengono memorizzati automaticamente e sostituiti con un URL prima che la richiesta raggiunga il modello.

Per i file locali, caricali prima e usa l'URL restituito:

curl -X POST https://api.atlascloud.ai/api/v1/model/uploadMedia \
  -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
  -F "[email protected]"

Vedi Caricare file per limiti e dettagli.

Fatturazione

I modelli audio vengono fatturati in uno di tre modi, a seconda del modello:

MetodoSi applica aBase di calcolo
Per 1.000 caratteriLa maggior parte dei modelli di sintesi vocaleLunghezza del text in input
Per secondo di outputAlcuni modelli vocali, tra cui Seed Audio 1.0Durata effettivamente generata, arrotondata per eccesso
Per minuto di inputModelli di trascrizione vocaleDurata dell'audio inviato

Le attività fallite non vengono fatturate. Per i modelli fatturati in base alla durata dell'output, un importo viene trattenuto all'invio e conguagliato sulla durata reale al completamento.

Usa l'endpoint dei prezzi per ottenere un preventivo esatto prima di generare e consulta Fatturazione dei modelli per esempi pratici.

Trovare i modelli audio

Il catalogo dei modelli cambia spesso. Invece di scrivere un elenco fisso nel codice, filtra il catalogo per tipo:

  • Sfoglia la Libreria dei modelli e filtra per Text-to-Audio o Audio-to-Text
  • Oppure elencali da un agente con il Server MCP usando atlas_list_models con type="Audio"

I parametri esatti di ogni modello sono pubblicati nella sua pagina di riferimento API sotto Model endpoints.

Argomenti correlati

Last updated on

On this page