Modelli audio
Genera voce, componi musica e trascrivi registrazioni tramite un unico endpoint di Atlas Cloud. Copre Seed Audio, ElevenLabs, MiniMax, Gemini TTS, Suno, Seed ASR e xAI STT.
Atlas Cloud espone tre diverse capacità audio — sintesi vocale, generazione musicale e trascrizione vocale — attraverso un unico endpoint. Quale ottieni dipende dal modello che scegli, non dall'URL.
POST https://api.atlascloud.ai/api/v1/model/generateAudioNon esiste un endpoint /v1/audio/speech o /v1/audio/transcriptions. Se stai portando codice dall'SDK OpenAI, le chiamate audio non si mappano uno a uno: passano dal flusso di predizione asincrono descritto qui sotto.
Come funziona
Le richieste audio sono asincrone, come la generazione di immagini e video:
Invia un'attività. Esegui un POST verso generateAudio con un model e i parametri specifici del modello appiattiti al livello principale.
Ottieni un ID di predizione. La risposta restituisce data.id e data.status.
Interroga il risultato. GET /api/v1/model/prediction/{id} finché status non raggiunge uno stato terminale, oppure registra un webhook e ricevi invece l'evento audio.task.terminal.
Vedi Predizioni per la macchina a stati completa e Webhook per la configurazione dei callback.
I risultati di trascrizione e testi delle canzoni sono testo, non URL. Per la maggior parte dei modelli audio outputs[0] è un link a un file generato. Per i modelli di trascrizione vocale e di generazione di testi, outputs[0] contiene il testo stesso — che a volte può somigliare a un URL. Non trattare mai ciecamente outputs[0] come qualcosa da scaricare: ramifica in base al tipo di modello.
Sintesi vocale
Sintetizza voce a partire dal testo. Tra i modelli disponibili ci sono Seed Audio, ElevenLabs, MiniMax Speech, Gemini TTS e xAI TTS.
Esempio: Seed Audio 1.0
curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
-H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "bytedance/seed-audio-1.0",
"text": "Welcome to Atlas Cloud.",
"format": "mp3",
"sample_rate": 24000
}'| Parametro | Obbligatorio | Predefinito | Note |
|---|---|---|---|
text | Sì | — | Il testo da sintetizzare |
references | No | — | Fino a 3 riferimenti vocali oppure un singolo riferimento immagine. Ogni voce usa esattamente una sorgente e i riferimenti audio e immagine non possono essere mescolati |
format | No | mp3 | mp3, wav, pcm, ogg_opus |
sample_rate | No | 24000 | 8000, 16000, 24000, 32000, 44100, 48000 |
pitch_rate | No | 0 | Da −12 a 12 |
speech_rate | No | 0 | Da −50 a 100 (100 = 2,0x, −50 = 0,5x) |
loudness_rate | No | 0 | Da −50 a 100 |
Per clonare o richiamare una voce, allega una clip di riferimento e puntaci dal testo:
{
"model": "bytedance/seed-audio-1.0",
"text": "Use the voice of @audio1 and say: your order has shipped.",
"references": [{ "audio_url": "https://example.com/sample-voice.mp3" }]
}Le clip di riferimento devono durare al massimo 30 secondi e pesare meno di 10 MB.
Generazione musicale
Componi brani completi, con o senza voce. Sono disponibili Suno Chirp e MiniMax Music, oltre a un modello dedicato alla scrittura dei testi.
Esempio: Suno Chirp v5
curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
-H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "suno/chirp-v5",
"prompt": "an upbeat indie pop song about summer road trips",
"vocal_gender": "Female"
}'| Parametro | Obbligatorio | Predefinito | Note |
|---|---|---|---|
prompt | Di solito | — | Con custom: false è una descrizione del brano. Con custom: true sono i testi |
custom | No | false | false = descrivi il brano, true = fornisci i tuoi testi |
instrumental | No | false | Genera senza voce |
vocal_gender | No | — | Male o Female. Vale in entrambe le modalità |
title, style, negative_tags, style_weight e campi correlati | No | — | Hanno effetto solo con custom: true — altrimenti vengono ignorati silenziosamente |
Chirp v5 restituisce due brani per richiesta, più una copertina generata in thumbnail. prompt è obbligatorio a meno che tu non imposti sia custom: true sia instrumental: true.
Per scrivere prima i testi e comporre dopo, chiama un modello di testi come minimax/lyrics-generation, poi passa il suo output nel campo lyrics del modello musicale.
Trascrizione vocale
Trascrivi registrazioni, con separazione dei parlanti e marcatori temporali a livello di parola opzionali.
I due modelli di trascrizione usano nomi di campo diversi per l'input audio: Seed ASR richiede audio_url, xAI STT richiede audio. Passare quello sbagliato fa fallire la validazione.
Esempio: Seed ASR 2.0
curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
-H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "bytedance/seed-asr-2.0",
"audio_url": "https://example.com/interview.mp3",
"enable_punc": true,
"enable_speaker_info": true,
"show_utterances": true
}'| Parametro | Obbligatorio | Predefinito | Note |
|---|---|---|---|
audio_url | Sì | — | URL pubblico o Base64. wav/mp3/ogg/raw |
format | No | mp3 | mp3, wav, ogg, raw |
language | No | auto | Lascia vuoto per il rilevamento automatico. Supporta 51 lingue |
enable_itn | No | true | Normalizzazione inversa del testo («cento» diventa «100») |
enable_punc | No | false | Aggiungi la punteggiatura |
enable_ddc | No | false | Attenua intercalari e ripetizioni |
enable_speaker_info | No | false | Separazione dei parlanti, fino a 10 parlanti |
show_utterances | No | false | Restituisci segmenti con marcatori temporali |
context | No | — | Hotword inline. Deve essere una stringa JSON: {"hotwords":[{"word":"Atlas"}]}. Del testo semplice qui fa fallire l'attività |
Esempio: xAI STT v1
curl -X POST https://api.atlascloud.ai/api/v1/model/generateAudio \
-H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "xai/stt-v1",
"audio": "https://example.com/interview.mp3",
"diarize": true,
"text_normalization": true
}'| Parametro | Obbligatorio | Predefinito | Note |
|---|---|---|---|
audio | Sì | — | URL pubblico o Base64. I formati contenitore vengono rilevati automaticamente |
language | No | auto | ISO 639-1. Supporta 24 lingue |
text_normalization | No | false | «cento dollari» diventa «100 $» |
keyterm | No | [] | Fino a 100 termini di bias, 50 caratteri ciascuno |
diarize | No | false | Separazione dei parlanti, aggiunge speaker_id per ogni parola |
filler_words | No | false | Mantieni «ehm» e «uhm» (rimossi per impostazione predefinita) |
multichannel | No | false | Trascrivi ogni canale separatamente |
Leggere il risultato
{
"code": 200,
"data": {
"id": "…",
"status": "completed",
"outputs": ["Thanks for joining the call today…"],
"stt_result": {
"text": "Thanks for joining the call today…",
"duration": 184.2,
"words": [
{ "text": "Thanks", "start": 0.12, "end": 0.41, "speaker_id": "1" }
]
}
}
}outputs[0] contiene la trascrizione in chiaro. L'output strutturato — tempi, parlanti, lingua rilevata — si trova in stt_result.
Fornire input audio
I campi di input audio accettano un URL HTTPS pubblico oppure un data URI in Base64. Gli input Base64 vengono memorizzati automaticamente e sostituiti con un URL prima che la richiesta raggiunga il modello.
Per i file locali, caricali prima e usa l'URL restituito:
curl -X POST https://api.atlascloud.ai/api/v1/model/uploadMedia \
-H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
-F "[email protected]"Vedi Caricare file per limiti e dettagli.
Fatturazione
I modelli audio vengono fatturati in uno di tre modi, a seconda del modello:
| Metodo | Si applica a | Base di calcolo |
|---|---|---|
| Per 1.000 caratteri | La maggior parte dei modelli di sintesi vocale | Lunghezza del text in input |
| Per secondo di output | Alcuni modelli vocali, tra cui Seed Audio 1.0 | Durata effettivamente generata, arrotondata per eccesso |
| Per minuto di input | Modelli di trascrizione vocale | Durata dell'audio inviato |
Le attività fallite non vengono fatturate. Per i modelli fatturati in base alla durata dell'output, un importo viene trattenuto all'invio e conguagliato sulla durata reale al completamento.
Usa l'endpoint dei prezzi per ottenere un preventivo esatto prima di generare e consulta Fatturazione dei modelli per esempi pratici.
Trovare i modelli audio
Il catalogo dei modelli cambia spesso. Invece di scrivere un elenco fisso nel codice, filtra il catalogo per tipo:
- Sfoglia la Libreria dei modelli e filtra per Text-to-Audio o Audio-to-Text
- Oppure elencali da un agente con il Server MCP usando
atlas_list_modelscontype="Audio"
I parametri esatti di ogni modello sono pubblicati nella sua pagina di riferimento API sotto Model endpoints.
Argomenti correlati
Last updated on