Référence API

Audio

Utilisez les API de génération vocale, de transcription audio et de traduction audio.

Les API Audio incluent la génération vocale, la transcription et la traduction. La génération vocale utilise un corps de requête JSON ; la transcription et la traduction utilisent généralement des données multipart form pour téléverser le fichier audio.

Points de terminaison

MéthodeCheminDescription
POST/v1/audio/speechSynthèse vocale
POST/v1/audio/transcriptionsTranscription audio
POST/v1/audio/translationsTraduction audio

Champs de la requête

ChampTypeS'applique àDescription
modelstringToutesIdentifiant du modèle audio, requis
inputstringvocalTexte à synthétiser
voicestringvocalIdentifiant de la voix
instructionsstringvocalStyle vocal ou instructions supplémentaires
response_formatstringToutesFormat de réponse. La transcription et la traduction utilisent json par défaut
speednumbervocalVitesse de la parole
stream_formatstringvocalDéfinir sur sse pour activer le streaming lorsque le modèle le prend en charge
metadataobjectvocalMétadonnées transmises telles quelles
filefiletranscriptions/traductionsFichier audio en données multipart form, requis
languageanyextensionOption de langue prise en charge par certains canaux

Génération vocale

curl https://api.tensoraxis.com/v1/audio/speech \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $TENSORAXIS_API_KEY" \
  -d '{
    "model": "tts-1",
    "voice": "alloy",
    "input": "Hello from TENSORAXIS.",
    "response_format": "mp3"
  }' \
  --output speech.mp3

Transcription

curl https://api.tensoraxis.com/v1/audio/transcriptions \
  -H "Authorization: Bearer $TENSORAXIS_API_KEY" \
  -F model="whisper-1" \
  -F file="@audio.mp3" \
  -F response_format="json"

Traduction

curl https://api.tensoraxis.com/v1/audio/translations \
  -H "Authorization: Bearer $TENSORAXIS_API_KEY" \
  -F model="whisper-1" \
  -F file="@audio.mp3" \
  -F response_format="json"

Structure de la réponse

Les réponses JSON de transcription et de traduction incluent généralement text :

{
  "text": "Transcribed text..."
}

La génération vocale renvoie directement l'audio binaire. Le Content-Type de la réponse dépend de response_format et du modèle en amont.