Referencia de la API
Audio
Utiliza las API de generación de voz, transcripción de audio y traducción de audio.
Las API de audio incluyen generación de voz, transcripción y traducción. La generación de voz utiliza un cuerpo de solicitud JSON; la transcripción y la traducción suelen utilizar datos de formulario multipart para cargar el archivo de audio.
Puntos de conexión
| Método | Ruta | Descripción |
|---|---|---|
POST | /v1/audio/speech | Texto a voz |
POST | /v1/audio/transcriptions | Transcripción de audio |
POST | /v1/audio/translations | Traducción de audio |
Campos de solicitud
| Campo | Tipo | Aplica a | Descripción |
|---|---|---|---|
model | string | All | ID del modelo de audio, obligatorio |
input | string | speech | Texto a sintetizar |
voice | string | speech | ID de voz |
instructions | string | speech | Estilo de voz o instrucciones adicionales |
response_format | string | All | Formato de respuesta. La transcripción y la traducción usan json de forma predeterminada |
speed | number | speech | Velocidad de la voz |
stream_format | string | speech | Configúralo en sse para habilitar el streaming cuando el modelo lo admita |
metadata | object | speech | Metadatos de transferencia directa |
file | file | transcriptions/translations | Archivo de audio en datos de formulario multipart, obligatorio |
language | any | extension | Opción de idioma admitida por algunos canales |
Generación de voz
curl https://api.tensoraxis.com/v1/audio/speech \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $TENSORAXIS_API_KEY" \
-d '{
"model": "tts-1",
"voice": "alloy",
"input": "Hello from TENSORAXIS.",
"response_format": "mp3"
}' \
--output speech.mp3Transcripción
curl https://api.tensoraxis.com/v1/audio/transcriptions \
-H "Authorization: Bearer $TENSORAXIS_API_KEY" \
-F model="whisper-1" \
-F file="@audio.mp3" \
-F response_format="json"Traducción
curl https://api.tensoraxis.com/v1/audio/translations \
-H "Authorization: Bearer $TENSORAXIS_API_KEY" \
-F model="whisper-1" \
-F file="@audio.mp3" \
-F response_format="json"Estructura de la respuesta
Las respuestas JSON de transcripción y traducción suelen incluir text:
{
"text": "Transcribed text..."
}La generación de voz devuelve audio binario directamente. El Content-Type de la respuesta depende de response_format y del modelo subyacente.