Справочник API
Аудио
Используйте API генерации речи, транскрипции и перевода аудио.
API для работы с аудио включают генерацию речи, транскрипцию и перевод. Генерация речи использует тело запроса в формате JSON; транскрипция и перевод обычно используют multipart form data для загрузки аудиофайла.
Конечные точки
| Метод | Путь | Описание |
|---|---|---|
POST | /v1/audio/speech | Преобразование текста в речь |
POST | /v1/audio/transcriptions | Транскрипция аудио |
POST | /v1/audio/translations | Перевод аудио |
Поля запроса
| Поле | Тип | Применяется к | Описание |
|---|---|---|---|
model | string | Все | ID модели аудио, обязательное |
input | string | speech | Текст для синтеза |
voice | string | speech | ID голоса |
instructions | string | speech | Стиль голоса или дополнительные инструкции |
response_format | string | Все | Формат ответа. Для транскрипции и перевода по умолчанию используется json |
speed | number | speech | Скорость речи |
stream_format | string | speech | Установите значение sse, чтобы включить потоковую передачу, если модель её поддерживает |
metadata | object | speech | Сквозные метаданные |
file | file | transcriptions/translations | Аудиофайл в multipart form data, обязательное |
language | any | extension | Опция языка, поддерживаемая некоторыми каналами |
Генерация речи
curl https://api.tensoraxis.com/v1/audio/speech \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $TENSORAXIS_API_KEY" \
-d '{
"model": "tts-1",
"voice": "alloy",
"input": "Hello from TENSORAXIS.",
"response_format": "mp3"
}' \
--output speech.mp3Транскрипция
curl https://api.tensoraxis.com/v1/audio/transcriptions \
-H "Authorization: Bearer $TENSORAXIS_API_KEY" \
-F model="whisper-1" \
-F file="@audio.mp3" \
-F response_format="json"Перевод
curl https://api.tensoraxis.com/v1/audio/translations \
-H "Authorization: Bearer $TENSORAXIS_API_KEY" \
-F model="whisper-1" \
-F file="@audio.mp3" \
-F response_format="json"Структура ответа
Ответы в формате JSON для транскрипции и перевода обычно включают text:
{
"text": "Transcribed text..."
}Генерация речи возвращает бинарные аудиоданные напрямую. Content-Type ответа зависит от response_format и используемой модели.