Gemini 3.8 Flash TTS API
gemini-38-flash-tts — генерация аудио-модель от Google.
asynctext_to_audio
Попробуйте прямо здесь
Gemini 3.8 Flash TTS Открыть в песочнице
Что умеет Gemini 3.8 Flash TTS
- Async
- Text-to-Audio
Стоимость
за 1 млн символов
Minimum 1000 characters
6 650 ₽
Цены указаны в рублях и списываются с баланса проекта за успешные запросы. Надбавки (+) суммируются с базовой ставкой.
Технические характеристики
Vendor
google
Modality
audio
Параметры запроса
Параметры, которые принимает модель. Передаются в теле запроса.
ПараметрТипДиапазон / значенияПо умолчаниюОписание
textstring
min: 1 · max: 8000
—Текст для одного голоса. Не передавайте вместе с speakers и turns.
voicestring
—
KoreГолос для одиночной озвучки. Для диалога задайте голос каждому speaker.
style_instructionsstring
max: 2000
—Общие указания по темпу, тону, эмоции и акценту; учитываются в цене.
speakersarray of objects
min: 2 · max: 2
—Ровно два говорящих с разными speaker_id; не передавайте вместе с text/voice.
turnsarray of objects
min: 1 · max: 100
—Реплики диалога в порядке произнесения; speaker_id должен быть в speakers.
Параметры ответа
Что возвращает API. У медиа-моделей формат зависит от режима: sync — сразу результат, async — task_id для опроса через GET /v1/tasks/{id}. Эта модель работает только в async-режиме.
Async (HTTP 202)
HTTP 202: сохраните id задачи для опроса.
ПолеТипЗначенияОписание
idstring
—
statusstring
—
Опрос статуса (GET /v1/tasks/{id})
GET /v1/tasks/{id}: статус и ссылка на WAV-файл.
ПолеТипЗначенияОписание
statusstring
—
dataarray
—
Каждый элемент:
url— string
errorstring
—
Пример кода
gemini-38-flash-tts_example.py
from openai import OpenAI
client = OpenAI(api_key="rk_live_...", base_url="https://api.ranvik.ru/v1")
resp = client.audio.speech.create(
model= "gemini-38-flash-tts",
text= "Пример промпта",
voice= "Kore",
style_instructions= "value",
speakers= [],
turns= [],
)
print(resp)