Gemini 3.8 Flash-Lite TTS API

ПровайдерGoogle

gemini-38-flash-lite-tts — генерация аудио-модель от Google.

asynctext_to_audio

Попробуйте прямо здесь

Что умеет Gemini 3.8 Flash-Lite TTS

  • Async
  • Text-to-Audio

Стоимость

за 1 млн символов
Minimum 1000 characters
5 320 ₽

Цены указаны в рублях и списываются с баланса проекта за успешные запросы. Надбавки (+) суммируются с базовой ставкой.

Технические характеристики

Vendor
google
Modality
audio

Параметры запроса

Параметры, которые принимает модель. Передаются в теле запроса.

ПараметрТипДиапазон / значенияПо умолчаниюОписание
text
string
min: 1 · max: 8000
—
Текст для одного голоса. Не передавайте вместе с speakers и turns.
voice
string
—
Kore
Голос для одиночной озвучки. Для диалога задайте голос каждому speaker.
style_instructions
string
max: 2000
—
Общие указания по темпу, тону, эмоции и акценту; учитываются в цене.
speakers
array of objects
min: 2 · max: 2
—
Ровно два говорящих с разными speaker_id; не передавайте вместе с text/voice.
turns
array of objects
min: 1 · max: 100
—
Реплики диалога в порядке произнесения; speaker_id должен быть в speakers.

Параметры ответа

Что возвращает API. У медиа-моделей формат зависит от режима: sync — сразу результат, async — task_id для опроса через GET /v1/tasks/{id}. Эта модель работает только в async-режиме.

Async (HTTP 202)

HTTP 202: сохраните id задачи для опроса.

ПолеТипЗначенияОписание
id
string
—
status
string
—

Опрос статуса (GET /v1/tasks/{id})

GET /v1/tasks/{id}: статус и ссылка на WAV-файл.

ПолеТипЗначенияОписание
status
string
—
data
array
—
Каждый элемент:
  • url— string
error
string
—

Пример кода

gemini-38-flash-lite-tts_example.py
from openai import OpenAI

client = OpenAI(api_key="rk_live_...", base_url="https://api.ranvik.ru/v1")
resp = client.audio.speech.create(
    model= "gemini-38-flash-lite-tts",
    text= "Пример промпта",
    voice= "Kore",
    style_instructions= "value",
    speakers= [],
    turns= [],
)
print(resp)
Полная документация модели