Генерация аудио · google

Gemini 3.8 Flash-Lite TTS

gemini-38-flash-lite-tts

Gemini 3.8 Flash-Lite TTS — генерация аудио от Google, доступная через единый Ranvik API. Поддерживаемые возможности: async, text_to_audio.

от 5 320 ₽ / 1 млн символов

Технические характеристики

МодальностьГенерация аудио
Провайдерgoogle
СтатусАктивна
ID для запросовgemini-38-flash-lite-tts

Возможности

  • Async
  • Text-to-Audio

Цены

ЕдиницаЦена
за 1 млн символов · Minimum 1000 characters5 320 ₽

Цены указаны в рублях. Списываются с баланса проекта при каждом успешном запросе.

Поддерживаемые параметры

Параметры передаются вендору как есть (pure proxy) — мы не валидируем их у себя на стороне. Если вендор не примет — вернётся его ошибка.

ПараметрТипДиапазон / valuesDefaultОписание
textstringmin: 1 · max: 8000— Текст для одного голоса. Не передавайте вместе с speakers и turns.
voicestring—Kore Голос для одиночной озвучки. Для диалога задайте голос каждому speaker.
style_instructionsstringmax: 2000— Общие указания по темпу, тону, эмоции и акценту; учитываются в цене.
speakersarray of objectsmin: 2 · max: 2— Ровно два говорящих с разными speaker_id; не передавайте вместе с text/voice.
turnsarray of objectsmin: 1 · max: 100— Реплики диалога в порядке произнесения; speaker_id должен быть в speakers.

Параметры ответа

Что возвращает API. У медиа-моделей формат зависит от режима: sync — сразу результат, async — task_id для опроса через GET /v1/tasks/{id}. Эта модель работает только в async-режиме.

Async (HTTP 202)

HTTP 202: сохраните id задачи для опроса.

ПолеТипЗначенияОписание
idstring—
statusstring—

Опрос статуса (GET /v1/tasks/{id})

GET /v1/tasks/{id}: статус и ссылка на WAV-файл.

ПолеТипЗначенияОписание
statusstring—
dataarray—
Каждый элемент:
  • url— string
errorstring—

Пример запроса

from openai import OpenAI

client = OpenAI(api_key="rk_live_...", base_url="https://api.ranvik.ru/v1")
resp = client.audio.speech.create(
    model= "gemini-38-flash-lite-tts",
    text= "Пример промпта",
    voice= "Kore",
    style_instructions= "value",
    speakers= [],
    turns= [],
)
print(resp)

Замените rk_live_... на ваш ключ из кабинета.

О провайдере: Google

Google DeepMind разрабатывает семейство моделей Gemini — мультимодальные LLM с нативной поддержкой текста, изображений, аудио и видео в одном запросе. Известны рекордно длинным контекстом (до 2M токенов).

Официальный сайт: https://deepmind.google

Документация модели у вендора: https://wavespeed.ai/models/google/gemini-3.8-flash-lite/text-to-speech