P-Video-Avatar API

ПровайдерPrunaai

prunaai-p-video-avatar — генерация видео-модель от Prunaai.

asyncimage_to_videotext_to_video

Попробуйте прямо здесь

Что умеет P-Video-Avatar

  • Async
  • Видео из изображения
  • Видео по тексту

Стоимость

за секунду
720p
3.3 ₽
1080p
13.21 ₽

Цены указаны в рублях и списываются с баланса проекта за успешные запросы. Надбавки (+) суммируются с базовой ставкой.

Технические характеристики

Vendor
prunaai
Modality
video

P-Video-Avatar — говорящие аватары из портрета

P-Video-Avatar — модель Pruna для превращения одного портрета в видео с говорящим аватаром. Она принимает изображение и текстовый сценарий или аудио, синхронизирует речь с движением губ и поддерживает настройку голоса, языка, визуальной и голосовой подсказок. Доступны разрешения 720p и 1080p, а параметр seed помогает воспроизводить результаты генерации. Модель подходит для контента, обучения и презентаций.

Параметры запроса

Параметры, которые принимает модель. Передаются в теле запроса.

ПараметрТипДиапазон / значенияПо умолчаниюОписание
positivePrompt
string
—
—
Опциональный текстовый промпт описывающий сцену / контекст.
resolution
enum
720p, 1080p
720p
Resolution preset. Aspect ratio автоматически наследуется из inputs.frameImages (портрета).
seed
integer
min: 0 · max: 2147483647
—
Seed для воспроизводимой генерации (32-bit).
inputs.frameImagesreq
array of strings or objects
min: 1
—
Портрет аватара. Каждый item — либо строка, либо объект {image, frame}. Модель поддерживает только first-frame anchoring.
2 формата ввода
Format 1: string[]

Image input — URL / UUID / Data URI / Base64.

[
  "https://example.com/portrait.jpg"
]
Format 2: object[]
ПолеТипЗначенияОписание
imagereqstring—Image input (UUID / URL / Data URI / Base64).
frameenumfirst, 0Только first / 0.
[
  {
    "image": "https://example.com/portrait.jpg",
    "frame": "first"
  }
]
inputs.audio
string
—
—
Готовая аудио-дорожка с речью (UUID / URL). Взаимоисключаемо с speech.text — выбери ОДИН источник аудио.
1 пример
Примеры
https://example.com/voice.mp3
speech.text
string
min: 1 · max: 5000
—
Текст для синтеза речи (TTS). Используется вместо inputs.audio. Требует speech.voice.
1 пример
Примеры
Привет! Сегодня я расскажу вам про новейший AI-сервис.
speech.voice
enum
Zephyr (Female), Puck (Male), Charon (Male), Kore (Female), Fenrir (Male), Leda (Female), Orus (Male), Aoede (Female), Callirrhoe (Female), Autonoe (Female), Enceladus (Male), Iapetus (Male), Umbriel (Male), Algenib (Male), Despina (Female), Erinome (Female), Laomedeia (Female), Achernar (Female), Algieba (Male), Schedar (Male), Gacrux (Female), Pulcherrima (Female), Achird (Male), Zubenelgenubi (Male), Vindemiatrix (Female), Sadachbia (Male), Sadaltager (Male), Sulafat (Female), Alnilam (Male), Rasalgethi (Male)
Zephyr (Female)
Голос для TTS. 30 предустановленных голосов (15 женских / 15 мужских).
speech.language
enum
en, en-US, en-GB, es, es-ES, fr, fr-FR, de, de-DE, it, it-IT, pt-BR, ja, ja-JP, ko, ko-KR, hi, hi-IN
en-US
Язык речи. 18 поддерживаемых кодов / локалей.
settings.promptUpsampling
boolean
—
false
Автоматическое расширение/улучшение prompt-а моделью.
settings.safetyFilter
boolean
—
true
Включить safety-фильтр на prompt / входные данные.
settings.voicePrompt
string
—
Say the following.
Инструкция стиля речи (тон, темп, эмоция). Управляет, как именно аватар будет произносить speech.text.
1 пример
Примеры
Speak in an enthusiastic, fast-paced narrator tone.
numberResults
integer
min: 1 · max: 4
1
Сколько вариаций сгенерировать (разные seeds). Каждая считается отдельно.
outputFormat
enum
MP4, WEBM, MOV
MP4
Контейнер для финального видео.
outputQuality
integer
min: 20 · max: 99
95
Качество компрессии (20–99). Выше — лучше визуально и больше размер файла.
safety.checkContent
boolean
—
false
Включить проверку контента на NSFW / запрещёнку. При true default-режим safety.mode становится fast.
safety.mode
enum
none, fast, full
none
Режим safety-сканера: none — выключен, fast — проверяет ключевые кадры, full — все кадры (медленнее).
webhookURL
string
—
—
URL для POST-уведомления при готовности задачи. При numberResults > 1 webhook триггерится на каждый результат отдельно.
1 пример
Примеры
https://yourapp.com/webhooks/runware
uploadEndpoint
string
—
—
Presigned URL (S3 / GCS / Azure / HTTP PUT) для автозагрузки готового видео. Сырое binary в body PUT-запроса.
1 пример
Примеры
https://bucket.s3.amazonaws.com/result.mp4?X-Amz-Signature=...

Параметры ответа

Что возвращает API. У медиа-моделей формат зависит от режима: sync — сразу результат, async — task_id для опроса через GET /v1/tasks/{id}. Эта модель работает только в async-режиме.

Async (HTTP 202)

HTTP 202. Видео-генерация всегда async — нет sync-режима.

ПолеТипЗначенияОписание
id
string
—
task_id для GET /v1/tasks/{id}.
object
string
video.task
status
enum
queued, processing, completed, failed
model
string
—
created
integer
—

Опрос статуса (GET /v1/tasks/{id})

GET /v1/tasks/{id} — опрос статуса.

ПолеТипЗначенияОписание
id
string
—
status
enum
queued, processing, completed, failed, canceled
modality
string
video
model
string
—
data
array
—
Каждый элемент:
  • url— string · CDN URL .mp4 / .webm / .mov.
error
string
—

Пример кода

prunaai-p-video-avatar_example.py
from openai import OpenAI

client = OpenAI(api_key="rk_live_...", base_url="https://api.ranvik.ru/v1")
resp = client.videos.generate(
    model= "prunaai-p-video-avatar",
    positivePrompt= "Пример промпта",
    resolution= "720p",
    seed= 1073741824,
    numberResults= 1,
    outputFormat= "MP4",
    outputQuality= 95,
    webhookURL= "https://example.com/...",
    uploadEndpoint= "value",
    inputs= {
        "frameImages": [],
        "audio": "Пример промпта"
    },
    speech= {
        "text": "Пример промпта",
        "voice": "Zephyr (Female)",
        "language": "en-US"
    },
    settings= {
        "promptUpsampling": False,
        "safetyFilter": True,
        "voicePrompt": "Say the following."
    },
    safety= {
        "checkContent": False,
        "mode": "none"
    },
)
print(resp)
Полная документация модели

Частые вопросы о P-Video-Avatar

P-Video-Avatar — модель Pruna для создания говорящего аватара: она оживляет портрет и синхронизирует речь по тексту или загруженной аудиозаписи.
Модель нужна для роликов с цифровым ведущим, презентаций и обучения: достаточно портрета и сценария либо аудио, чтобы получить видео с речью.
Подключить модель можно через Ranvik API: сервис предоставляет единый доступ к API, чтобы быстрее внедрить генерацию говорящих аватаров в продукт.
В России P-Video-Avatar удобно запускать через Ranvik API: сервис дает доступ к API без VPN, поэтому запросы и интеграция работают в привычном контуре.
Да, для работы с P-Video-Avatar через Ranvik API доступна оплата в российских рублях, что упрощает расчеты для команд и бизнеса в России.
Для генерации нужен портрет в JPG, JPEG, PNG или WEBP и текст либо аудио; доступны выбор голоса, языка, подсказки и разрешение 720p или 1080p.