Текстовая модель · openai

GPT-5.6

gpt-5.6

GPT-5.6 — текстовая модель от OpenAI, доступная через единый Ranvik API. Контекстное окно — 1.1M токенов. Максимум выходных токенов за один запрос — 128k. Поддерживаемые возможности: computer_use, file_search, function_calling, prompt_caching, reasoning, streaming, vision, web_search.

от 1 663 ₽ / 1M

GPT-5.6 — официальный alias OpenAI для GPT-5.6 Sol. Используйте этот id, если хотите следовать alias провайдера, или gpt-5.6-sol, если нужен явный стабильный id в каталоге Ranvik.

Технические характеристики

МодальностьТекстовая модель
Провайдерopenai
Контекст1 050 000 токенов
Max output128 000 токенов
СтатусАктивна
ID для запросовgpt-5.6

Возможности

Prompt caching— Повторно используемые префиксы (системный промпт, документы) кэшируются — цена в 5-10× ниже.

Зачем

Если ты отправляешь один и тот же системный промпт + документы на каждом запросе — модель повторно тратит compute на их обработку. Prompt caching сохраняет эти токены и заряжает 10× меньше при попадании.

Базовая формула экономии:

  • Cache write — обычно 1.25× цены input (5-минутный TTL) или 2× (1-часовой).
  • Cache hit — 0.1× цены input.
  • Окупается с 2-3 повторений того же префикса в течение TTL.

Что кэшируется

Префикс должен быть идентичным byte-в-byte: системный промпт, статические документы, фиксированные few-shot примеры. Динамическая часть (юзер-промпт, переменные) идёт ПОСЛЕ кэшированной.

Когда использовать

  • RAG: документы в context каждого запроса (кэшируй документы).
  • Агенты: длинная инструкция системы (кэшируй её).
  • Few-shot prompting: фиксированные примеры (кэшируй блок примеров).

Особенности у OpenAI

Автоматический — включается при ≥1024 токенов в начале запроса. Кэш живёт 5-10 минут (точное время не документировано). Хит виден в ответе как usage.prompt_tokens_details.cached_tokens. Цена кэшированного — cache_read ($0.125/1M для gpt-5, $0.50/1M для o3).

Streaming (SSE)— Получение ответа по мере генерации — токен за токеном через Server-Sent Events.

Как работает

Передай stream: true в теле запроса — сервер вернёт SSE-поток с заголовком content-type: text/event-stream. Каждый чанк — строка вида data: {...}\n\n. Конец потока — data: [DONE]\n\n.

curl -N https://api.ranvik.ru/v1/chat/completions \
  -H "Authorization: Bearer rk_live_..." \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-5",
    "messages": [{"role": "user", "content": "Привет"}],
    "stream": true,
    "stream_options": {"include_usage": true}
  }'

Каждый чанк содержит choices[0].delta — частичные данные. Последний чанк перед [DONE] (если включить stream_options.include_usage: true) содержит usage с реальным числом токенов — используй для биллинг-учёта на клиенте.

Когда использовать

  • Чат-интерфейсы, где важна перцептивная скорость отклика.
  • Длинные ответы (> 1000 токенов) — пользователь видит прогресс.
  • Streaming tool-calls — delta.tool_calls[i].function.arguments приходят инкрементально.

Когда НЕ использовать

  • Backend-to-backend интеграции, где нужен только финальный JSON — добавляет парсинг SSE без выгод.
  • Когда обязательно знать стоимость до отправки в БД — без include_usage затраты неизвестны.

Особенности у OpenAI

Стандарт. include_usage: true обязателен для получения final usage в последнем чанке.

Vision (анализ изображений)— Картинки на вход вместе с текстом — OCR, распознавание объектов, описание сцен, анализ графиков.

Как передать изображение

Через массив content в сообщении вместо строки. Поддерживается URL и base64 (data URI).

{
  "model": "gpt-5",
  "messages": [{
    "role": "user",
    "content": [
      {"type": "text", "text": "Что на этой схеме?"},
      {"type": "image_url", "image_url": {"url": "https://.../diagram.png"}}
    ]
  }]
}

Для base64: "url": "data:image/png;base64,iVBOR...". Размер ограничен ~20MB.

Биллинг изображений

Картинка считается как input-токены — точное число зависит от размера и detail. Грубо: 512×512 ≈ 250 токенов, 2048×2048 ≈ 1500. Минимизируй размер если нужно много кадров.

Что НЕ умеют vision-модели

  • Точные измерения (расстояния, размеры в пикселях).
  • Распознавание текста на сложных шрифтах при низком DPI — лучше OCR-модель.
  • Деанонимизация лиц / людей — модели отказываются.

Особенности у OpenAI

Параметр detail: "low" | "high" | "auto". low фиксирует обработку под 85 токенов (грубее, дешевле); high — сетка 512×512 кропов до 1500+ токенов. Default auto решает по размеру.

  • Computer Use
  • File Search
  • Function Calling
  • Prompt Caching
  • Reasoning
  • Streaming
  • Vision
  • Веб-поиск

Цены

ЕдиницаЦена
за 1М cache read · <= 272k166 ₽
за 1М cache read · > 272k333 ₽
за 1М input · <= 272k1 663 ₽
за 1М cache write · <= 272k2 078 ₽
за 1М input · > 272k3 325 ₽
за 1М cache write · > 272k4 156 ₽
за 1М output · <= 272k9 975 ₽
за 1М output · > 272k14 963 ₽

Цены указаны в рублях. Списываются с баланса проекта при каждом успешном запросе.

Поддерживаемые параметры

Параметры передаются вендору как есть (pure proxy) — мы не валидируем их у себя на стороне. Если вендор не примет — вернётся его ошибка.

ПараметрТипДиапазон / valuesDefaultОписание
messagesrequiredarray Массив сообщений диалога в OpenAI-формате. Поле content может быть строкой или мультимодальным массивом с текстом и изображениями.
max_completion_tokensintegermin: 1 · max: 1280008192 Максимум токенов в ответе, включая токены рассуждения.
reasoning_effortenumnone, low, medium, high, xhigh, maxmedium Глубина рассуждения модели: от none для быстрых ответов до max для самых сложных задач.
verbosityenumlow, medium, highmedium Контроль подробности ответа.
temperaturenumbermin: 0 · max: 21 Креативность ответа: 0 — строже, 2 — разнообразнее.
top_pnumbermin: 0 · max: 11 Сэмплирование по ядру вероятности. Обычно используйте либо top_p, либо temperature.
stoparray of strings Стоп-последовательности, на которых генерация должна остановиться.
nintegermin: 1 · max: 1281 Сколько вариантов ответа сгенерировать.
frequency_penaltynumbermin: -2 · max: 20 Штраф за повторение токенов.
presence_penaltynumbermin: -2 · max: 20 Штраф за повторение уже затронутых тем.
response_formatobject Структурированный вывод: {type:"json_object"} или {type:"json_schema", json_schema:{...}}.
toolsarray Определения функций и инструментов в OpenAI-формате.
tool_choiceobject auto | none | required | {type:"function", function:{name:"..."}}.
parallel_tool_callsbooleantrue Разрешить параллельные вызовы инструментов.
web_search_optionsobject Настройки встроенного web search: search_context_size и user_location.
seedinteger Сид для воспроизводимости, если модель и endpoint его поддерживают.
streambooleanfalse SSE-стриминг ответа.
service_tierenumauto, default, flex, scale, priorityauto Уровень обработки OpenAI, если доступен для аккаунта.
storebooleanfalse Сохранять ответ у провайдера для evals/distillation, если включено.
metadataobject Метаданные запроса для трекинга.
prompt_cache_keystring Ключ для повышения вероятности попадания в кэш на похожих промптах.
safety_identifierstringmax: 64 Стабильный идентификатор пользователя для сигналов безопасности.

Пример запроса

from openai import OpenAI

client = OpenAI(api_key="rk_live_...", base_url="https://api.ranvik.ru/v1")
resp = client.chat.completions.create(
    model="gpt-5.6",
    messages=[{"role": "user", "content": "Привет!"}],
)
print(resp.choices[0].message.content)

# ── С веб-поиском ──
resp = client.responses.create(
    model="gpt-5.6",
    input="Что нового в AI сегодня?",
    tools=[{"type": "web_search"}],
)
print(resp.output_text)

# Генерация файла: client.responses.create(model="gpt-5.6", input="...", tools=[{"type":"code_interpreter"}])

Замените rk_live_... на ваш ключ из кабинета.

О провайдере: OpenAI

OpenAI — американская компания, создатель ChatGPT и серии моделей GPT. Один из лидеров индустрии генеративного ИИ. Модели OpenAI отличаются балансом скорости, качества и широкой поддержкой инструментов (function calling, vision, structured output).

Официальный сайт: https://openai.com

Документация модели у вендора: https://developers.openai.com/api/docs/models