GPT-5.6 Sol
gpt-5.6-sol
GPT-5.6 Sol — текстовая модель от OpenAI, доступная через единый Ranvik API. Контекстное окно — 1.1M токенов. Максимум выходных токенов за один запрос — 128k. Поддерживаемые возможности: computer_use, file_search, function_calling, prompt_caching, reasoning, streaming, vision, web_search.
от 1 663 ₽ / 1M
GPT-5.6 Sol — флагманская модель OpenAI для сложных задач: рассуждение, программирование, ревью кода, агентные сценарии, анализ больших документов и мультимодальные запросы с изображениями. Контекст — до 1.05M токенов, максимальный ответ — до 128K токенов.
Технические характеристики
gpt-5.6-solВозможности
Prompt caching— Повторно используемые префиксы (системный промпт, документы) кэшируются — цена в 5-10× ниже.
Зачем
Если ты отправляешь один и тот же системный промпт + документы на каждом запросе — модель повторно тратит compute на их обработку. Prompt caching сохраняет эти токены и заряжает 10× меньше при попадании.
Базовая формула экономии:
- Cache write — обычно 1.25× цены input (5-минутный TTL) или 2× (1-часовой).
- Cache hit — 0.1× цены input.
- Окупается с 2-3 повторений того же префикса в течение TTL.
Что кэшируется
Префикс должен быть идентичным byte-в-byte: системный промпт, статические документы, фиксированные few-shot примеры. Динамическая часть (юзер-промпт, переменные) идёт ПОСЛЕ кэшированной.
Когда использовать
- RAG: документы в context каждого запроса (кэшируй документы).
- Агенты: длинная инструкция системы (кэшируй её).
- Few-shot prompting: фиксированные примеры (кэшируй блок примеров).
Особенности у OpenAI
Автоматический — включается при ≥1024 токенов в начале запроса.
Кэш живёт 5-10 минут (точное время не документировано). Хит виден в ответе как
usage.prompt_tokens_details.cached_tokens. Цена кэшированного — cache_read
($0.125/1M для gpt-5, $0.50/1M для o3).
Streaming (SSE)— Получение ответа по мере генерации — токен за токеном через Server-Sent Events.
Как работает
Передай stream: true в теле запроса — сервер вернёт SSE-поток с заголовком
content-type: text/event-stream. Каждый чанк — строка вида data: {...}\n\n.
Конец потока — data: [DONE]\n\n.
curl -N https://api.ranvik.ru/v1/chat/completions \
-H "Authorization: Bearer rk_live_..." \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-5",
"messages": [{"role": "user", "content": "Привет"}],
"stream": true,
"stream_options": {"include_usage": true}
}'
Каждый чанк содержит choices[0].delta — частичные данные. Последний чанк перед
[DONE] (если включить stream_options.include_usage: true) содержит usage
с реальным числом токенов — используй для биллинг-учёта на клиенте.
Когда использовать
- Чат-интерфейсы, где важна перцептивная скорость отклика.
- Длинные ответы (> 1000 токенов) — пользователь видит прогресс.
- Streaming tool-calls —
delta.tool_calls[i].function.argumentsприходят инкрементально.
Когда НЕ использовать
- Backend-to-backend интеграции, где нужен только финальный JSON — добавляет парсинг SSE без выгод.
- Когда обязательно знать стоимость до отправки в БД — без
include_usageзатраты неизвестны.
Особенности у OpenAI
Стандарт. include_usage: true обязателен для получения final usage в
последнем чанке.
Vision (анализ изображений)— Картинки на вход вместе с текстом — OCR, распознавание объектов, описание сцен, анализ графиков.
Как передать изображение
Через массив content в сообщении вместо строки. Поддерживается URL и base64
(data URI).
{
"model": "gpt-5",
"messages": [{
"role": "user",
"content": [
{"type": "text", "text": "Что на этой схеме?"},
{"type": "image_url", "image_url": {"url": "https://.../diagram.png"}}
]
}]
}
Для base64: "url": "data:image/png;base64,iVBOR...". Размер ограничен ~20MB.
Биллинг изображений
Картинка считается как input-токены — точное число зависит от размера и
detail. Грубо: 512×512 ≈ 250 токенов, 2048×2048 ≈ 1500. Минимизируй размер
если нужно много кадров.
Что НЕ умеют vision-модели
- Точные измерения (расстояния, размеры в пикселях).
- Распознавание текста на сложных шрифтах при низком DPI — лучше OCR-модель.
- Деанонимизация лиц / людей — модели отказываются.
Особенности у OpenAI
Параметр detail: "low" | "high" | "auto". low фиксирует обработку под
85 токенов (грубее, дешевле); high — сетка 512×512 кропов до 1500+ токенов.
Default auto решает по размеру.
- Computer Use
- File Search
- Function Calling
- Prompt Caching
- Reasoning
- Streaming
- Vision
- Веб-поиск
Цены
| Единица | Цена |
|---|---|
| за 1М cache read · <= 272k | 166 ₽ |
| за 1М cache read · > 272k | 333 ₽ |
| за 1М input · <= 272k | 1 663 ₽ |
| за 1М cache write · <= 272k | 2 078 ₽ |
| за 1М input · > 272k | 3 325 ₽ |
| за 1М cache write · > 272k | 4 156 ₽ |
| за 1М output · <= 272k | 9 975 ₽ |
| за 1М output · > 272k | 14 963 ₽ |
Цены указаны в рублях. Списываются с баланса проекта при каждом успешном запросе.
Поддерживаемые параметры
Параметры передаются вендору как есть (pure proxy) — мы не валидируем их у себя на стороне. Если вендор не примет — вернётся его ошибка.
| Параметр | Тип | Диапазон / values | Default | Описание |
|---|---|---|---|---|
messagesrequired | array | — | — | Массив сообщений диалога в OpenAI-формате. Поле content может быть строкой или мультимодальным массивом с текстом и изображениями. |
max_completion_tokens | integer | min: 1 · max: 128000 | 8192 | Максимум токенов в ответе, включая токены рассуждения. |
reasoning_effort | enum | none, low, medium, high, xhigh, max | medium | Глубина рассуждения модели: от none для быстрых ответов до max для самых сложных задач. |
verbosity | enum | low, medium, high | medium | Контроль подробности ответа. |
temperature | number | min: 0 · max: 2 | 1 | Креативность ответа: 0 — строже, 2 — разнообразнее. |
top_p | number | min: 0 · max: 1 | 1 | Сэмплирование по ядру вероятности. Обычно используйте либо top_p, либо temperature. |
stop | array of strings | — | — | Стоп-последовательности, на которых генерация должна остановиться. |
n | integer | min: 1 · max: 128 | 1 | Сколько вариантов ответа сгенерировать. |
frequency_penalty | number | min: -2 · max: 2 | 0 | Штраф за повторение токенов. |
presence_penalty | number | min: -2 · max: 2 | 0 | Штраф за повторение уже затронутых тем. |
response_format | object | — | — | Структурированный вывод: {type:"json_object"} или {type:"json_schema", json_schema:{...}}. |
tools | array | — | — | Определения функций и инструментов в OpenAI-формате. |
tool_choice | object | — | — | auto | none | required | {type:"function", function:{name:"..."}}. |
parallel_tool_calls | boolean | — | true | Разрешить параллельные вызовы инструментов. |
web_search_options | object | — | — | Настройки встроенного web search: search_context_size и user_location. |
seed | integer | — | — | Сид для воспроизводимости, если модель и endpoint его поддерживают. |
stream | boolean | — | false | SSE-стриминг ответа. |
service_tier | enum | auto, default, flex, scale, priority | auto | Уровень обработки OpenAI, если доступен для аккаунта. |
store | boolean | — | false | Сохранять ответ у провайдера для evals/distillation, если включено. |
metadata | object | — | — | Метаданные запроса для трекинга. |
prompt_cache_key | string | — | — | Ключ для повышения вероятности попадания в кэш на похожих промптах. |
safety_identifier | string | max: 64 | — | Стабильный идентификатор пользователя для сигналов безопасности. |
Пример запроса
from openai import OpenAI
client = OpenAI(api_key="rk_live_...", base_url="https://api.ranvik.ru/v1")
resp = client.chat.completions.create(
model="gpt-5.6-sol",
messages=[{"role": "user", "content": "Привет!"}],
)
print(resp.choices[0].message.content)
# ── С веб-поиском ──
resp = client.responses.create(
model="gpt-5.6-sol",
input="Что нового в AI сегодня?",
tools=[{"type": "web_search"}],
)
print(resp.output_text)
# Генерация файла: client.responses.create(model="gpt-5.6-sol", input="...", tools=[{"type":"code_interpreter"}]) Замените rk_live_... на ваш ключ из кабинета.
О провайдере: OpenAI
OpenAI — американская компания, создатель ChatGPT и серии моделей GPT. Один из лидеров индустрии генеративного ИИ. Модели OpenAI отличаются балансом скорости, качества и широкой поддержкой инструментов (function calling, vision, structured output).
Официальный сайт: https://openai.com
Документация модели у вендора: https://developers.openai.com/api/docs/models