Режимы обработки flex и priority (service tiers)
Режим обработки (service tier) — это приоритет, с которым провайдер модели выполняет ваш запрос. Модель и качество ответов одинаковые, различаются цена и скорость:
flexвыполняет запрос примерно вдвое дешевле, но медленнее и без гарантий по мощностям,priority— быстрее, но дороже. Режим задаётся параметромservice_tierв теле запроса; без него действует стандартный режим (default).
Чем отличаются режимы
default (без параметра) |
flex |
priority |
|
|---|---|---|---|
| Цена за токены | стандартная | обычно −50% | выше стандартной |
| Скорость ответа | обычная | ниже; в пиковые часы задержка растёт | максимальная, приоритетная очередь |
| Если мощностей нет | резервные провайдеры (fallbacks) | ошибка, средства не списываются | автоматический переход на default |
| Для чего | повседневные задачи | фоновые и массовые задачи | продукты реального времени |
Качество не меняется: во всех режимах отвечает одна и та же модель. Режим влияет только на приоритет обработки у провайдера и на цену токенов.
Как включить: параметр service_tier
Передайте service_tier верхним полем в теле запроса:
from openai import OpenAI
client = OpenAI(
api_key="ROUTERAI_API_KEY",
base_url="https://routerai.ru/api/v1"
)
response = client.chat.completions.create(
model="openai/gpt-5.6-terra",
messages=[{"role": "user", "content": "Привет!"}],
service_tier="flex" # или "priority"
)
Параметр работает во всех совместимых форматах API: Chat Completions, Responses и Messages (Anthropic-совместимом).
Режим задаётся на каждый запрос, а не на ключ или аккаунт: одно приложение может отправлять фоновые задачи во flex, а пользовательские — в priority.
Режим для конкретного провайдера: суффиксы /flex и /priority
Если вы управляете порядком провайдеров через provider.order или provider.only, режим можно указать прямо в идентификаторе провайдера — суффиксом. Это удобно, когда режим нужен только у одного из провайдеров в списке:
{
"model": "openai/gpt-5.6-terra",
"messages": [{ "role": "user", "content": "Привет!" }],
"provider": {
"order": ["openai/priority"]
}
}
Какие провайдеры поддерживают flex и priority
| Провайдер | flex |
priority |
|---|---|---|
| OpenAI | ✅ | ✅ |
| Google Vertex AI | ✅ | ✅ |
| Google AI Studio | ✅ | ✅ |
| xAI | — | ✅ |
Режимы доступны для отдельных моделей этих провайдеров. Если выбранная модель не поддерживает запрошенный режим, запрос обслуживается в стандартном режиме по обычной цене.
Если режим недоступен: маршрутизация и тарификация
Два режима ведут себя по-разному, когда нужных мощностей нет:
priorityдеградирует мягко. Если выполнить запрос с приоритетом невозможно, он автоматически выполнится в стандартном режиме — без ошибки и без доплаты: спишется стандартная цена.flexработает строго. Маршрутизация ограничивается только flex-совместимыми провайдерами. Если ни один сейчас не доступен, вернётся ошибка, средства не спишутся. Повторите запрос позже или отправьте его безservice_tier.
Списание всегда идёт по фактически использованному режиму. Заплатить priority-цену за стандартную обработку невозможно; в каком режиме запрос был обслужен на самом деле — видно в ответе.
Как узнать фактический режим запроса
Режим, в котором была обслужена генерация, возвращается в ответе в поле service_tier:
- Chat Completions и Responses — верхнеуровневое поле ответа.
- Messages (Anthropic-совместимый) — внутри объекта
usage.
Возможные значения: default, flex, priority либо null, если провайдер не сообщает режим.
{
"id": "rai-...",
"model": "openai/gpt-5.6-terra",
"service_tier": "flex",
"choices": [ ... ],
"usage": { "prompt_tokens": 12, "completion_tokens": 34, "total_tokens": 46 }
}
Если для вас важен контроль фактических расходов, логируйте это поле: по нему видно, какая часть priority-запросов реально выполнилась с приоритетом.