Загрузка...

Режимы обработки flex и priority (service tiers)

Режим обработки (service tier) — это приоритет, с которым провайдер модели выполняет ваш запрос. Модель и качество ответов одинаковые, различаются цена и скорость: flex выполняет запрос примерно вдвое дешевле, но медленнее и без гарантий по мощностям, priorityбыстрее, но дороже. Режим задаётся параметром service_tier в теле запроса; без него действует стандартный режим (default).

Чем отличаются режимы

  default (без параметра) flex priority
Цена за токены стандартная обычно −50% выше стандартной
Скорость ответа обычная ниже; в пиковые часы задержка растёт максимальная, приоритетная очередь
Если мощностей нет резервные провайдеры (fallbacks) ошибка, средства не списываются автоматический переход на default
Для чего повседневные задачи фоновые и массовые задачи продукты реального времени

Качество не меняется: во всех режимах отвечает одна и та же модель. Режим влияет только на приоритет обработки у провайдера и на цену токенов.

Как включить: параметр service_tier

Передайте service_tier верхним полем в теле запроса:

from openai import OpenAI

client = OpenAI(
    api_key="ROUTERAI_API_KEY",
    base_url="https://routerai.ru/api/v1"
)

response = client.chat.completions.create(
    model="openai/gpt-5.6-terra",
    messages=[{"role": "user", "content": "Привет!"}],
    service_tier="flex"  # или "priority"
)

Параметр работает во всех совместимых форматах API: Chat Completions, Responses и Messages (Anthropic-совместимом).

Режим задаётся на каждый запрос, а не на ключ или аккаунт: одно приложение может отправлять фоновые задачи во flex, а пользовательские — в priority.

Режим для конкретного провайдера: суффиксы /flex и /priority

Если вы управляете порядком провайдеров через provider.order или provider.only, режим можно указать прямо в идентификаторе провайдера — суффиксом. Это удобно, когда режим нужен только у одного из провайдеров в списке:

{
  "model": "openai/gpt-5.6-terra",
  "messages": [{ "role": "user", "content": "Привет!" }],
  "provider": {
    "order": ["openai/priority"]
  }
}

Какие провайдеры поддерживают flex и priority

Провайдер flex priority
OpenAI
Google Vertex AI
Google AI Studio
xAI

Режимы доступны для отдельных моделей этих провайдеров. Если выбранная модель не поддерживает запрошенный режим, запрос обслуживается в стандартном режиме по обычной цене.

Если режим недоступен: маршрутизация и тарификация

Два режима ведут себя по-разному, когда нужных мощностей нет:

  • priority деградирует мягко. Если выполнить запрос с приоритетом невозможно, он автоматически выполнится в стандартном режиме — без ошибки и без доплаты: спишется стандартная цена.
  • flex работает строго. Маршрутизация ограничивается только flex-совместимыми провайдерами. Если ни один сейчас не доступен, вернётся ошибка, средства не спишутся. Повторите запрос позже или отправьте его без service_tier.

Списание всегда идёт по фактически использованному режиму. Заплатить priority-цену за стандартную обработку невозможно; в каком режиме запрос был обслужен на самом деле — видно в ответе.

Как узнать фактический режим запроса

Режим, в котором была обслужена генерация, возвращается в ответе в поле service_tier:

  • Chat Completions и Responses — верхнеуровневое поле ответа.
  • Messages (Anthropic-совместимый) — внутри объекта usage.

Возможные значения: default, flex, priority либо null, если провайдер не сообщает режим.

{
  "id": "rai-...",
  "model": "openai/gpt-5.6-terra",
  "service_tier": "flex",
  "choices": [ ... ],
  "usage": { "prompt_tokens": 12, "completion_tokens": 34, "total_tokens": 46 }
}

Если для вас важен контроль фактических расходов, логируйте это поле: по нему видно, какая часть priority-запросов реально выполнилась с приоритетом.