Your privacy choices

Allow optional cookies for referral attribution, visit analytics, and Google Ads purchase measurement.

Совместимые эндпоинты · Аутентификация · Стриминг

Документация для разработчиков

Справочная документация по совместимым эндпоинтам, аутентификации, формату запросов, потоковым ответам и обработке ошибок.

Быстрый старт

Укажите эндпоинт, настройте ключ, подключите клиент и отправьте первый запрос.

Выберите эндпоинт

Выберите формат эндпоинта, который ожидает ваш клиент. Доступны маршруты, совместимые с Chat Completions, Responses и Messages.

Base URL: https://api.llm-token.cn/v1

Подготовьте API-ключ

Используйте активный API-ключ из серверного окружения. Не раскрывайте ключи в коде на стороне браузера.

Authorization: Bearer sk-your-api-key

Интегрируйте клиент

Используйте совместимый SDK или вызывайте REST API напрямую с собственным base_url.

client = OpenAI(base_url='https://api.llm-token.cn/v1')

Начните вызовы

Отправляйте запросы и получайте ответы ИИ. Потоковая передача поддерживается для более быстрого отклика.

POST /v1/chat/completions

Аутентификация

Каждый API-запрос должен содержать ваш API-ключ в HTTP-заголовке Authorization.

Формат аутентификации

Добавляйте свой API-ключ в заголовок Authorization в каждом запросе.

POST/v1/chat/completions

Пример запроса с аутентификацией

Пример запроса
json
curl https://api.llm-token.cn/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer sk-your-api-key" \
  -d '{
    "model": "gpt-4o-mini",
    "messages": [{"role": "user", "content": "Hello!"}]
  }'
Пример ответа
json
{
  "id": "chatcmpl_123",
  "object": "chat.completion",
  "choices": [{
    "message": {
      "role": "assistant",
      "content": "Hello! How can I help you today?"
    }
  }]
}
Рекомендуемый Base URL
https://api.llm-token.cn/v1Используйте для большинства клиентов
Резервный Base URL
https://gpt-agent.ccИспользуйте, только если клиент отклоняет /v1 при проверке
Эндпоинт, совместимый с Chat Completions
/v1/chat/completionsДля клиентов, ожидающих Chat Completions
Эндпоинт, совместимый с Responses
/v1/responsesВ первую очередь для клиентов, поддерживающих Responses
Эндпоинт, совместимый с Messages
/v1/messagesВ первую очередь для Messages-совместимых клиентов

Chat Completions API

Совместимый с OpenAI эндпоинт Chat Completions для разных экосистем моделей.

python
from openai import OpenAI

# Initialize the client
client = OpenAI(
    api_key="sk-your-api-key",
    base_url="https://api.llm-token.cn/v1"
)

# Send a chat request
response = client.chat.completions.create(
    model="gpt-4o-mini",
    messages=[
        {"role": "system", "content": "You are a concise assistant."},
        {"role": "user", "content": "Introduce yourself in one sentence."}
    ]
)

print(response.choices[0].message.content)

Параметры запроса

ПараметрТипОбязательныйОписание
modelstringДаID модели, например gpt-4o-mini
messagesarrayДаМассив сообщений чата
temperaturenumberНетТемпература сэмплирования от 0 до 2, по умолчанию 1
max_tokensintegerНетМаксимальное количество генерируемых токенов
streambooleanНетВключать ли потоковый вывод
top_pnumberНетЗначение nucleus-сэмплирования, по умолчанию 1

Поля ответа

ПолеТипОписание
idstringУникальный идентификатор ответа
objectstringТип объекта, обычно chat.completion
createdintegerМетка времени создания
modelstringID модели, использованной для ответа
choicesarrayСгенерированные варианты ответа
usageobjectСтатистика использования токенов

Стриминг

Включите стриминг, чтобы получать сгенерированные токены в реальном времени и снизить ощущаемую задержку.

Преимущества стриминга
  • Меньше ощущаемая задержка - Пользователь сразу видит вывод, не дожидаясь полного ответа.
  • Удобнее для длинных ответов - Длинные ответы появляются постепенно, как при живом наборе текста.
  • Та же стоимость - Стриминг тарифицируется так же, как синхронный вывод; меняется только способ передачи.
python
from openai import OpenAI

client = OpenAI(
    api_key="sk-your-api-key",
    base_url="https://api.llm-token.cn/v1"
)

# Enable streaming
stream = client.chat.completions.create(
    model="gpt-4o-mini",
    messages=[
        {"role": "system", "content": "You are a concise assistant."},
        {"role": "user", "content": "Introduce yourself in one sentence."}
    ],
    stream=True
)

# Print each streamed token as it arrives
for chunk in stream:
    if chunk.choices[0].delta.content is not None:
        print(chunk.choices[0].delta.content, end="")

print()  # New line

Ошибки

Типичные ошибки API и рекомендуемые действия по их обработке.

HTTP-статусНазвание ошибкиОписаниеРекомендуемое действие
400INVALID_REQUESTНекорректное тело запроса или неверные параметрыПроверьте тело запроса и параметры
401UNAUTHORIZEDAPI-ключ недействителен или истёкПроверьте правильность API-ключа
429RATE_LIMITПревышен лимит частоты запросовПовторите с экспоненциальной задержкой
500INTERNAL_ERRORВнутренняя ошибка сервисаПовторите позже
503SERVICE_UNAVAILABLEСервис временно недоступенПовторите позже

Ограничения частоты

Частота API-запросов ограничивается для стабильной работы сервиса.

Правила ограничения частоты
  • У каждого API-ключа свои ограничения на частоту запросов
  • При получении ответа 429 используйте экспоненциальную задержку для повторов
  • Потоковые и непотоковые запросы используют одну квоту ограничения частоты
  • Фактический лимит определяется текущей конфигурацией ключа

Есть вопросы? Свяжитесь с поддержкой или прочитайте FAQ.