OpenAI-compatible · 鑑權 · 串流

開發者文件

集中說明 Base URL、鑑權、OpenAI-compatible formats、串流輸出、錯誤碼和限流。已有 API Key 時可以直接按範例接入。

快速開始

確認端點、設定金鑰、接入用戶端,然後發起第一個請求。

選擇接入端點

根據你的用戶端類型選擇合適的 API 端點。支援 OpenAI-compatible、Responses-compatible 和 Messages-compatible 介面。

Base URL: https://api.llm-token.cn/v1

準備 API Key

使用已經開通的 API Key,並只放在伺服器端環境變數中,避免暴露到瀏覽器程式碼。

Authorization: Bearer sk-your-api-key

整合用戶端

使用相容用戶端或直接呼叫 REST API,設定 base_url 後即可快速接入。

client = OpenAI(base_url='https://api.llm-token.cn/v1')

開始呼叫

傳送請求取得 AI 回應,支援串流輸出以獲得更好的使用者體驗。

POST /v1/chat/completions

身分驗證

所有 API 請求都需要在 HTTP Header 中攜帶 API Key 進行身分驗證。

驗證格式

在每個請求的 Authorization header 中加入你的 API Key。

POST/v1/chat/completions

帶驗證的請求範例

請求範例
json
curl https://api.llm-token.cn/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer sk-your-api-key" \
  -d '{
    "model": "gpt-4o-mini",
    "messages": [{"role": "user", "content": "Hello!"}]
  }'
回應範例
json
{
  "id": "chatcmpl_123",
  "object": "chat.completion",
  "choices": [{
    "message": {
      "role": "assistant",
      "content": "Hello! How can I help you today?"
    }
  }]
}
推薦 Base URL
https://api.llm-token.cn/v1大部分用戶端使用此網址
備用 Base URL
https://gpt-agent.cc用戶端驗證失敗時使用
OpenAI-compatible 介面
/v1/chat/completions相容 Chat Completions
Responses 相容介面
/v1/responses支援 Responses 格式的用戶端優先使用
Messages 相容介面
/v1/messagesMessages-compatible 用戶端優先使用

聊天補全 API

OpenAI-compatible Chat Completions endpoint for multiple model ecosystems.

python
from openai import OpenAI

# 初始化客户端
client = OpenAI(
    api_key="sk-your-api-key",
    base_url="https://api.llm-token.cn/v1"
)

# 发送聊天请求
response = client.chat.completions.create(
    model="gpt-4o-mini",
    messages=[
        {"role": "system", "content": "你是一个简洁的助手。"},
        {"role": "user", "content": "用一句话介绍你自己。"}
    ]
)

print(response.choices[0].message.content)

請求參數

參數類型必填說明
modelstring模型 ID,例如 gpt-4o-mini
messagesarray聊天訊息陣列
temperaturenumber取樣溫度,0-2,預設 1
max_tokensinteger產生 token 上限
streamboolean是否啟用串流輸出
top_pnumber核取樣,預設 1

回應欄位

欄位類型說明
idstring回應唯一標識
objectstring物件類型,固定為 chat.completion
createdinteger建立時間戳記
modelstring使用的模型 ID
choicesarray產生的回覆選項
usageobjecttoken 使用統計

串流輸出

啟用串流輸出可以即時接收生成的 token,顯著降低使用者感知延遲。

串流輸出的優勢
  • 降低感知延遲 - 使用者無需等待完整回應,可以立即看到內容
  • 更好的長文本體驗 - 內容像真人打字一樣逐步顯示
  • 成本相同 - 與同步輸出成本完全一致,只是傳輸方式不同
python
from openai import OpenAI

client = OpenAI(
    api_key="sk-your-api-key",
    base_url="https://api.llm-token.cn/v1"
)

# 启用流式输出
stream = client.chat.completions.create(
    model="gpt-4o-mini",
    messages=[
        {"role": "system", "content": "你是一个简洁的助手。"},
        {"role": "user", "content": "用一句话介绍你自己。"}
    ],
    stream=True
)

# 实时打印每个 token
for chunk in stream:
    if chunk.choices[0].delta.content is not None:
        print(chunk.choices[0].delta.content, end="")

print()  # 换行

錯誤碼

API 可能回傳的錯誤碼及其處理建議。

HTTP 狀態碼錯誤名稱說明處理建議
400INVALID_REQUEST請求格式錯誤或參數無效檢查請求體格式和參數
401UNAUTHORIZEDAPI Key 無效或已過期檢查 API Key 是否正確
429RATE_LIMIT請求頻率超限使用指數退避策略重試
500INTERNAL_ERROR服務內部錯誤稍後重試
503SERVICE_UNAVAILABLE服務暫時不可用稍後重試

限流說明

為了確保服務穩定性,我們對 API 請求進行頻率限制。

限流規則
  • 每個 API Key 有獨立的請求頻率限制
  • 收到 429 回應時請使用指數退避策略重試
  • 串流和非串流請求共享相同的限流配額
  • 實際上限以目前 Key 的設定為準

如有問題,請聯絡客服或查看 FAQ 頁面