快速開始
確認端點、設定金鑰、接入用戶端,然後發起第一個請求。
選擇接入端點
根據你的用戶端類型選擇合適的 API 端點。支援 OpenAI-compatible、Responses-compatible 和 Messages-compatible 介面。
Base URL: https://api.llm-token.cn/v1準備 API Key
使用已經開通的 API Key,並只放在伺服器端環境變數中,避免暴露到瀏覽器程式碼。
Authorization: Bearer sk-your-api-key整合用戶端
使用相容用戶端或直接呼叫 REST API,設定 base_url 後即可快速接入。
client = OpenAI(base_url='https://api.llm-token.cn/v1')開始呼叫
傳送請求取得 AI 回應,支援串流輸出以獲得更好的使用者體驗。
POST /v1/chat/completions身分驗證
所有 API 請求都需要在 HTTP Header 中攜帶 API Key 進行身分驗證。
驗證格式
在每個請求的 Authorization header 中加入你的 API Key。
POST
/v1/chat/completions帶驗證的請求範例
請求範例
json
curl https://api.llm-token.cn/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer sk-your-api-key" \
-d '{
"model": "gpt-4o-mini",
"messages": [{"role": "user", "content": "Hello!"}]
}'回應範例
json
{
"id": "chatcmpl_123",
"object": "chat.completion",
"choices": [{
"message": {
"role": "assistant",
"content": "Hello! How can I help you today?"
}
}]
}推薦 Base URL
https://api.llm-token.cn/v1大部分用戶端使用此網址備用 Base URL
https://gpt-agent.cc用戶端驗證失敗時使用OpenAI-compatible 介面
/v1/chat/completions相容 Chat CompletionsResponses 相容介面
/v1/responses支援 Responses 格式的用戶端優先使用Messages 相容介面
/v1/messagesMessages-compatible 用戶端優先使用聊天補全 API
OpenAI-compatible Chat Completions endpoint for multiple model ecosystems.
python
from openai import OpenAI
# 初始化客户端
client = OpenAI(
api_key="sk-your-api-key",
base_url="https://api.llm-token.cn/v1"
)
# 发送聊天请求
response = client.chat.completions.create(
model="gpt-4o-mini",
messages=[
{"role": "system", "content": "你是一个简洁的助手。"},
{"role": "user", "content": "用一句话介绍你自己。"}
]
)
print(response.choices[0].message.content)請求參數
| 參數 | 類型 | 必填 | 說明 |
|---|---|---|---|
model | string | 是 | 模型 ID,例如 gpt-4o-mini |
messages | array | 是 | 聊天訊息陣列 |
temperature | number | 否 | 取樣溫度,0-2,預設 1 |
max_tokens | integer | 否 | 產生 token 上限 |
stream | boolean | 否 | 是否啟用串流輸出 |
top_p | number | 否 | 核取樣,預設 1 |
回應欄位
| 欄位 | 類型 | 說明 |
|---|---|---|
id | string | 回應唯一標識 |
object | string | 物件類型,固定為 chat.completion |
created | integer | 建立時間戳記 |
model | string | 使用的模型 ID |
choices | array | 產生的回覆選項 |
usage | object | token 使用統計 |
串流輸出
啟用串流輸出可以即時接收生成的 token,顯著降低使用者感知延遲。
串流輸出的優勢
- 降低感知延遲 - 使用者無需等待完整回應,可以立即看到內容
- 更好的長文本體驗 - 內容像真人打字一樣逐步顯示
- 成本相同 - 與同步輸出成本完全一致,只是傳輸方式不同
python
from openai import OpenAI
client = OpenAI(
api_key="sk-your-api-key",
base_url="https://api.llm-token.cn/v1"
)
# 启用流式输出
stream = client.chat.completions.create(
model="gpt-4o-mini",
messages=[
{"role": "system", "content": "你是一个简洁的助手。"},
{"role": "user", "content": "用一句话介绍你自己。"}
],
stream=True
)
# 实时打印每个 token
for chunk in stream:
if chunk.choices[0].delta.content is not None:
print(chunk.choices[0].delta.content, end="")
print() # 换行錯誤碼
API 可能回傳的錯誤碼及其處理建議。
| HTTP 狀態碼 | 錯誤名稱 | 說明 | 處理建議 |
|---|---|---|---|
400 | INVALID_REQUEST | 請求格式錯誤或參數無效 | 檢查請求體格式和參數 |
401 | UNAUTHORIZED | API Key 無效或已過期 | 檢查 API Key 是否正確 |
429 | RATE_LIMIT | 請求頻率超限 | 使用指數退避策略重試 |
500 | INTERNAL_ERROR | 服務內部錯誤 | 稍後重試 |
503 | SERVICE_UNAVAILABLE | 服務暫時不可用 | 稍後重試 |
限流說明
為了確保服務穩定性,我們對 API 請求進行頻率限制。
限流規則
- 每個 API Key 有獨立的請求頻率限制
- 收到 429 回應時請使用指數退避策略重試
- 串流和非串流請求共享相同的限流配額
- 實際上限以目前 Key 的設定為準