Your privacy choices

Allow optional cookies for referral attribution, visit analytics, and Google Ads purchase measurement.

Endpoint tương thích · Xác thực · Streaming

Tài liệu cho nhà phát triển

Tài liệu tham khảo về các endpoint tương thích, xác thực, định dạng yêu cầu, phản hồi streaming và xử lý lỗi.

Bắt đầu nhanh

Thiết lập endpoint, cấu hình API Key, tích hợp client rồi gửi yêu cầu đầu tiên.

Chọn endpoint

Chọn định dạng endpoint mà client của bạn yêu cầu. Có sẵn các tuyến tương thích với Chat Completions, Responses và Messages.

Base URL: https://api.llm-token.cn/v1

Chuẩn bị API Key

Dùng API Key đang hoạt động từ môi trường máy chủ. Tránh để lộ key trong mã phía trình duyệt.

Authorization: Bearer sk-your-api-key

Tích hợp client

Dùng SDK tương thích hoặc gọi trực tiếp REST API với base_url tùy chỉnh.

client = OpenAI(base_url='https://api.llm-token.cn/v1')

Bắt đầu gọi

Gửi yêu cầu và nhận phản hồi AI. Hỗ trợ truyền phát để phản hồi nhanh hơn.

POST /v1/chat/completions

Xác thực

Mọi yêu cầu API đều phải kèm API Key của bạn trong HTTP header Authorization.

Định dạng xác thực

Thêm API Key của bạn vào header Authorization trong mỗi yêu cầu.

POST/v1/chat/completions

Ví dụ yêu cầu có xác thực

Ví dụ yêu cầu
json
curl https://api.llm-token.cn/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer sk-your-api-key" \
  -d '{
    "model": "gpt-4o-mini",
    "messages": [{"role": "user", "content": "Hello!"}]
  }'
Ví dụ phản hồi
json
{
  "id": "chatcmpl_123",
  "object": "chat.completion",
  "choices": [{
    "message": {
      "role": "assistant",
      "content": "Hello! How can I help you today?"
    }
  }]
}
Base URL khuyến nghị
https://api.llm-token.cn/v1Dùng cho hầu hết các client
Base URL dự phòng
https://gpt-agent.ccChỉ dùng nếu client từ chối /v1 khi xác thực
Endpoint tương thích Chat Completions
/v1/chat/completionsDành cho client yêu cầu Chat Completions
Endpoint tương thích Responses
/v1/responsesƯu tiên dùng cho client hỗ trợ Responses
Endpoint tương thích Messages
/v1/messagesƯu tiên dùng cho client tương thích Messages

Chat Completions API

Endpoint Chat Completions tương thích OpenAI cho nhiều hệ sinh thái mô hình.

python
from openai import OpenAI

# Initialize the client
client = OpenAI(
    api_key="sk-your-api-key",
    base_url="https://api.llm-token.cn/v1"
)

# Send a chat request
response = client.chat.completions.create(
    model="gpt-4o-mini",
    messages=[
        {"role": "system", "content": "You are a concise assistant."},
        {"role": "user", "content": "Introduce yourself in one sentence."}
    ]
)

print(response.choices[0].message.content)

Tham số yêu cầu

Tham sốKiểuBắt buộcMô tả
modelstringID mô hình, ví dụ gpt-4o-mini
messagesarrayMảng tin nhắn trò chuyện
temperaturenumberKhôngNhiệt độ lấy mẫu từ 0 đến 2, mặc định 1
max_tokensintegerKhôngSố token tối đa được tạo
streambooleanKhôngCó bật truyền phát hay không
top_pnumberKhôngGiá trị lấy mẫu nucleus, mặc định 1

Trường phản hồi

TrườngKiểuMô tả
idstringĐịnh danh duy nhất của phản hồi
objectstringLoại đối tượng, thường là chat.completion
createdintegerDấu thời gian tạo
modelstringID mô hình dùng cho phản hồi
choicesarrayCác lựa chọn phản hồi được tạo
usageobjectThống kê sử dụng token

Streaming

Bật streaming để nhận token được tạo theo thời gian thực và giảm độ trễ cảm nhận.

Lợi ích của streaming
  • Giảm độ trễ cảm nhận - Người dùng thấy nội dung ngay thay vì chờ phản hồi hoàn chỉnh.
  • Trải nghiệm văn bản dài tốt hơn - Câu trả lời dài hiện ra dần, giống như đang gõ trực tiếp.
  • Chi phí như nhau - Streaming tính phí giống đầu ra đồng bộ; chỉ khác cách truyền tải.
python
from openai import OpenAI

client = OpenAI(
    api_key="sk-your-api-key",
    base_url="https://api.llm-token.cn/v1"
)

# Enable streaming
stream = client.chat.completions.create(
    model="gpt-4o-mini",
    messages=[
        {"role": "system", "content": "You are a concise assistant."},
        {"role": "user", "content": "Introduce yourself in one sentence."}
    ],
    stream=True
)

# Print each streamed token as it arrives
for chunk in stream:
    if chunk.choices[0].delta.content is not None:
        print(chunk.choices[0].delta.content, end="")

print()  # New line

Lỗi

Các lỗi API thường gặp và các bước xử lý được khuyến nghị.

Mã HTTPTên lỗiMô tảHành động khuyến nghị
400INVALID_REQUESTĐịnh dạng yêu cầu sai hoặc tham số không hợp lệKiểm tra định dạng và tham số của thân yêu cầu
401UNAUTHORIZEDAPI Key không hợp lệ hoặc đã hết hạnKiểm tra xem API Key có đúng không
429RATE_LIMITVượt quá giới hạn tần suất yêu cầuThử lại với chiến lược lùi theo cấp số nhân
500INTERNAL_ERRORLỗi nội bộ của dịch vụThử lại sau
503SERVICE_UNAVAILABLEDịch vụ tạm thời không khả dụngThử lại sau

Giới hạn tần suất

Yêu cầu API bị giới hạn tần suất để giữ dịch vụ ổn định.

Quy tắc giới hạn tần suất
  • Mỗi API Key có giới hạn tần suất yêu cầu riêng
  • Khi nhận phản hồi 429, hãy thử lại với chiến lược lùi theo cấp số nhân
  • Yêu cầu truyền phát và không truyền phát dùng chung hạn ngạch giới hạn tần suất
  • Giới hạn thực tế theo cấu hình hiện tại của Key

Có thắc mắc? Hãy liên hệ hỗ trợ hoặc xem FAQ.