Schnellstart
Legen Sie den Endpoint fest, konfigurieren Sie Ihren Schlüssel, integrieren Sie den Client und senden Sie dann die erste Anfrage.
Endpoint auswählen
Wählen Sie das Endpoint-Format, das Ihr Client erwartet. Routen kompatibel mit Chat Completions, Responses und Messages stehen zur Verfügung.
Base URL: https://api.llm-token.cn/v1API Key vorbereiten
Verwenden Sie einen aktiven API Key aus Ihrer Serverumgebung. Vermeiden Sie es, Schlüssel im Browser-Code offenzulegen.
Authorization: Bearer sk-your-api-keyClient integrieren
Verwenden Sie ein kompatibles SDK oder rufen Sie die REST API direkt mit einer benutzerdefinierten base_url auf.
client = OpenAI(base_url='https://api.llm-token.cn/v1')Aufrufe starten
Senden Sie Anfragen und erhalten Sie KI-Antworten. Streaming wird für eine schneller wahrgenommene Antwort unterstützt.
POST /v1/chat/completionsAuthentifizierung
Jede API-Anfrage muss Ihren API Key im HTTP-Authorization-Header enthalten.
Authentifizierungsformat
Fügen Sie Ihren API Key in jeder Anfrage zum Header Authorization hinzu.
/v1/chat/completionsBeispiel für eine authentifizierte Anfrage
curl https://api.llm-token.cn/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer sk-your-api-key" \
-d '{
"model": "gpt-4o-mini",
"messages": [{"role": "user", "content": "Hello!"}]
}'{
"id": "chatcmpl_123",
"object": "chat.completion",
"choices": [{
"message": {
"role": "assistant",
"content": "Hello! How can I help you today?"
}
}]
}https://api.llm-token.cn/v1Für die meisten Clients verwendenhttps://gpt-agent.ccNur verwenden, wenn Ihr Client /v1 bei der Validierung ablehnt/v1/chat/completionsFür Clients, die Chat Completions erwarten/v1/responsesZuerst für Clients verwenden, die Responses unterstützen/v1/messagesZuerst für Messages-kompatible Clients verwendenChat Completions API
OpenAI-kompatibler Chat Completions-Endpoint für mehrere Modell-Ökosysteme.
from openai import OpenAI
# Initialize the client
client = OpenAI(
api_key="sk-your-api-key",
base_url="https://api.llm-token.cn/v1"
)
# Send a chat request
response = client.chat.completions.create(
model="gpt-4o-mini",
messages=[
{"role": "system", "content": "You are a concise assistant."},
{"role": "user", "content": "Introduce yourself in one sentence."}
]
)
print(response.choices[0].message.content)Anfrageparameter
| Parameter | Typ | Erforderlich | Beschreibung |
|---|---|---|---|
model | string | Ja | Modell-ID, zum Beispiel gpt-4o-mini |
messages | array | Ja | Array von Chat-Nachrichten |
temperature | number | Nein | Sampling-Temperatur von 0 bis 2, Standard 1 |
max_tokens | integer | Nein | Maximale Anzahl der zu generierenden Tokens |
stream | boolean | Nein | Ob die Streaming-Ausgabe aktiviert wird |
top_p | number | Nein | Nucleus-Sampling-Wert, Standard 1 |
Antwortfelder
| Feld | Typ | Beschreibung |
|---|---|---|
id | string | Eindeutige Antwortkennung |
object | string | Objekttyp, normalerweise chat.completion |
created | integer | Zeitstempel der Erstellung |
model | string | Für die Antwort verwendete Modell-ID |
choices | array | Generierte Antwortoptionen |
usage | object | Statistik zur Token-Nutzung |
Streaming
Aktivieren Sie Streaming, um generierte Tokens in Echtzeit zu erhalten und die wahrgenommene Latenz zu verringern.
- Geringere wahrgenommene Latenz - Nutzer sehen die Ausgabe sofort, statt auf die vollständige Antwort zu warten.
- Bessere Erfahrung bei langen Texten - Lange Antworten erscheinen schrittweise, ähnlich wie beim Live-Tippen.
- Gleiche Kosten - Streaming wird genauso abgerechnet wie die synchrone Ausgabe; nur der Übertragungsweg ändert sich.
from openai import OpenAI
client = OpenAI(
api_key="sk-your-api-key",
base_url="https://api.llm-token.cn/v1"
)
# Enable streaming
stream = client.chat.completions.create(
model="gpt-4o-mini",
messages=[
{"role": "system", "content": "You are a concise assistant."},
{"role": "user", "content": "Introduce yourself in one sentence."}
],
stream=True
)
# Print each streamed token as it arrives
for chunk in stream:
if chunk.choices[0].delta.content is not None:
print(chunk.choices[0].delta.content, end="")
print() # New lineFehler
Häufige API-Fehler und empfohlene Schritte zur Behandlung.
| HTTP-Status | Fehlername | Beschreibung | Empfohlene Aktion |
|---|---|---|---|
400 | INVALID_REQUEST | Der Anfragetext ist fehlerhaft oder die Parameter sind ungültig | Prüfen Sie den Anfragetext und die Parameter |
401 | UNAUTHORIZED | API Key ist ungültig oder abgelaufen | Stellen Sie sicher, dass der API Key korrekt ist |
429 | RATE_LIMIT | Anfrage-Ratenbegrenzung überschritten | Mit exponentiellem Backoff erneut versuchen |
500 | INTERNAL_ERROR | Interner Servicefehler | Versuchen Sie es später erneut |
503 | SERVICE_UNAVAILABLE | Dienst vorübergehend nicht verfügbar | Versuchen Sie es später erneut |
Ratenbegrenzungen
API-Anfragen sind in der Frequenz begrenzt, um den Dienst stabil zu halten.
- Jeder API Key hat eigene Anfrage-Ratenbegrenzungen
- Verwenden Sie exponentielles Backoff, wenn Sie eine 429-Antwort erhalten
- Streaming- und Nicht-Streaming-Anfragen teilen sich dasselbe Ratenbegrenzungskontingent
- Die effektive Begrenzung richtet sich nach der aktuellen Konfiguration des Schlüssels