Your privacy choices

Allow optional cookies for referral attribution, visit analytics, and Google Ads purchase measurement.

Kompatible Endpoints · Auth · Streaming

Entwicklerdokumentation

Referenzdokumentation zu kompatiblen Endpoints, Authentifizierung, Anfrageformat, Streaming-Antworten und Fehlerbehandlung.

Schnellstart

Legen Sie den Endpoint fest, konfigurieren Sie Ihren Schlüssel, integrieren Sie den Client und senden Sie dann die erste Anfrage.

Endpoint auswählen

Wählen Sie das Endpoint-Format, das Ihr Client erwartet. Routen kompatibel mit Chat Completions, Responses und Messages stehen zur Verfügung.

Base URL: https://api.llm-token.cn/v1

API Key vorbereiten

Verwenden Sie einen aktiven API Key aus Ihrer Serverumgebung. Vermeiden Sie es, Schlüssel im Browser-Code offenzulegen.

Authorization: Bearer sk-your-api-key

Client integrieren

Verwenden Sie ein kompatibles SDK oder rufen Sie die REST API direkt mit einer benutzerdefinierten base_url auf.

client = OpenAI(base_url='https://api.llm-token.cn/v1')

Aufrufe starten

Senden Sie Anfragen und erhalten Sie KI-Antworten. Streaming wird für eine schneller wahrgenommene Antwort unterstützt.

POST /v1/chat/completions

Authentifizierung

Jede API-Anfrage muss Ihren API Key im HTTP-Authorization-Header enthalten.

Authentifizierungsformat

Fügen Sie Ihren API Key in jeder Anfrage zum Header Authorization hinzu.

POST/v1/chat/completions

Beispiel für eine authentifizierte Anfrage

Beispielanfrage
json
curl https://api.llm-token.cn/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer sk-your-api-key" \
  -d '{
    "model": "gpt-4o-mini",
    "messages": [{"role": "user", "content": "Hello!"}]
  }'
Beispielantwort
json
{
  "id": "chatcmpl_123",
  "object": "chat.completion",
  "choices": [{
    "message": {
      "role": "assistant",
      "content": "Hello! How can I help you today?"
    }
  }]
}
Empfohlene Base URL
https://api.llm-token.cn/v1Für die meisten Clients verwenden
Alternative Base URL
https://gpt-agent.ccNur verwenden, wenn Ihr Client /v1 bei der Validierung ablehnt
Chat Completions-kompatibler Endpoint
/v1/chat/completionsFür Clients, die Chat Completions erwarten
Responses-kompatibler Endpoint
/v1/responsesZuerst für Clients verwenden, die Responses unterstützen
Messages-kompatibler Endpoint
/v1/messagesZuerst für Messages-kompatible Clients verwenden

Chat Completions API

OpenAI-kompatibler Chat Completions-Endpoint für mehrere Modell-Ökosysteme.

python
from openai import OpenAI

# Initialize the client
client = OpenAI(
    api_key="sk-your-api-key",
    base_url="https://api.llm-token.cn/v1"
)

# Send a chat request
response = client.chat.completions.create(
    model="gpt-4o-mini",
    messages=[
        {"role": "system", "content": "You are a concise assistant."},
        {"role": "user", "content": "Introduce yourself in one sentence."}
    ]
)

print(response.choices[0].message.content)

Anfrageparameter

ParameterTypErforderlichBeschreibung
modelstringJaModell-ID, zum Beispiel gpt-4o-mini
messagesarrayJaArray von Chat-Nachrichten
temperaturenumberNeinSampling-Temperatur von 0 bis 2, Standard 1
max_tokensintegerNeinMaximale Anzahl der zu generierenden Tokens
streambooleanNeinOb die Streaming-Ausgabe aktiviert wird
top_pnumberNeinNucleus-Sampling-Wert, Standard 1

Antwortfelder

FeldTypBeschreibung
idstringEindeutige Antwortkennung
objectstringObjekttyp, normalerweise chat.completion
createdintegerZeitstempel der Erstellung
modelstringFür die Antwort verwendete Modell-ID
choicesarrayGenerierte Antwortoptionen
usageobjectStatistik zur Token-Nutzung

Streaming

Aktivieren Sie Streaming, um generierte Tokens in Echtzeit zu erhalten und die wahrgenommene Latenz zu verringern.

Vorteile des Streamings
  • Geringere wahrgenommene Latenz - Nutzer sehen die Ausgabe sofort, statt auf die vollständige Antwort zu warten.
  • Bessere Erfahrung bei langen Texten - Lange Antworten erscheinen schrittweise, ähnlich wie beim Live-Tippen.
  • Gleiche Kosten - Streaming wird genauso abgerechnet wie die synchrone Ausgabe; nur der Übertragungsweg ändert sich.
python
from openai import OpenAI

client = OpenAI(
    api_key="sk-your-api-key",
    base_url="https://api.llm-token.cn/v1"
)

# Enable streaming
stream = client.chat.completions.create(
    model="gpt-4o-mini",
    messages=[
        {"role": "system", "content": "You are a concise assistant."},
        {"role": "user", "content": "Introduce yourself in one sentence."}
    ],
    stream=True
)

# Print each streamed token as it arrives
for chunk in stream:
    if chunk.choices[0].delta.content is not None:
        print(chunk.choices[0].delta.content, end="")

print()  # New line

Fehler

Häufige API-Fehler und empfohlene Schritte zur Behandlung.

HTTP-StatusFehlernameBeschreibungEmpfohlene Aktion
400INVALID_REQUESTDer Anfragetext ist fehlerhaft oder die Parameter sind ungültigPrüfen Sie den Anfragetext und die Parameter
401UNAUTHORIZEDAPI Key ist ungültig oder abgelaufenStellen Sie sicher, dass der API Key korrekt ist
429RATE_LIMITAnfrage-Ratenbegrenzung überschrittenMit exponentiellem Backoff erneut versuchen
500INTERNAL_ERRORInterner ServicefehlerVersuchen Sie es später erneut
503SERVICE_UNAVAILABLEDienst vorübergehend nicht verfügbarVersuchen Sie es später erneut

Ratenbegrenzungen

API-Anfragen sind in der Frequenz begrenzt, um den Dienst stabil zu halten.

Regeln zur Ratenbegrenzung
  • Jeder API Key hat eigene Anfrage-Ratenbegrenzungen
  • Verwenden Sie exponentielles Backoff, wenn Sie eine 429-Antwort erhalten
  • Streaming- und Nicht-Streaming-Anfragen teilen sich dasselbe Ratenbegrenzungskontingent
  • Die effektive Begrenzung richtet sich nach der aktuellen Konfiguration des Schlüssels

Fragen? Kontaktieren Sie den Support oder lesen Sie die FAQ.