Your privacy choices

Allow optional cookies for referral attribution, visit analytics, and Google Ads purchase measurement.

Endpoints compatibles · Auth · Streaming

Docs développeur

Documentation de référence sur les endpoints compatibles, l'authentification, le format des requêtes, les réponses en streaming et la gestion des erreurs.

Démarrage rapide

Définissez l'endpoint, configurez votre clé, intégrez le client, puis envoyez la première requête.

Choisissez un endpoint

Choisissez le format d'endpoint attendu par votre client. Les routes compatibles Chat Completions, Responses et Messages sont disponibles.

Base URL: https://api.llm-token.cn/v1

Préparez votre API Key

Utilisez une API Key active depuis votre environnement serveur. Évitez d'exposer les clés dans le code côté navigateur.

Authorization: Bearer sk-your-api-key

Intégrez votre client

Utilisez un SDK compatible ou appelez directement la REST API avec un base_url personnalisé.

client = OpenAI(base_url='https://api.llm-token.cn/v1')

Commencez à appeler

Envoyez des requêtes et recevez des réponses de l'IA. Le streaming est pris en charge pour une réponse perçue plus rapide.

POST /v1/chat/completions

Authentification

Chaque requête API doit inclure votre API Key dans l'en-tête HTTP Authorization.

Format d'authentification

Ajoutez votre API Key à l'en-tête Authorization dans chaque requête.

POST/v1/chat/completions

Exemple de requête authentifiée

Exemple de requête
json
curl https://api.llm-token.cn/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer sk-your-api-key" \
  -d '{
    "model": "gpt-4o-mini",
    "messages": [{"role": "user", "content": "Hello!"}]
  }'
Exemple de réponse
json
{
  "id": "chatcmpl_123",
  "object": "chat.completion",
  "choices": [{
    "message": {
      "role": "assistant",
      "content": "Hello! How can I help you today?"
    }
  }]
}
Base URL recommandée
https://api.llm-token.cn/v1À utiliser pour la plupart des clients
Base URL de secours
https://gpt-agent.ccÀ utiliser uniquement si votre client rejette /v1 lors de la validation
Endpoint compatible Chat Completions
/v1/chat/completionsPour les clients qui attendent Chat Completions
Endpoint compatible Responses
/v1/responsesÀ utiliser en priorité pour les clients qui prennent en charge Responses
Endpoint compatible Messages
/v1/messagesÀ utiliser en priorité pour les clients compatibles Messages

Chat Completions API

Endpoint Chat Completions compatible OpenAI pour plusieurs écosystèmes de modèles.

python
from openai import OpenAI

# Initialize the client
client = OpenAI(
    api_key="sk-your-api-key",
    base_url="https://api.llm-token.cn/v1"
)

# Send a chat request
response = client.chat.completions.create(
    model="gpt-4o-mini",
    messages=[
        {"role": "system", "content": "You are a concise assistant."},
        {"role": "user", "content": "Introduce yourself in one sentence."}
    ]
)

print(response.choices[0].message.content)

Paramètres de la requête

ParamètreTypeObligatoireDescription
modelstringOuiID du modèle, par exemple gpt-4o-mini
messagesarrayOuiTableau de messages de chat
temperaturenumberNonTempérature d'échantillonnage de 0 à 2, par défaut 1
max_tokensintegerNonNombre maximal de tokens à générer
streambooleanNonActive ou non la sortie en streaming
top_pnumberNonValeur d'échantillonnage nucleus, par défaut 1

Champs de la réponse

ChampTypeDescription
idstringIdentifiant unique de la réponse
objectstringType d'objet, généralement chat.completion
createdintegerHorodatage de création
modelstringID du modèle utilisé pour la réponse
choicesarrayChoix de réponse générés
usageobjectStatistiques d'utilisation des tokens

Streaming

Activez le streaming pour recevoir les tokens générés en temps réel et réduire la latence perçue.

Avantages du streaming
  • Latence perçue réduite - Les utilisateurs voient la sortie immédiatement au lieu d'attendre la réponse complète.
  • Meilleure expérience sur les textes longs - Les réponses longues apparaissent progressivement, comme une saisie en direct.
  • Coût identique - Le streaming est facturé au même tarif que la sortie synchrone ; seul le transport change.
python
from openai import OpenAI

client = OpenAI(
    api_key="sk-your-api-key",
    base_url="https://api.llm-token.cn/v1"
)

# Enable streaming
stream = client.chat.completions.create(
    model="gpt-4o-mini",
    messages=[
        {"role": "system", "content": "You are a concise assistant."},
        {"role": "user", "content": "Introduce yourself in one sentence."}
    ],
    stream=True
)

# Print each streamed token as it arrives
for chunk in stream:
    if chunk.choices[0].delta.content is not None:
        print(chunk.choices[0].delta.content, end="")

print()  # New line

Erreurs

Erreurs API courantes et étapes de gestion recommandées.

Statut HTTPNom de l'erreurDescriptionAction recommandée
400INVALID_REQUESTLe corps de la requête est mal formé ou les paramètres sont invalidesVérifiez le corps de la requête et les paramètres
401UNAUTHORIZEDL'API Key est invalide ou expiréeVérifiez que l'API Key est correcte
429RATE_LIMITLimite de fréquence des requêtes dépasséeRéessayez avec un backoff exponentiel
500INTERNAL_ERRORErreur interne du serviceRéessayez plus tard
503SERVICE_UNAVAILABLEService temporairement indisponibleRéessayez plus tard

Limites de fréquence

Les requêtes API sont limitées en fréquence pour garder le service stable.

Règles de limitation de fréquence
  • Chaque API Key dispose de ses propres limites de fréquence de requêtes
  • Utilisez un backoff exponentiel lorsque vous recevez une réponse 429
  • Les requêtes en streaming et hors streaming partagent le même quota de limite de fréquence
  • La limite effective suit la configuration actuelle de la clé

Des questions ? Contactez le support ou consultez la FAQ.