Démarrage rapide
Définissez l'endpoint, configurez votre clé, intégrez le client, puis envoyez la première requête.
Choisissez un endpoint
Choisissez le format d'endpoint attendu par votre client. Les routes compatibles Chat Completions, Responses et Messages sont disponibles.
Base URL: https://api.llm-token.cn/v1Préparez votre API Key
Utilisez une API Key active depuis votre environnement serveur. Évitez d'exposer les clés dans le code côté navigateur.
Authorization: Bearer sk-your-api-keyIntégrez votre client
Utilisez un SDK compatible ou appelez directement la REST API avec un base_url personnalisé.
client = OpenAI(base_url='https://api.llm-token.cn/v1')Commencez à appeler
Envoyez des requêtes et recevez des réponses de l'IA. Le streaming est pris en charge pour une réponse perçue plus rapide.
POST /v1/chat/completionsAuthentification
Chaque requête API doit inclure votre API Key dans l'en-tête HTTP Authorization.
Format d'authentification
Ajoutez votre API Key à l'en-tête Authorization dans chaque requête.
/v1/chat/completionsExemple de requête authentifiée
curl https://api.llm-token.cn/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer sk-your-api-key" \
-d '{
"model": "gpt-4o-mini",
"messages": [{"role": "user", "content": "Hello!"}]
}'{
"id": "chatcmpl_123",
"object": "chat.completion",
"choices": [{
"message": {
"role": "assistant",
"content": "Hello! How can I help you today?"
}
}]
}https://api.llm-token.cn/v1À utiliser pour la plupart des clientshttps://gpt-agent.ccÀ utiliser uniquement si votre client rejette /v1 lors de la validation/v1/chat/completionsPour les clients qui attendent Chat Completions/v1/responsesÀ utiliser en priorité pour les clients qui prennent en charge Responses/v1/messagesÀ utiliser en priorité pour les clients compatibles MessagesChat Completions API
Endpoint Chat Completions compatible OpenAI pour plusieurs écosystèmes de modèles.
from openai import OpenAI
# Initialize the client
client = OpenAI(
api_key="sk-your-api-key",
base_url="https://api.llm-token.cn/v1"
)
# Send a chat request
response = client.chat.completions.create(
model="gpt-4o-mini",
messages=[
{"role": "system", "content": "You are a concise assistant."},
{"role": "user", "content": "Introduce yourself in one sentence."}
]
)
print(response.choices[0].message.content)Paramètres de la requête
| Paramètre | Type | Obligatoire | Description |
|---|---|---|---|
model | string | Oui | ID du modèle, par exemple gpt-4o-mini |
messages | array | Oui | Tableau de messages de chat |
temperature | number | Non | Température d'échantillonnage de 0 à 2, par défaut 1 |
max_tokens | integer | Non | Nombre maximal de tokens à générer |
stream | boolean | Non | Active ou non la sortie en streaming |
top_p | number | Non | Valeur d'échantillonnage nucleus, par défaut 1 |
Champs de la réponse
| Champ | Type | Description |
|---|---|---|
id | string | Identifiant unique de la réponse |
object | string | Type d'objet, généralement chat.completion |
created | integer | Horodatage de création |
model | string | ID du modèle utilisé pour la réponse |
choices | array | Choix de réponse générés |
usage | object | Statistiques d'utilisation des tokens |
Streaming
Activez le streaming pour recevoir les tokens générés en temps réel et réduire la latence perçue.
- Latence perçue réduite - Les utilisateurs voient la sortie immédiatement au lieu d'attendre la réponse complète.
- Meilleure expérience sur les textes longs - Les réponses longues apparaissent progressivement, comme une saisie en direct.
- Coût identique - Le streaming est facturé au même tarif que la sortie synchrone ; seul le transport change.
from openai import OpenAI
client = OpenAI(
api_key="sk-your-api-key",
base_url="https://api.llm-token.cn/v1"
)
# Enable streaming
stream = client.chat.completions.create(
model="gpt-4o-mini",
messages=[
{"role": "system", "content": "You are a concise assistant."},
{"role": "user", "content": "Introduce yourself in one sentence."}
],
stream=True
)
# Print each streamed token as it arrives
for chunk in stream:
if chunk.choices[0].delta.content is not None:
print(chunk.choices[0].delta.content, end="")
print() # New lineErreurs
Erreurs API courantes et étapes de gestion recommandées.
| Statut HTTP | Nom de l'erreur | Description | Action recommandée |
|---|---|---|---|
400 | INVALID_REQUEST | Le corps de la requête est mal formé ou les paramètres sont invalides | Vérifiez le corps de la requête et les paramètres |
401 | UNAUTHORIZED | L'API Key est invalide ou expirée | Vérifiez que l'API Key est correcte |
429 | RATE_LIMIT | Limite de fréquence des requêtes dépassée | Réessayez avec un backoff exponentiel |
500 | INTERNAL_ERROR | Erreur interne du service | Réessayez plus tard |
503 | SERVICE_UNAVAILABLE | Service temporairement indisponible | Réessayez plus tard |
Limites de fréquence
Les requêtes API sont limitées en fréquence pour garder le service stable.
- Chaque API Key dispose de ses propres limites de fréquence de requêtes
- Utilisez un backoff exponentiel lorsque vous recevez une réponse 429
- Les requêtes en streaming et hors streaming partagent le même quota de limite de fréquence
- La limite effective suit la configuration actuelle de la clé