Your privacy choices

Allow optional cookies for referral attribution, visit analytics, and Google Ads purchase measurement.

Endpoints compatibles · Autenticación · Streaming

Documentación para desarrolladores

Documentación de referencia sobre endpoints compatibles, autenticación, formato de solicitud, respuestas en streaming y manejo de errores.

Inicio rápido

Configura el endpoint, ajusta tu clave, integra el cliente y envía la primera solicitud.

Elige un endpoint

Elige el formato de endpoint que espera tu cliente. Hay rutas compatibles con Chat Completions, Responses y Messages.

Base URL: https://api.llm-token.cn/v1

Prepara tu API Key

Usa una API Key activa desde tu entorno de servidor. Evita exponer claves en el código del navegador.

Authorization: Bearer sk-your-api-key

Integra tu cliente

Usa un SDK compatible o llama directamente a la REST API con un base_url personalizado.

client = OpenAI(base_url='https://api.llm-token.cn/v1')

Empieza a llamar

Envía solicitudes y recibe respuestas de IA. El streaming está disponible para una respuesta más rápida.

POST /v1/chat/completions

Autenticación

Cada solicitud de API debe incluir tu API Key en el header HTTP Authorization.

Formato de autenticación

Añade tu API Key al header Authorization en cada solicitud.

POST/v1/chat/completions

Ejemplo de solicitud autenticada

Ejemplo de solicitud
json
curl https://api.llm-token.cn/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer sk-your-api-key" \
  -d '{
    "model": "gpt-4o-mini",
    "messages": [{"role": "user", "content": "Hello!"}]
  }'
Ejemplo de respuesta
json
{
  "id": "chatcmpl_123",
  "object": "chat.completion",
  "choices": [{
    "message": {
      "role": "assistant",
      "content": "Hello! How can I help you today?"
    }
  }]
}
Base URL recomendada
https://api.llm-token.cn/v1Úsala para la mayoría de los clientes
Base URL alternativa
https://gpt-agent.ccÚsala solo si tu cliente rechaza /v1 durante la validación
Endpoint compatible con Chat Completions
/v1/chat/completionsPara clientes que esperan Chat Completions
Endpoint compatible con Responses
/v1/responsesÚsala primero en clientes que admiten Responses
Endpoint compatible con Messages
/v1/messagesÚsala primero en clientes compatibles con Messages

Chat Completions API

Endpoint Chat Completions compatible con OpenAI para múltiples ecosistemas de modelos.

python
from openai import OpenAI

# Initialize the client
client = OpenAI(
    api_key="sk-your-api-key",
    base_url="https://api.llm-token.cn/v1"
)

# Send a chat request
response = client.chat.completions.create(
    model="gpt-4o-mini",
    messages=[
        {"role": "system", "content": "You are a concise assistant."},
        {"role": "user", "content": "Introduce yourself in one sentence."}
    ]
)

print(response.choices[0].message.content)

Parámetros de solicitud

ParámetroTipoObligatorioDescripción
modelstringID del modelo, por ejemplo gpt-4o-mini
messagesarrayArray de mensajes de chat
temperaturenumberNoTemperatura de muestreo de 0 a 2, predeterminado 1
max_tokensintegerNoNúmero máximo de tokens a generar
streambooleanNoSi se habilita la salida en streaming
top_pnumberNoValor de muestreo de núcleo, predeterminado 1

Campos de respuesta

CampoTipoDescripción
idstringIdentificador único de la respuesta
objectstringTipo de objeto, normalmente chat.completion
createdintegerMarca de tiempo de creación
modelstringID del modelo usado para la respuesta
choicesarrayOpciones de respuesta generadas
usageobjectEstadísticas de uso de tokens

Streaming

Activa el streaming para recibir los tokens generados en tiempo real y reducir la latencia percibida.

Ventajas del streaming
  • Menor latencia percibida - El usuario ve la salida de inmediato en lugar de esperar la respuesta completa.
  • Mejor experiencia con textos largos - Las respuestas largas aparecen de forma progresiva, como una escritura en vivo.
  • Mismo coste - El streaming tiene el mismo precio que la salida sincrónica; solo cambia el transporte.
python
from openai import OpenAI

client = OpenAI(
    api_key="sk-your-api-key",
    base_url="https://api.llm-token.cn/v1"
)

# Enable streaming
stream = client.chat.completions.create(
    model="gpt-4o-mini",
    messages=[
        {"role": "system", "content": "You are a concise assistant."},
        {"role": "user", "content": "Introduce yourself in one sentence."}
    ],
    stream=True
)

# Print each streamed token as it arrives
for chunk in stream:
    if chunk.choices[0].delta.content is not None:
        print(chunk.choices[0].delta.content, end="")

print()  # New line

Errores

Errores comunes de la API y los pasos de manejo recomendados.

Estado HTTPNombre del errorDescripciónAcción recomendada
400INVALID_REQUESTEl cuerpo de la solicitud tiene un formato incorrecto o los parámetros no son válidosRevisa el cuerpo de la solicitud y los parámetros
401UNAUTHORIZEDLa API Key no es válida o ha caducadoVerifica que la API Key sea correcta
429RATE_LIMITSe superó el límite de frecuencia de solicitudesReintenta con retroceso exponencial
500INTERNAL_ERRORError interno del servicioInténtalo de nuevo más tarde
503SERVICE_UNAVAILABLEServicio temporalmente no disponibleInténtalo de nuevo más tarde

Límites de tasa

Las solicitudes de la API tienen límites de tasa para mantener el servicio estable.

Reglas de límite de tasa
  • Cada API Key tiene sus propios límites de frecuencia de solicitudes
  • Cuando recibas una respuesta 429, reintenta con retroceso exponencial
  • Las solicitudes con y sin streaming comparten la misma cuota de límite de frecuencia
  • El límite efectivo depende de la configuración actual de la clave

¿Tienes dudas? Contacta con soporte o consulta las FAQ.