Your privacy choices

Allow optional cookies for referral attribution, visit analytics, and Google Ads purchase measurement.

Endpoints compatíveis · Autenticação · Streaming

Documentação para desenvolvedores

Documentação de referência sobre endpoints compatíveis, autenticação, formato de requisição, respostas em streaming e tratamento de erros.

Início rápido

Defina o endpoint, configure sua chave, integre o cliente e envie a primeira requisição.

Escolha um endpoint

Escolha o formato de endpoint que seu cliente espera. Há rotas compatíveis com Chat Completions, Responses e Messages.

Base URL: https://api.llm-token.cn/v1

Prepare sua API Key

Use uma API Key ativa do ambiente do servidor. Evite expor chaves no código do navegador.

Authorization: Bearer sk-your-api-key

Integre seu cliente

Use um SDK compatível ou chame a REST API diretamente com um base_url personalizado.

client = OpenAI(base_url='https://api.llm-token.cn/v1')

Comece a chamar

Envie requisições e receba respostas de IA. O streaming é suportado para uma resposta mais rápida.

POST /v1/chat/completions

Autenticação

Toda requisição de API deve incluir sua API Key no header HTTP Authorization.

Formato de autenticação

Adicione sua API Key ao header Authorization em cada requisição.

POST/v1/chat/completions

Exemplo de requisição autenticada

Exemplo de solicitação
json
curl https://api.llm-token.cn/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer sk-your-api-key" \
  -d '{
    "model": "gpt-4o-mini",
    "messages": [{"role": "user", "content": "Hello!"}]
  }'
Exemplo de resposta
json
{
  "id": "chatcmpl_123",
  "object": "chat.completion",
  "choices": [{
    "message": {
      "role": "assistant",
      "content": "Hello! How can I help you today?"
    }
  }]
}
Base URL recomendada
https://api.llm-token.cn/v1Use para a maioria dos clientes
Base URL alternativa
https://gpt-agent.ccUse apenas se o seu cliente rejeitar /v1 durante a validação
Endpoint compatível com Chat Completions
/v1/chat/completionsPara clientes que esperam Chat Completions
Endpoint compatível com Responses
/v1/responsesUse primeiro em clientes que suportam Responses
Endpoint compatível com Messages
/v1/messagesUse primeiro em clientes compatíveis com Messages

Chat Completions API

Endpoint Chat Completions compatível com OpenAI para múltiplos ecossistemas de modelos.

python
from openai import OpenAI

# Initialize the client
client = OpenAI(
    api_key="sk-your-api-key",
    base_url="https://api.llm-token.cn/v1"
)

# Send a chat request
response = client.chat.completions.create(
    model="gpt-4o-mini",
    messages=[
        {"role": "system", "content": "You are a concise assistant."},
        {"role": "user", "content": "Introduce yourself in one sentence."}
    ]
)

print(response.choices[0].message.content)

Parâmetros da requisição

ParâmetroTipoObrigatórioDescrição
modelstringSimID do modelo, por exemplo gpt-4o-mini
messagesarraySimArray de mensagens de chat
temperaturenumberNãoTemperatura de amostragem de 0 a 2, padrão 1
max_tokensintegerNãoNúmero máximo de tokens a gerar
streambooleanNãoSe ativa a saída em streaming
top_pnumberNãoValor de amostragem de núcleo, padrão 1

Campos da resposta

CampoTipoDescrição
idstringIdentificador único da resposta
objectstringTipo de objeto, normalmente chat.completion
createdintegerCarimbo de data/hora de criação
modelstringID do modelo usado na resposta
choicesarrayOpções de resposta geradas
usageobjectEstatísticas de uso de tokens

Streaming

Ative o streaming para receber os tokens gerados em tempo real e reduzir a latência percebida.

Vantagens do streaming
  • Menor latência percebida - O usuário vê a saída imediatamente em vez de esperar a resposta completa.
  • Melhor experiência com textos longos - Respostas longas aparecem progressivamente, como uma digitação ao vivo.
  • Mesmo custo - O streaming tem o mesmo preço da saída síncrona; muda apenas o transporte.
python
from openai import OpenAI

client = OpenAI(
    api_key="sk-your-api-key",
    base_url="https://api.llm-token.cn/v1"
)

# Enable streaming
stream = client.chat.completions.create(
    model="gpt-4o-mini",
    messages=[
        {"role": "system", "content": "You are a concise assistant."},
        {"role": "user", "content": "Introduce yourself in one sentence."}
    ],
    stream=True
)

# Print each streamed token as it arrives
for chunk in stream:
    if chunk.choices[0].delta.content is not None:
        print(chunk.choices[0].delta.content, end="")

print()  # New line

Erros

Erros comuns da API e os passos de tratamento recomendados.

Status HTTPNome do erroDescriçãoAção recomendada
400INVALID_REQUESTO corpo da requisição está malformado ou os parâmetros são inválidosVerifique o corpo da requisição e os parâmetros
401UNAUTHORIZEDA API Key é inválida ou expirouVerifique se a API Key está correta
429RATE_LIMITLimite de frequência de requisições excedidoTente novamente com retentativa exponencial
500INTERNAL_ERRORErro interno do serviçoTente novamente mais tarde
503SERVICE_UNAVAILABLEServiço temporariamente indisponívelTente novamente mais tarde

Limites de taxa

As requisições da API têm limite de taxa para manter o serviço estável.

Regras de limite de taxa
  • Cada API Key tem seus próprios limites de frequência de requisições
  • Ao receber uma resposta 429, tente novamente com retentativa exponencial
  • Requisições com e sem streaming compartilham a mesma cota de limite de frequência
  • O limite efetivo segue a configuração atual da chave

Tem dúvidas? Fale com o suporte ou veja o FAQ.