Estime o custo da sua LLM API antes de se comprometer
Escolha um modelo, informe o volume mensal de tokens e defina uma taxa de acerto de cache. A calculadora usa nossos multiplicadores reais publicados sobre uma base de 0.4 CNY por 1M de tokens, sem cadastro.
Como esta calculadora difere de chutar
A maioria das estimativas de custo é feita de cabeça. Esta roda com os mesmos multiplicadores por modelo que o gateway de fato cobra.
| Esta calculadora | Uma estimativa grosseira | |
|---|---|---|
| Fonte da tarifa | Multiplicadores por modelo publicados em tempo real | Memória ou um post de blog |
| Modelagem de cache | Taxa de acerto ajustável a partir do piso de 0.1x | Geralmente ignorada |
| Moeda | CNY, igual ao que é cobrado de você | Mistura de USD/CNY |
| Cobertura de modelos | Cada modelo de texto que o gateway roteia | Um ou dois modelos |
Para quem é
Útil se você
- Quer uma estimativa de custo defensável antes de mover tráfego para um modelo
- Precisa comparar um modelo 0.5x com um modelo de fronteira no mesmo volume
- Quer ver como uma taxa de acerto de cache maior reduz sua tarifa efetiva
- Está orçando um gasto mensal de LLM em CNY
Menos útil se você
- Precisa de valores em USD: esta calculadora trabalha em CNY
- Cobra por imagem ou por chamada em vez de por token (essas linhas são excluídas)
- Quer um orçamento garantido: o uso real depende dos seus prompts e saídas
- Precisa do preço nativo do provedor para um modelo que o gateway não roteia
Como ler o resultado
A conta é simples e transparente, mas estimativas são estimativas.
- Custo = tarifa efetiva × seu volume de tokens. A tarifa efetiva combina a tarifa normal e a de cache pela sua porcentagem de acerto.
- A tarifa de cache usa o piso documentado de 0.1x do multiplicador do modelo; a economia real depende do reuso dos seus prompts.
- As contagens de tokens são você quem estima: entrada mais saída. O uso real varia com o comprimento do prompt e da resposta.
- Modelos por imagem e por chamada são excluídos porque não são cobrados por token.
A regra por trás dos números
Nada aqui é oculto. A tarifa de cada modelo é seu multiplicador vezes a base.
Isto é uma estimativa baseada em tarifas publicadas e nos seus dados, não um orçamento. O custo real depende do uso real de tokens e do comportamento de cache na sua carga de trabalho.
Apenas uma estimativa, baseada em multiplicadores publicados e nos seus dados. Modelos por imagem e por chamada são excluídos.
Calculadora de preços — Perguntas frequentes
De onde vêm as tarifas?
Dos multiplicadores por modelo publicados pelo gateway, aplicados a uma base de 0.4 CNY por 1M de tokens. A mesma regra que a página de preços lista.
O que a taxa de acerto de cache faz?
A entrada em cache é cobrada a partir do piso de 0.1x do multiplicador do modelo. Aumentar a porcentagem de acerto reduz sua tarifa efetiva combinada.
O resultado é um preço garantido?
Não. É uma estimativa. Seu custo real depende das contagens reais de tokens de entrada e saída e de quanto da entrada é armazenado em cache.
Por que está tudo em CNY?
Porque a cobrança e os créditos pré-pagos são denominados em CNY. A calculadora reflete como você é realmente cobrado.
Satisfeito com a estimativa?
Compre uma chave e comece: créditos pré-pagos, sem validade.