Os provedores de LLM cobram por token, e a matemática é simples quando você conhece as quatro alavancas: qual modelo você usa, quantos tokens de entrada e saída cada solicitação precisa, quanto de sua entrada você pode armazenar em cache e se o trabalho pode ser executado em lote. Esta calculadora transforma essas alavancas em números reais mensais e anuais e permite comparar modelos na mesma carga de trabalho. Este guia explica como cada alavanca funciona e onde se escondem as economias.

Como funciona o preço do token

Cada solicitação tem preço em tokens — pedaços de subpalavras com aproximadamente quatro caracteres. Os provedores publicam duas taxas principais por modelo: um preço por milhão de tokens de entrada (tudo o que você envia) e um preço por milhão de tokens de saída (tudo o que o modelo gera). O custo de uma solicitação é apenas a contagem de cada token dividido por um milhão, multiplicado por sua taxa, somado.

A coisa mais importante a ser internalizada é que a saída é muito mais cara que a entrada — normalmente de 3 a 6 vezes a taxa. No Claude Sonnet 4.6, a entrada é de US$ 3/1 milhão e a produção é de US$ 15/1 milhão; no GPT-5.5 é de US$ 5 contra US$ 30. Isso significa que um modelo tagarela que preenche as respostas pode custar mais do que um modelo mais caro que responde concisamente. Quando uma fatura o surpreender, observe primeiro o comprimento da saída.

Custo de entrada versus custo de produção – e por que a escolha do modelo é importante

Como as duas taxas são muito diferentes, o modelo mais barato nem sempre é o mais barato para sua carga de trabalho. Uma carga de trabalho que envia solicitações enormes, mas espera respostas curtas, é dominada pelo custo de entrada, onde um modelo intermediário pode ser uma pechincha. Uma carga de trabalho que gera documentos longos é dominada pelo custo de produção, onde um modelo menor e mais rápido pode economizar muito mais do que reduzir a entrada.

É para isso que serve a guia Comparar modelos: ela mantém fixas as contagens e o volume de tokens e os reavalia em três modelos de uma vez, dividindo cada barra em entrada, entrada em cache e saída para que você possa ver exatamente para onde vai o dinheiro. Muitas vezes, um modelo de um nível abaixo realiza a tarefa por uma fração do custo. A única maneira de saber é comparando seus números reais.

Cache imediato e descontos em lote

Dois recursos do provedor reduzem custos sem alterar seu modelo ou suas solicitações. O cache de prompts armazena o prefixo estável de uma solicitação — um prompt do sistema, um bloco de instruções longo, contexto recuperado — para que solicitações repetidas não o reprocessem. Os tokens armazenados em cache são lidos a aproximadamente 10% do preço de entrada. O problema é um prêmio único de gravação em cache (cerca de 1,25× entrada no Anthropic) na primeira solicitação, portanto, o armazenamento em cache compensa quando o mesmo prefixo é reutilizado muitas vezes dentro da janela de cache.

A API Batch executa solicitações de forma assíncrona usando as taxas de lote publicadas pelo provedor. Muitas taxas de token representam 50% do preço padrão, mas componentes como leituras de cache podem variar de acordo com o provedor. Se o seu trabalho pode tolerar minutos a horas de latência – resumo em massa, classificação, avaliações, enriquecimento de dados – compare as taxas exibidas antes do lote. Os dois recursos podem ser acumulados: uma carga de trabalho em cache, em lote e do tamanho certo pode custar uma pequena fração da estimativa ingênua.

Estimando tokens e evitando surpresas

Para fazer um orçamento antes de construir, você precisa de uma estimativa simbólica. O texto em inglês tem cerca de quatro caracteres ou 0,75 palavras por token, portanto, um documento de 2.000 palavras equivale a aproximadamente 2.700 tokens. A guia Token Estimator faz essa conversão a partir de texto colado ou de uma contagem bruta. Trate-o como um guia aproximado - código, JSON, texto que não seja em inglês e vocabulário incomum são tokenizados de maneira diferente e, para números exatos, você deve usar o tokenizer ou o ponto de extremidade de contagem de tokens do provedor.

Duas surpresas comuns: o histórico de conversas é reenviado (e cobrado novamente) a cada turno, a menos que você o armazene em cache ou corte-o, de modo que os bate-papos em vários turnos ficam mais caros à medida que ficam mais longos; e o contexto recuperado sempre conta como entrada, mesmo que a pergunta do usuário seja pequena. O modelo e os preços nesta ferramenta foram verificados em 29 de agosto de 2026 e estão isolados em uma única tabela datada no código – sempre confirme na página de preços do próprio fornecedor antes de comprometer um orçamento, pois as taxas mudam.