Estime e compare os custos da API LLM entre modelos – entrada, saída e tokens armazenados em cache, com projeções mensais e economia imediata de armazenamento em cache. Os valores monetários são expressos em dólares americanos (US$), sem conversão para reais.
Carga de trabalho
Preenchimento rápido:
US$ por 1 milhão de tokens de entrada/saída.
O instantâneo de preços está desatualizado; confirme os termos atuais do fornecedor antes da aquisição.
Presume-se que os tokens armazenados em cache sejam leituras de cache no modo rápido. Use a carga de trabalho avançada para modelar falhas de cache, gravações, elegibilidade e cadência de retenção.
Suposições avançadas de carga de trabalho, cache e orçamento
Modele detalhes de produção sem perder a estimativa rápida: perdas de cache, novas tentativas, roteamento, crescimento, qualidade e preços efetivos.
Modelo personalizado/taxa negociada
Esses valores permanecem no seu navegador e são usados somente quando “Modelo personalizado/taxa de contrato” é selecionado.
As ocorrências, gravações, elegibilidade e retenção de cache variam de acordo com o provedor. Use o uso faturado real para reconciliação.
Custo estimado
—
Insira sua carga de trabalho para calcular.
Por solicitação—
por dia—
por mês—
Taxa de execução atual/ano—
Economia de cache/mês—
% de economia de cache—
Custo/tarefa aceita
Orçamento do Estado
Imposto/sobretaxa (US$)
Créditos aplicados (US$)
Detalhamento/solicitação de custos
Insira uma carga de trabalho válida para ver a divisão por solicitação.
Como o custo de cada solicitação é dividido entre entrada não armazenada em cache, entrada armazenada em cache e tokens de saída.
Previsão de 12 meses
Insira uma carga de trabalho válida para ver uma previsão de doze meses.
Defina uma taxa de crescimento de solicitação mensal em Suposições avançadas para modelar a taxa de execução do mês 12 e o gasto cumulativo de doze meses.
Compare três modelos na mesma carga de trabalho
Usa os tokens por solicitação, o volume e a configuração de lote do Calculadora guia. Escolha três modelos para ver o custo mensal lado a lado.
Inclua assinaturas, taxas de gateway, capacidade reservada ou compromissos mínimos para cada modelo.
Custo mensal por modelo
Modelo
% de qualidade
Ajustado pela qualidade / mês
Por tarefa aceita
Por solicitação
Por mês
Por ano
O modelo mais barato para esta carga de trabalho está em destaque.
Proteção orçamentária e ponto de equilíbrio
Volume mensal máximo abaixo do seu orçamento e o volume de solicitações em que os Modelos A e B custam o mesmo.
Máximo de tarefas modeladas dentro do orçamento—
Pista de orçamento—
Volume de equilíbrio do modelo—
Análise de sensibilidade
Envelope de cenário e destino de cache
Esse intervalo de planejamento varia o uso de token, novas tentativas e ocorrências de cache de acordo com sua carga de trabalho atual. Não é uma previsão de uso.
Magro—
Esperado—
Alto—
Ponto de equilíbrio do cache—
Modelo de custo de loop de agente
Amplie a carga de trabalho atual com saída multivoltas, esquemas/resultados de ferramentas e cobranças de ferramentas externas.
Defina suposições do agente para estender essa carga de trabalho.
Otimizador de orçamento
Encontre o menor custo mensal modelado entre os três modelos de comparação, preservando as atuais suposições de carga de trabalho.
Modelo recomendado—
Previsão orçamentária de Monte Carlo
Um intervalo de planejamento reproduzível que varia o volume mensal e o uso de token de acordo com a carga de trabalho atual. Não é uma garantia.
10º percentil—
Mediana—
90º percentil—
Ajuste a volatilidade para ver um intervalo de planejamento.
Uso do provedor de importação
Cole um objeto de uso de uma resposta do provedor. O importador extrai tokens de entrada, saída, cache e raciocínio localmente em seu navegador.
Planejador de mix de carga de trabalho
Adicione a carga de trabalho atual a um portfólio e use um multiplicador para outra classe de carga de trabalho. O portfólio permanece neste navegador.
Carga de trabalho
Custo mensal
Ações
Total do portfólio: —
Reconciliação de fatura
Insira uma fatura para compará-la com o custo mensal modelado.
Relatório de planejamento
Exporte suposições, resultados atuais, instantâneo de preços e portfólio de carga de trabalho para uma revisão orçamentária.
Estimar tokens
De:
Perfil:
0
tokens estimados
Somente intervalo de planejamento aproximado. As contagens de tokens variam de acordo com tokenizer, idioma, densidade de código, esquemas de ferramentas e modelo. Use um tokenizer de provedor ou endpoint de uso para cobrança exata.
Escolha um modelo e insira seus tokens por solicitação
Escolha o modelo que você está precificando (agrupado por provedor) e insira quantos tokens de entrada, tokens de saída e tokens de entrada em cache uma única solicitação usa. O modo rápido trata os tokens de entrada armazenados em cache como leituras de cache; A carga de trabalho avançada permite modelar falhas de cache, gravações, elegibilidade e cadência de retenção. Não tem certeza de quantos tokens tem o seu prompt? Use a guia Token Estimator para converter texto colado ou uma contagem de palavras em uma estimativa.
2
Defina seu volume e leia a projeção
Insira quantas solicitações você executa por dia ou por mês e a calculadora projeta o custo por solicitação, por dia, por mês e por ano. Ele também mostra quanto o cache imediato está economizando em dólares e por cento. Ative a alternância da API Batch se sua carga de trabalho puder ser executada de forma assíncrona — a calculadora aplica as taxas de lote publicadas do provedor selecionado, que geralmente são 50% das taxas de token padrão.
3
Compare modelos na mesma carga de trabalho
Alterne para a guia Comparar modelos para executar exatamente a mesma carga de trabalho em três modelos lado a lado. A tabela e o gráfico de barras empilhadas mostram a divisão do custo mensal em entrada, entrada em cache e saída, e a opção mais barata é sinalizada. Esta é a maneira mais rápida de ver se um modelo menor reduziria sua conta sem alterar a contagem de tokens.
Os preços são cotados por 1.000.000 de tokens, portanto, cada contagem de tokens faturáveis é dividida por 1.000.000 antes de multiplicar por sua taxa. A entrada não armazenada em cache e a sobrecarga do provedor faturável usam o preço total da entrada; leituras e gravações de cache usam taxas específicas do provedor; a saída usa a taxa de saída. O modo rápido assume que o campo de entrada em cache representa leituras de cache.
Multiplique o custo por solicitação pela contagem mensal de solicitações. Por dia é o valor mensal dividido por 30,44 (a média de dias por mês); por ano é mensal × 12. Quando a API Batch está habilitada, a calculadora aplica as taxas de lote publicadas do provedor selecionado por componente; muitas taxas de token são 50% do preço padrão, mas as taxas de cache podem ser diferentes. Com 10.000 solicitações/mês, a solicitação de US$ 0,0093 acima custa cerca de US$ 93/mês, ou cerca de US$ 1.116/ano.
O custo da linha de base fixa o preço de cada token de entrada na taxa de entrada total (como se não houvesse cache); o custo armazenado em cache determina o preço da fatia armazenada na taxa de leitura do cache. A diferença é a sua economia. No exemplo acima, a linha de base sem cache é de US$ 0,012/solicitação, portanto, o armazenamento em cache economiza US$ 0,0027 – 22,5%. Quanto mais sua entrada for um prefixo estável e reutilizável, maior será o percentual.
Estimando tokens de texto
tokens ≈ characters / 4 ≈ words / 0.75
O texto em inglês tem em média cerca de 4 caracteres ou 0,75 palavras por token, então um snippet de 400 caracteres equivale a cerca de 100 tokens e 750 palavras equivale a cerca de 1.000 tokens. Estas são aproximações – código, texto diferente do inglês e palavras raras são tokenizadas de maneira diferente. Para contagens exatas, use o tokenizer ou o endpoint de contagem de tokens do provedor.
✓
Risco YMYL moderado
Confiabilidade, metodologia e fontes
Metodologia e fontes▸
Responsabilidade editorial
Responsável editorial: Calculover Editorial - Calculator methodology and source review
Última revisão: 2026-08-29
Última verificação: 2026-08-29
Dados vigentes: 2026-08-29
Metodologia
A calculadora multiplica as suposições de entrada inseridas pelo usuário, entrada em cache, saída, nova tentativa, fallback e volume pelas taxas datadas por milhão de token na origem da calculadora. As regras de cache e lote específicas do provedor são modeladas separadamente quando documentadas.
Premissa: O instantâneo de preços selecionado é denominado em dólares americanos por um milhão de tokens e exclui impostos, a menos que um usuário os insira como uma taxa fixa.
Premissa: As entradas de cache, nova tentativa, aceitação, fallback, crescimento, regional, desconto negociado e cobrança de ferramenta são suposições de planejamento fornecidas pelo usuário, e não previsões.
Premissa: As taxas de modelos personalizados são fornecidas pelo usuário e não são verificadas de forma independente pela Calculover.
Limitações e orientações
Os preços do provedor, a disponibilidade do modelo, os tokenizadores, as camadas de contexto, a elegibilidade do cache, os termos do lote, as janelas de retenção e as cobranças de recursos podem mudar sem aviso prévio.
A estimativa não substitui a reconciliação de faturas, uma exportação de utilização do fornecedor, uma revisão de contrato, aconselhamento fiscal, aconselhamento contabilístico ou uma cotação de aquisição.
Esta calculadora fornece apenas estimativas de planejamento. Não se trata de uma cotação, fatura, recomendação de aquisição, parecer contábil, parecer fiscal, parecer jurídico ou garantia de encargos do fornecedor. Os custos reais podem diferir devido à tokenização do provedor, prompts do sistema, definições de ferramentas, contexto recuperado, tokens de raciocínio, novas tentativas, solicitações com falha, elegibilidade do cache, retenção de cache, regras de lote, preços de contexto longo, termos regionais, impostos, créditos, compromissos mínimos, arredondamento, conversão de moeda e políticas de cobrança do fornecedor. Verifique a documentação atual do fornecedor e reconcilie as estimativas com os registros de uso ou faturas antes de tomar decisões de produção, compra ou orçamento.
Orientação profissional: Esta calculadora é um software de planejamento educacional e não uma consultoria financeira, contábil, tributária, jurídica, de compras ou de investimento. Confirme os termos atuais, registros de uso e faturas com o fornecedor relevante e profissional qualificado antes de fazer um orçamento ou decisão de compra.
Tokens de entrada (tokens de prompt)Tudo o que você envia para o modelo: o prompt do sistema, o histórico da conversa, o contexto recuperado e a mensagem do usuário. Faturado pela taxa de entrada do modelo, que é sempre mais barata que a saída.
Tokens de saída (tokens de conclusão)Os tokens que o modelo gera em sua resposta. O preço é 3 a 6 vezes mais alto do que os tokens de entrada na maioria dos modelos, portanto, o comprimento da resposta geralmente é a maior alavanca de custo.
Tokens de entrada armazenados em cacheA parte da sua entrada servida pelo cache de prompt do provedor em vez de ser reprocessada. No modo rápido desta calculadora, o campo de entrada em cache é tratado como leituras de cache. O modo avançado separa leituras e gravações de cache, elegibilidade, estabilidade de prefixo e cadência de retenção.
Cache de promptUm recurso que armazena o prefixo estável de uma solicitação para que solicitações repetidas ignorem o reprocessamento. A primeira solicitação paga um prêmio único de gravação em cache (cerca de 1,25× entrada no Anthropic); cada hit subsequente lê o prefixo em cache por uma fração do preço. Mais eficaz quando um prefixo grande é reutilizado com frequência.
API de loteUm modo de processamento assíncrono oferecido por vários provedores, incluindo Anthropic, Google e OpenAI. Ele usa as taxas de lote publicadas pelo provedor – muitas taxas de token são 50% do preço padrão, embora componentes individuais, como leituras de cache, possam ser diferentes – e é ideal para trabalhos não sensíveis à latência, como resumo em massa, classificação ou avaliações.
Janela de contextoO número máximo de tokens (entrada + saída) que um modelo pode manipular em uma solicitação. Contextos maiores permitem enviar mais, mas cada token enviado ainda é cobrado – uma grande janela é um limite de capacidade, não um desconto.
$ por 1 milhão de tokensA unidade padrão para preços LLM: dólares por um milhão de tokens. Para obter o custo de N tokens, divida N por 1.000.000 e multiplique pela taxa. Um modelo com entrada de US$ 3/1 milhão custa US$ 0,003 por 1.000 tokens de entrada.
👥
Situações comuns
Exemplos práticos
3 exemplos▸
💬
Chatbot de suporte
Soneto 4.6, cache leve
Modelo Soneto de Claude 4.6Entrada/saída 1.500/500 fichasEntrada em cache 1.000 fichasVolume 10.000/mês
Cada solicitação custa cerca de US$ 0,0093, portanto, 10.000 solicitações por mês custam cerca de US$ 93/mês (US$ 1.116/ano). Armazenar em cache o prompt do sistema de 1.000 tokens economiza 22,5% em comparação ao pagamento do preço total de entrada. O resultado representa 81% do custo de cada solicitação — encurtar as respostas economizaria mais do que qualquer outra alteração.
📚
Gasoduto RAG
Contexto em cache grande
Modelo Soneto de Claude 4.6Entrada/saída 8.000/800 fichasEntrada em cache 6.000 fichasVolume 5.000/mês
Com 6.000 dos 8.000 tokens de entrada servidos a partir do cache, o custo por solicitação cai bem abaixo da linha de base sem cache – o cache economiza mais de 50% na parte de entrada aqui. Cargas de trabalho de recuperação aumentada com um prefixo de contexto grande e reutilizável são exatamente onde o cache de prompt compensa mais. Compare com o Haiku 4.5 na guia Comparar para ver se um modelo mais barato ainda atende ao seu padrão de qualidade.
🗂️
Resumidor de lote noturno
Haiku 4.5 + API em lote
Modelo Claude Haiku 4.5Entrada/saída 4.000/1.000 fichasEntrada em cache 0 fichasVolume 100.000/mês (lote)
Resumir 100.000 documentos no Haiku 4.5 custa cerca de US$ 0,009/solicitação no preço padrão, mas o desconto de 50% da API em lote reduz pela metade para cerca de US$ 0,0045 – cerca de US$ 450/mês em vez de US$ 900. Quando a latência não importa, mudar um trabalho de alto volume para lote é a maior economia disponível, além de escolher o menor modelo que faz o trabalho.
🔗
Referência
Citar esta calculadora
APA e MLA▸
Use um destes formatos para citar esta calculadora em um trabalho ou relatório.
Os provedores de LLM cobram por token, e a matemática é simples quando você conhece as quatro alavancas: qual modelo você usa, quantos tokens de entrada e saída cada solicitação precisa, quanto de sua entrada você pode armazenar em cache e se o trabalho pode ser executado em lote. Esta calculadora transforma essas alavancas em números reais mensais e anuais e permite comparar modelos na mesma carga de trabalho. Este guia explica como cada alavanca funciona e onde se escondem as economias.
Como funciona o preço do token
▸
Cada solicitação tem preço em tokens — pedaços de subpalavras com aproximadamente quatro caracteres. Os provedores publicam duas taxas principais por modelo: um preço por milhão de tokens de entrada (tudo o que você envia) e um preço por milhão de tokens de saída (tudo o que o modelo gera). O custo de uma solicitação é apenas a contagem de cada token dividido por um milhão, multiplicado por sua taxa, somado.
A coisa mais importante a ser internalizada é que a saída é muito mais cara que a entrada — normalmente de 3 a 6 vezes a taxa. No Claude Sonnet 4.6, a entrada é de US$ 3/1 milhão e a produção é de US$ 15/1 milhão; no GPT-5.5 é de US$ 5 contra US$ 30. Isso significa que um modelo tagarela que preenche as respostas pode custar mais do que um modelo mais caro que responde concisamente. Quando uma fatura o surpreender, observe primeiro o comprimento da saída.
Custo de entrada versus custo de produção – e por que a escolha do modelo é importante
▸
Como as duas taxas são muito diferentes, o modelo mais barato nem sempre é o mais barato para sua carga de trabalho. Uma carga de trabalho que envia solicitações enormes, mas espera respostas curtas, é dominada pelo custo de entrada, onde um modelo intermediário pode ser uma pechincha. Uma carga de trabalho que gera documentos longos é dominada pelo custo de produção, onde um modelo menor e mais rápido pode economizar muito mais do que reduzir a entrada.
É para isso que serve a guia Comparar modelos: ela mantém fixas as contagens e o volume de tokens e os reavalia em três modelos de uma vez, dividindo cada barra em entrada, entrada em cache e saída para que você possa ver exatamente para onde vai o dinheiro. Muitas vezes, um modelo de um nível abaixo realiza a tarefa por uma fração do custo. A única maneira de saber é comparando seus números reais.
Cache imediato e descontos em lote
▸
Dois recursos do provedor reduzem custos sem alterar seu modelo ou suas solicitações. O cache de prompts armazena o prefixo estável de uma solicitação — um prompt do sistema, um bloco de instruções longo, contexto recuperado — para que solicitações repetidas não o reprocessem. Os tokens armazenados em cache são lidos a aproximadamente 10% do preço de entrada. O problema é um prêmio único de gravação em cache (cerca de 1,25× entrada no Anthropic) na primeira solicitação, portanto, o armazenamento em cache compensa quando o mesmo prefixo é reutilizado muitas vezes dentro da janela de cache.
A API Batch executa solicitações de forma assíncrona usando as taxas de lote publicadas pelo provedor. Muitas taxas de token representam 50% do preço padrão, mas componentes como leituras de cache podem variar de acordo com o provedor. Se o seu trabalho pode tolerar minutos a horas de latência – resumo em massa, classificação, avaliações, enriquecimento de dados – compare as taxas exibidas antes do lote. Os dois recursos podem ser acumulados: uma carga de trabalho em cache, em lote e do tamanho certo pode custar uma pequena fração da estimativa ingênua.
Estimando tokens e evitando surpresas
▸
Para fazer um orçamento antes de construir, você precisa de uma estimativa simbólica. O texto em inglês tem cerca de quatro caracteres ou 0,75 palavras por token, portanto, um documento de 2.000 palavras equivale a aproximadamente 2.700 tokens. A guia Token Estimator faz essa conversão a partir de texto colado ou de uma contagem bruta. Trate-o como um guia aproximado - código, JSON, texto que não seja em inglês e vocabulário incomum são tokenizados de maneira diferente e, para números exatos, você deve usar o tokenizer ou o ponto de extremidade de contagem de tokens do provedor.
Duas surpresas comuns: o histórico de conversas é reenviado (e cobrado novamente) a cada turno, a menos que você o armazene em cache ou corte-o, de modo que os bate-papos em vários turnos ficam mais caros à medida que ficam mais longos; e o contexto recuperado sempre conta como entrada, mesmo que a pergunta do usuário seja pequena. O modelo e os preços nesta ferramenta foram verificados em 29 de agosto de 2026 e estão isolados em uma única tabela datada no código – sempre confirme na página de preços do próprio fornecedor antes de comprometer um orçamento, pois as taxas mudam.
❓
Perguntas
Perguntas frequentes
6 perguntas▸
Como o custo da API LLM é calculado?+
O custo é por token. Para uma solicitação: pegue os tokens de entrada não armazenados em cache divididos por um milhão de vezes a taxa de entrada, mais os tokens de entrada armazenados em cache divididos por um milhão de vezes a taxa de leitura do cache, mais os tokens de saída divididos por um milhão de vezes a taxa de saída. Multiplique pelo seu volume de solicitações para obter um valor diário, mensal ou anual. Esta calculadora faz tudo isso e mostra o detalhamento.
Por que os tokens de saída são mais caros que os tokens de entrada?+
A geração de tokens exige mais computação do que a leitura deles, portanto, os provedores cobram a produção de 3 a 6 vezes mais alta do que a entrada. Na maioria dos modelos, a duração da resposta é o maior fator de custo – encurtar os resultados geralmente economiza mais do que qualquer outra alteração. Observe o gráfico detalhado por solicitação para ver quanto do seu custo é produzido.
O que é cache imediato e quanto ele economiza?+
O cache de prompt armazena o prefixo estável da sua solicitação (prompt do sistema, instruções, contexto longo) para que solicitações repetidas não o reprocessem. Os tokens armazenados em cache são lidos a aproximadamente 10% do preço de entrada. A economia depende de quanto de sua entrada é um prefixo reutilizado – armazenar em cache um contexto grande e fixo pode reduzir o custo de entrada em até cerca de 90%. Há um pequeno prêmio único de gravação em cache, por isso compensa com a reutilização frequente.
Quão preciso é o estimador de token?+
Ele usa a regra prática padrão – cerca de 4 caracteres ou 0,75 palavras por token para inglês – portanto, é uma boa estimativa de planejamento, mas não exata. Código, JSON, texto que não seja em inglês e palavras raras são tokenizados de maneira diferente. Para contagens precisas, utilize o tokenizer ou o ponto final de contagem de tokens do fornecedor do modelo antes de finalizar um orçamento.
Esses preços são atuais?+
A lista de modelos e preços foram verificados em 29 de agosto de 2026 e estão mantidos em uma única tabela claramente datada no código da calculadora. Os preços do provedor mudam regularmente, portanto, sempre verifique as páginas oficiais de preços (platform.claude.com, developers.openai.com, ai.google.dev) antes de confiar em um valor para o orçamento.
Posso compartilhar minha estimativa com um colega?+
Sim. A calculadora codifica seu modelo, contagens de tokens, volume e configuração de lote no URL da página, portanto, clicar em Compartilhar (ou copiar o link) permite que um colega abra exatamente o mesmo cenário. Suas entradas também são salvas localmente em seu navegador para que persistam entre visitas no mesmo dispositivo.
📄
Salvar e compartilhar
Receba um PDF personalizado com seus resultados
Baixe na hora um PDF de uma página com seus resultados. Informe seu e-mail para receber também dicas ocasionais sobre nossas calculadoras — sem spam e com opção de cancelamento a qualquer momento. Privacidade.