Esta calculadora estima quanto custa por mês rodar um fluxo em uma API de inteligência artificial. Você informa quantos tokens entram e saem em cada chamada, quantas chamadas acontecem no mês e a cotação do dólar; ela devolve o custo por chamada, o custo mensal e anual em dólar e em real, e mostra qual parte da conta vem da resposta do modelo. O cálculo roda no navegador.
O que é um token, na prática
Modelos de linguagem cobram por token, não por palavra. Um token é um pedaço de texto de mais ou menos quatro caracteres em português — uma palavra curta costuma ser um token, uma palavra longa ou com acento pode ser dois ou três. Uma página de texto (cerca de 500 palavras) fica na casa de 700 a 900 tokens.
Duas contagens diferentes entram na fatura:
- Entrada: tudo que você envia — instruções, exemplos, o documento colado, o histórico da conversa.
- Saída: tudo que o modelo devolve. Em modelos que raciocinam antes de responder, esse raciocínio interno também é cobrado como saída, mesmo quando não aparece na tela.
A saída custa várias vezes mais caro que a entrada. Por isso a calculadora mostra a parcela da saída no custo: quando ela passa de 60%, pedir respostas mais curtas economiza mais do que enxugar o prompt.
A tabela de preços usada aqui
| Modelo | Entrada (US$/milhão) | Saída (US$/milhão) |
|---|
| Claude Opus 5 (Anthropic) | US$ 5.00 | US$ 25.00 |
| Claude Sonnet 5 (Anthropic) | US$ 2.00 | US$ 10.00 |
| Claude Haiku 4.5 (Anthropic) | US$ 1.00 | US$ 5.00 |
Valores conferidos na página oficial de preços do fornecedor em 6 de setembro de 2026. Só listamos o que conseguimos confirmar na fonte: para qualquer outro modelo ou fornecedor, escolha "Outro modelo" e copie os dois números da página de preços da sua conta. Preço de API muda com frequência — confirme antes de fechar um orçamento.
Cache de entrada: a economia que quase ninguém liga
Quando o começo do seu prompt se repete a cada chamada (as mesmas instruções, o mesmo catálogo, o mesmo manual), a maioria dos fornecedores permite cachear esse trecho e cobra a leitura por uma fração do preço cheio — a referência usada aqui é 10%.
Em um assistente que carrega o mesmo manual de 20 mil tokens em toda conversa, isso muda a ordem de grandeza da conta. O campo "entrada servida de cache" estima esse ganho. Duas regras práticas: coloque o conteúdo estável no começo do prompt e o que muda no fim, e verifique nos relatórios de uso se o cache está realmente sendo lido — um carimbo de data ou um identificador aleatório no meio do bloco estável invalida tudo o que vem depois.
De estimativa para orçamento
Três motivos fazem o consumo real ficar acima da primeira estimativa: pedidos maiores do que a média, chamadas que rodam de novo porque a primeira falhou ou veio incompleta, e testes durante o desenvolvimento. Some de 20% a 30% de folga antes de prometer um custo a um cliente, e reveja o número depois do primeiro mês com a fatura na mão.
Se o custo vai virar preço, jogue o resultado na calculadora de preço para serviços de IA: ela transforma custo de API, horas e margem no valor a cobrar pelo projeto.
Preços de ferramentas e de APIs são os publicados pelos fornecedores na data indicada em cada página e mudam sem aviso — confirme na fonte antes de decidir. Nenhum valor citado aqui é garantia de faturamento.