O custo de tokens em uma API de LLM depende do modelo, do volume de tokens de entrada e de saída e de cobranças adicionais por recursos como cache, processamento em lote e ferramentas. Para reduzir a conta, meça o custo por tarefa concluída — não apenas o preço por milhão de tokens — e aplique cada recurso quando sua latência e seu padrão de uso fizerem sentido.
O que entra no custo de tokens de um LLM
Em APIs, a cobrança costuma separar tokens de entrada e de saída, com tarifas que variam por modelo. A entrada pode incluir instruções, histórico da conversa e documentos enviados; a saída inclui o que o modelo gera. Os endpoints de API não são necessariamente cobrados como produtos separados: consulte a tabela oficial do fornecedor e do modelo que pretende usar. A tabela de preços da OpenAI e a do Gemini Developer API são exemplos de fontes oficiais.
Não estime o gasto apenas pela tarifa de entrada. Modelos diferentes podem tokenizar o mesmo texto de formas distintas e gerar volumes diferentes de resposta ou raciocínio. Por isso, um preço unitário menor por milhão de tokens não garante um custo total menor por tarefa. A orientação do OpenAI Help Center sobre tokens destaca essa diferença.
- Entrada: instruções, contexto, histórico e documentos enviados para cada chamada.
- Saída: texto gerado e, conforme o modelo e as regras de cobrança, tokens de raciocínio ou de outras modalidades.
- Recursos adicionais: ferramentas, cache ou armazenamento podem ter tarifas próprias além da inferência.
As categorias e os critérios variam entre provedores e modelos. Por exemplo, a tabela do Gemini consultada em 4 de outubro de 2026 informa que o preço de saída indicado para certos modelos inclui tokens de pensamento; não se deve presumir que a mesma regra vale para outros modelos ou fornecedores.
Quick wins for a faster PC:
Scan for outdated or missing drivers - takes under a minuteDriver Scan →Clear out junk files and repair common Windows errorsFree Scan →#1 Best Overall
Por que uma chamada pode custar mais do que parece
Contexto reenviado
Em conversas longas, cada chamada pode reenviar instruções, histórico e documentos, acumulando tokens de entrada. Cache pode reduzir o custo de contexto repetido quando a chamada é elegível e há acerto, mas manter uma sessão aberta, por si só, não garante que isso aconteça.
Respostas extensas e raciocínio
Uma resposta longa consome mais tokens de saída. O modelo também pode ter regras próprias para contabilizar tokens de raciocínio. Definir formato e nível de detalhe esperados ajuda a evitar geração que não melhora o resultado, desde que os limites não prejudiquem a qualidade nem provoquem retrabalho.
Rank #2
Ferramentas e armazenamento
Pesquisa, grounding e outros recursos podem ser cobrados separadamente da inferência; o armazenamento de cache também pode entrar na conta. Ao estimar um fluxo, some essas linhas ao custo dos tokens, em vez de tratar a tarifa do modelo como o custo completo. A tabela de preços do Gemini e a documentação de cache do Gemini descrevem exemplos dessas regras.
Exemplo de preço: Gemini 3.8 Flash
A tabela oficial do Google AI for Developers consultada em 4 de outubro de 2026 lista os preços abaixo para o Gemini 3.8 Flash padrão pago e para Batch. São valores do modelo e das modalidades indicadas, não uma média de mercado; confirme a tarifa aplicável ao modelo, à região e à data de uso na página oficial de preços.
| Modalidade | Até 31 de dezembro de 2026, entrada | Até 31 de dezembro de 2026, saída | A partir de 1º de janeiro de 2027, entrada | A partir de 1º de janeiro de 2027, saída |
|---|---|---|---|---|
| Padrão pago | US$ 0,75 por milhão de tokens | US$ 3,75 por milhão de tokens | US$ 1,50 por milhão de tokens | US$ 7,50 por milhão de tokens |
| Batch | US$ 0,375 por milhão de tokens | US$ 1,875 por milhão de tokens | US$ 0,75 por milhão de tokens | US$ 3,75 por milhão de tokens |
O Google descreve Batch como processamento assíncrono e apresenta a modalidade como 50% do custo padrão na documentação consultada. Elegibilidade, limites e preço dependem da modalidade e do modelo; consulte a documentação de otimização do Gemini antes de planejar uma fila de trabalho.
Como reduzir desperdício sem comprometer o resultado
- Meça por tarefa e categoria. Registre modelo, tokens de entrada e saída, tokens em cache, ferramentas chamadas e custo final. Compare o gasto por resultado útil, não apenas por chamada.
- Enxugue o contexto. Remova histórico sem relação com a tarefa, documentos duplicados e instruções repetidas que não alteram a resposta. Preserve as informações necessárias para manter precisão e qualidade.
- Estruture conteúdo reutilizável para cache. Quando a documentação do fornecedor indicar que prefixos compartilhados favorecem o cache, mantenha instruções e conteúdo estável no início do prompt. Verifique os dados de uso para confirmar acertos: a reutilização não é garantida. A OpenAI informa que prompt caching está habilitado por padrão em modelos compatíveis e pode reduzir em até 95% a tarifa dos tokens de entrada armazenados em cache; isso não é uma economia garantida para toda chamada. Consulte a documentação de prompt caching da OpenAI e a documentação de cache do Gemini para as condições de cada serviço.
- Use Batch quando a resposta não precisar ser imediata. Classificação em escala, sumarização em lote e outras filas offline podem ser candidatas se o processamento assíncrono atender ao prazo. Avalie qualidade, limites e tempo de espera junto com a tarifa na documentação de otimização do Gemini.
- Escolha o modelo pela tarefa real. Compare modelos com uma amostra representativa e critérios de qualidade definidos. Considere tentativas, retrabalho e tamanho médio das respostas; o rótulo “mini” ou uma entrada barata, isoladamente, não prova que uma opção será mais econômica.
- Especifique a saída necessária. Peça o formato, a extensão e o nível de detalhe adequados. Verifique se limitar a saída não reduz a precisão nem aumenta o retrabalho.
- Inclua ferramentas e armazenamento no orçamento. Some custos de pesquisa, grounding e duração de cache quando aplicáveis, além das tarifas de inferência.
Como comparar modelos e provedores
Compare fluxos equivalentes com entradas representativas e os mesmos critérios de qualidade. Use os itens abaixo para identificar custos que uma tarifa por milhão, sozinha, não mostra.
| Eixo | O que verificar |
|---|---|
| Entrada e saída | Preço por milhão e tratamento de tokens de raciocínio, imagem, áudio ou documentos. |
| Cache | Tarifa de leitura, elegibilidade, requisitos de prefixo e eventual cobrança de armazenamento. |
| Batch | Desconto, latência, limites e modelos elegíveis. |
| Ferramentas | Cobrança separada por pesquisa, grounding, execução ou modalidades. |
| Adequação | Qualidade na tarefa real, tokens médios de saída e necessidade de tentativas ou retrabalho. |
| Condições comerciais | Região, nível de serviço e data efetiva da tarifa. |
Os preços e as condições mudam. As tabelas da OpenAI e do Google Gemini permitem conferir os valores publicados para esses serviços, mas não formam um ranking completo de todos os provedores.
Quick Recap
Product prices and availability are accurate as of the date/time indicated and are subject to change. Any price and availability information displayed on Amazon at the time of purchase will apply.

