More in
Notícias de AI no Trabalho
A OpenAI Abriu a Publicidade no ChatGPT para Pequenas Empresas com Qualquer Orçamento
jun 6, 2026
AI Está em Todo Lugar no Trabalho. Apenas 1 em 10 Diz que Transformou o Emprego
jun 6, 2026
O Momento de US$ 10,5B do Vibe Coding: AI Agora Inicia a Maioria dos Novos Projetos de Software
jun 6, 2026
Agentes de AI Agora Têm Mais Acesso ao Sistema do que Seus Funcionários. Poucos Estão Protegidos
jun 5, 2026
Você Deve Construir Sua AI ou Comprá-la? Observe o que os Gigantes Compraram.
jun 5, 2026
A Uber Limitou os Gastos de AI por Funcionário a US$ 1.500 por Assento Após um Estouro de Orçamento
jun 5, 2026
O Decreto Executivo de AI de Trump é Desregulamentador. Seu Risco de Conformidade Não Mudou
jun 4, 2026
A AI Empurrou 220 Unicórnios Abaixo de US$ 1B. Empresas Pré-ChatGPT Enfrentam um Acerto de Contas
jun 4, 2026
Os Preços de Token Caíram 67% Este Ano. Sua Conta de AI Está Aumentando de Qualquer Forma
jun 3, 2026 · Currently reading
Pequenas Empresas que Usam AI Relatam Maior Receita e Jornadas de Trabalho Mais Curtas
jun 3, 2026
Os Preços de Token Caíram 67% Este Ano. Sua Fatura de AI Continua Subindo

Turn this article into takeaways for your work.
Each assistant summarizes the article only for you and suggests best practices for your work.
Seus fornecedores estão cotando preços menores. Sua equipe de finanças está sinalizando um item de AI maior. Ambos estão certos.
Isso não é uma contradição. É a armadilha de custos definidora da AI empresarial em 2026, e a maioria dos CEOs ainda não tem um framework para ela.
De acordo com uma análise da Fortune publicada em 22 de maio de 2026, a migração para fluxos de trabalho de inteligência artificial (AI) agêntica está fazendo o gasto total das empresas subir acentuadamente, mesmo com o custo unitário de inferência de AI continuando a cair. O problema não é o preço por token. É a quantidade de tokens que as cargas de trabalho modernas de AI consomem.
O Paradoxo de Jevons Está Controlando Seu Orçamento de AI

Os economistas têm um nome para esse padrão. O Paradoxo de Jevons estabelece que, quando um recurso fica mais barato, o consumo total tende a crescer mais rápido do que o preço cai, porque o custo menor viabiliza novos casos de uso que antes não eram possíveis. Carvão. Eletricidade. Banda larga. Agora tokens.
Os custos combinados de inferência de AI caíram aproximadamente 67% em relação ao ano anterior, passando de cerca de US$ 18,40 para US$ 6,07 por milhão de tokens entre o primeiro trimestre de 2025 e o primeiro trimestre de 2026, com base em análises de custos do setor em 2026. Trata-se de uma queda de preço genuína e expressiva.
Mesmo assim, 73% das empresas relataram em 2026 que seus custos reais de AI excederam as projeções originais. Essa diferença não é um erro de orçamento. É o Paradoxo de Jevons em ação: a AI mais barata permitiu que as empresas a implantassem em mais lugares, em mais cargas de trabalho complexas.
Fatos-chave
- Os preços de token caíram aproximadamente 67% em relação ao ano anterior (de US$ 18,40 para US$ 6,07 por milhão de tokens, do primeiro trimestre de 2025 ao de 2026). (Análises de custos do setor, 2026)
- 73% das empresas relataram que os gastos com AI excederam as projeções originais em 2026. (Análises de custos, 2026)
- Uma análise do Goldman Sachs projeta que a AI agêntica pode aumentar a demanda total de tokens em até 24 vezes. (Tom's Hardware, citando Goldman Sachs)
Por Que a AI Agêntica Estoura o Orçamento
Casos de uso simples de AI, como um chatbot respondendo a uma pergunta ou um modelo resumindo um documento, consomem tokens em uma única troca. Um prompt entra, uma resposta sai. Você consegue modelar esse custo em uma planilha.
As cargas de trabalho agênticas não funcionam assim. Um agente completando uma tarefa de forma autônoma dispara de 10 a 20 chamadas ao modelo por ação do usuário. Cada etapa do fluxo de trabalho é uma chamada de inferência separada. A geração aumentada por recuperação (RAG, na sigla em inglês), em que o modelo busca documentos relevantes para responder com precisão, infla as janelas de contexto de 3 a 5 vezes. Agentes de monitoramento sempre ativos operam continuamente, gerando tokens independentemente de um humano estar acompanhando.
O efeito cumulativo é significativo. Um único fluxo de trabalho agêntico que parece "uma tarefa" pode consumir cinquenta vezes mais tokens do que a mesma solicitação tratada por um modelo básico de chamada única.
Uma análise do Goldman Sachs divulgada pelo Tom's Hardware colocou um número nisso: a AI agêntica pode aumentar a demanda total de tokens nas empresas em até 24 vezes em comparação ao consumo atual. Não é uma previsão para um futuro distante. Empresas como a Uber já estão vivendo isso.
O diretor de tecnologia (CTO) da Uber revelou que a empresa consumiu todo o orçamento de AI de 2026 em quatro meses. A adoção interna do Claude Code, o assistente de programação de AI da Anthropic, saltou de 32% para 84% de cerca de 5.000 engenheiros. O custo mensal por engenheiro varia de US$ 500 a US$ 2.000, segundo os relatórios da Fortune e do Tom's Hardware. Com esse nível de adoção, em uma base de engenharia desse tamanho, o gasto se acumula rapidamente.
E como a Fortune relatou, a Microsoft reconheceu que, em algumas cargas de trabalho, o custo de processamento de AI supera o custo de um trabalhador humano para realizar a mesma tarefa.
O GitHub Mudou o Modelo de Cobrança. Outros Vão Seguir.
Essa realidade de custos está agora reformulando a forma como os fornecedores de AI estruturam seus contratos.
Em 1.º de junho de 2026, o GitHub migrou o Copilot de assinaturas de tarifa fixa para um modelo baseado em uso, usando "GitHub AI Credits" vinculados diretamente ao consumo de tokens. A Microsoft está migrando seu conjunto mais amplo de produtos Copilot para a mesma estrutura de créditos no mesmo período.
Isso importa para sua próxima negociação com fornecedores. O modelo de assentos fixos que tornava o orçamento de AI previsível como um gasto de SaaS está chegando ao fim. Você está entrando no território de utilidade medida, e a fatura escala com o uso, não com o número de pessoas.
Os modelos de governança de AI, abordados com mais profundidade em AI Agêntica e a Lacuna de Governança, não foram projetados para consumo medido. A maioria das empresas ainda não tem visibilidade de custo por fluxo de trabalho.
O Que Fazer a Respeito
Tokens mais baratos são uma vantagem real se você os capturar corretamente. Mas capturá-los exige tratar a infraestrutura de AI da maneira que você trata a computação em nuvem: como uma utilidade medida com controles de custo no nível do fluxo de trabalho, não como uma licença de assento fixo.
Aqui está um framework prático para começar.
Instrumente o custo de tokens por fluxo de trabalho antes de escalar. Você não pode otimizar o que não mede. Antes de expandir um fluxo de trabalho agêntico para toda a organização, meça o custo real por tarefa concluída. Compare isso com o equivalente em mão de obra humana. Alguns fluxos de trabalho mostrarão uma vantagem de custo de 10 vezes. Outros mostrarão o oposto.
Estabeleça orçamentos e guardrails para os agentes. Cada agente implantado deve ter um orçamento máximo de tokens por tarefa. Quando o agente ultrapassar esse limite, a tarefa deve ser escalada para um humano ou recair para um modelo mais barato. Isso é padrão no gerenciamento de custos de nuvem e deve ser padrão no gerenciamento de AI.
Decida quais fluxos de trabalho justificam o gasto agêntico. Nem toda tarefa precisa de um agente autônomo de várias etapas. Uma tarefa simples de classificação ou sumarização pode usar um modelo de chamada única a uma fração do custo. Modelos de pesos abertos mais baratos são cada vez mais viáveis para inferência de menor risco, como explorado na análise do Nemotron da Nvidia para CTOs. Combine o modelo com a complexidade do fluxo de trabalho.
Renegocie na renovação com dados de uso em mãos. Se seu fornecedor está migrando para cobrança baseada em créditos, seus dados de consumo do período de tarifa fixa são sua alavancagem de negociação. Saiba o que você tem consumido antes de concordar com uma nova estrutura de preços.
Trate a AI como uma utilidade, não como uma licença de software. As empresas de energia elétrica não vendem "eletricidade ilimitada" por uma mensalidade fixa. Os fornecedores de AI também não vão fazer isso depois que a adoção agêntica amadurecer. Construa seus processos internos de governança e finanças com base em contabilidade por consumo agora, antes de o modelo de cobrança mudar sob seus pés.
O dado do BCG AI Radar 2026 de que 90% dos CEOs esperam que a AI agêntica entregue ROI este ano sugere que a maioria das organizações está apostando pesado nessa tecnologia. Mas os cálculos de ROI que assumem precificação de tarifa fixa estarão errados. A estrutura de custos mudou. A estratégia precisa acompanhar.
Para uma visão mais ampla de como os relacionamentos com fornecedores de AI estão evoluindo, a análise de cálculo de fornecedores a partir do pedido de IPO da Anthropic aborda as implicações estratégicas de a AI se tornar um gasto de infraestrutura fundamental.
A Auditoria de Custo de Agente com 3 Perguntas
Antes de implantar qualquer fluxo de trabalho agêntico em escala, responda a estas três perguntas:
- Qual é o custo de tokens por tarefa concluída, medido em 100 execuções reais (não em demonstrações)?
- Esse custo supera a alternativa de mão de obra humana no seu volume atual, e em 10 vezes esse volume?
- Que limite de guardrail controla o custo quando o agente se comporta de forma inesperada ou o escopo da tarefa se expande?
Se você não consegue responder às três, o fluxo de trabalho não está pronto para produção em escala.
Perguntas Frequentes
Por que minha fatura de AI está subindo se os preços de token estão caindo?
Porque as cargas de trabalho modernas de AI consomem muito mais tokens do que os aplicativos de chat simples que a maioria dos modelos de orçamento assumia. Fluxos de trabalho agênticos disparam de 10 a 20 chamadas ao modelo por tarefa do usuário, e a geração aumentada por recuperação (RAG) expande as janelas de contexto de 3 a 5 vezes. O preço por token é menor, mas o volume consumido é dramaticamente maior. O gasto total sobe mesmo quando o preço unitário cai, o que é o Paradoxo de Jevons aplicado à infraestrutura de AI.
O que devo fazer antes da próxima renovação com meu fornecedor de AI?
Colete seus dados reais de consumo de tokens por fluxo de trabalho do período atual de tarifa fixa. À medida que os fornecedores migram para cobrança baseada em créditos, esses dados se tornam sua referência de negociação. Saiba o que você tem consumido antes de concordar com uma nova estrutura de preços.
Quais cargas de trabalho de AI não valem o gasto agêntico de tokens?
Tarefas de uma única etapa que não se beneficiam de cadeias de raciocínio: classificação de documentos, sumarização básica, extração de entidades, pontuação de sentimento. Essas podem rodar em modelos mais baratos de chamada única ou em alternativas de pesos abertos. Reserve o gasto agêntico de várias etapas para fluxos de trabalho em que o raciocínio autônomo realmente muda a qualidade da saída, como análises complexas, pesquisas com múltiplas fontes ou tarefas que exigem tomada de decisão sequencial.
Fonte: Fortune, 22 de maio de 2026 | Tom's Hardware | Duperrin, 1.º de junho de 2026
