Provedores derrubaram preço, builders aprenderam a cortar tokens, e a Uber lembrou todo mundo que ROI de IA continua mais frágil do que o hype sugere — tudo na mesma semana.
Quatro meses.
Foi o tempo que a Uber levou para queimar o orçamento de IA de 2026 inteiro. E o CEO admitiu em público: ninguém consegue provar a ligação entre token consumido e feature útil entregue ao consumidor.
Esta é a Wire #14 da ai|expert. O dia em que o custo do token parou de ser detalhe de engenharia e virou KPI de board.
Vamos começar pelo paradoxo desta semana. A Anthropic lançou o Claude Opus 4.8 com o preço do fast mode cortado em dois terços — de 30 para 10 dólares por milhão de tokens de entrada. No mesmo dia, o GitHub publicou o playbook que reduziu o gasto em tokens de workflows agênticos em até 62%. E ainda assim, na Uber, o orçamento anual de IA foi a zero antes do fim de abril. Três histórias que só fazem sentido quando você as coloca em sequência.
O Opus 4.8 tem números que justificam a atenção. 69,2% no SWE-Bench Pro — contra 58,6% do GPT-5.5 e 54,2% do Gemini 3.1 Pro. 84% no Online-Mind2Web de uso de computador. 88,6% no SWE-bench Verified. O fast mode agora custa 10 dólares por milhão de tokens de entrada e 50 por milhão de saída — contra 30 e 150 do Opus 4.7. Para quem roda loops agênticos com muitos turnos curtos, esse corte de dois terços no fast mode muda a planilha de custo de forma direta. A Databricks reportou 61% de redução de custo por token ao migrar para o 4.8 em workloads multimodais com PDFs e diagramas. [ref: anthropics-claude-opus-48-clai]
A Anthropic também entregou duas funcionalidades operacionais que somam. A Messages API agora aceita entradas de sistema dentro do próprio array de mensagens — o agente pode atualizar instruções no meio da tarefa sem quebrar o cache de prompt. E o "dynamic workflows" no Claude Code: o modelo planeja a tarefa, distribui o trabalho entre subagentes paralelos, e esses subagentes verificam e contestam as conclusões uns dos outros antes de convergir. É auto-revisão distribuída — mas o aviso da Anthropic é que o consumo de tokens pode superar significativamente uma sessão normal do Claude Code.
Tem uma sinalização no system card que merece atenção antes de colocar em produção. A Anthropic identificou uma tendência crescente de o modelo especular sobre quem está avaliando sua resposta — presente em cerca de 5% dos episódios de treinamento. Por enquanto não virou comportamento ruim observável; o Opus 4.8 faz menos afirmações enganosas de sucesso do que versões anteriores. Mas para pipelines de agente jurídico ou de auditoria, monitore drift de calibração.
O GitHub transformou esse cenário em problema de engenharia resolvível. Um proxy de API intercepta cada chamada dos CLIs — Claude, Copilot, Codex — e gera um artefato de uso por execução. Dois agentes rodam diariamente: um auditor que agrega consumo por workflow e sinaliza picos anômalos, e um otimizador que abre issues no próprio repositório propondo correções específicas. Resultado, medido em doze workflows internos ao longo de pelo menos 109 execuções pós-correção: Auto-Triage Issues caiu 62%. Smoke Claude, 59%. Security Guard, 43%. [ref: github-reduces-agentic-token-c]
A métrica que o GitHub usa — Effective Tokens — pondera output a 4x, leitura de cache a 0,1x, com multiplicador por modelo: Haiku em 0,25x, Sonnet em 1x, Opus em 5x. Uma queda de 10% nos Effective Tokens é uma queda de 10% no custo, independente do modelo. Uma unidade que vai direto ao board sem precisar de tradução. A filosofia que eles documentaram é simples: "The cheapest LLM call is the one you don't make."
E é exatamente esse controle que faltou na Uber.
A Uber implantou o Claude Code para 5.000 engenheiros em dezembro. Em março, 84% eram usuários de coding agêntico. Em abril, 95%. 70% do código commitado veio de IA. 11% das atualizações de backend em produção foram executadas por agentes sem revisão humana. O custo de IA subiu seis vezes desde 2024, sobre uma base de P&D de 3,4 bilhões de dólares. [ref: uber-pumps-brakes-on-ai-spendi]
O COO Andrew Macdonald disse no Rapid Response: "That link is not there yet" — nenhuma evidência de ligação entre token consumido e feature útil ao consumidor. E o que agravou foi a estrutura de incentivo: leaderboards internos que ranqueavam engenheiros por uso de IA. Mais tokens, posição mais alta. Você criou um sistema que recompensava gasto, não resultado. A Duolingo enfrentou o equivalente — avaliou engenheiros pelo consumo de ferramentas de IA e teve que recuar depois de resistência interna.
O dado macroeconômico fecha o quadro. Custos de token enterprise caíram 67% em doze meses — de 18,40 para 6,07 dólares por milhão em média. Mas 95% do volume ainda roda nos modelos frontier mais caros, mesmo para tarefas que não precisam disso. O gasto médio por organização subiu 108% ano a ano, chegando a 1,2 milhão de dólares. 78% dos líderes de TI toparam com cobranças que nunca tinham orçado. Preço caiu. Volume explodiu. A conta subiu. [ref: cnbc-signals-enterprise-cost-m]
Então o board vai perguntar: onde está o roteamento?
Arquiteturas com tiered intelligence stack estão atingindo custo médio de 2,31 dólares por milhão de tokens — contra 18,40 de uma stack frontier-only. Diferença de 87%. O OpenRouter, que levantou 113 milhões de dólares em maio e processa cerca de 25 trilhões de tokens por semana — cinco vezes mais do que seis meses atrás — existe para resolver esse roteamento em produção. Modelos open-weight capturaram 38% do volume de tokens enterprise no Q1 de 2026, ante 11% um ano antes. O deslocamento está acontecendo — mas a maioria das empresas ainda não construiu o harness de evals necessário para confiar endpoints mais baratos com tráfego crítico.
Tudo que ficou mais barato no bloco anterior precisa de hardware para rodar. Esta semana, quatro histórias mapeiam a oferta que sustenta — ou trava — essa capacidade.
A AWS revelou que o RNG — Resilient Network Graph — é agora a arquitetura padrão para a maioria das novas construções globalmente, após piloto em Dublin em 2024. A topologia substitui a fat-tree hierárquica por uma malha quasi-aleatória com switches commodity e painéis ópticos passivos chamados ShuffleBoxes. Os números declarados: 69% menos hardware de rede, 33% mais throughput, 40% menos consumo de energia de rede. [ref: amazons-resilient-network-grap]
O protocolo Spraypoint distribui pacotes aleatoriamente para vizinhos até que um waypoint associado ao destino seja atingido — sem silicon customizado. Isso gera quase o dobro de caminhos independentes entre roteadores. Mas os arquitetos precisam de cautela: o artigo acadêmico não publica latência p99 para diferenciais de hop count, e não há evidência publicada de integração com RDMA ou RoCE. O ganho de throughput é real na infraestrutura da AWS. O impacto direto em clusters de inferência ainda é teórico.
Na Dell, os números do Q1 fiscal 2027 mostram o outro lado da equação. Receita total de 43,84 bilhões de dólares, alta de 88% ano a ano — o crescimento mais rápido desde o IPO de 2018. Receita de servidores de IA: 16,1 bilhões, alta de 757%. A projeção anual foi revisada de 50 para 60 bilhões de dólares. [ref: dell-q1-beats-on-ai-server-dem]
Mais de 5.000 clientes de servidor de IA no trimestre — neoclouds, entidades soberanas, enterprises. E o COO Jeff Clarke disse que estão "repricing every day" por causa do ambiente inflacionário de componentes que começou em janeiro de 2026. DRAM, NAND, CPUs x86 e discos rígidos estão sob restrição de oferta no segundo semestre de 2027. Se você não tem contrato de longo prazo firmado agora, está na fila de alocação atrás de quem tem — e a cotação desta semana pode não ser válida no próximo mês.
Para quem quer escapar dessa fila, uma alternativa on-prem ganhou viabilidade real esta semana.
Quatro Mac Studio M3 Ultra com 512 GB de RAM cada — custo total em torno de 38 mil dólares — rodando DeepSeek V3.1 671B a aproximadamente 25 tokens por segundo e Kimi K2, um MoE de um trilhão de parâmetros, a cerca de 34 tokens por segundo. Sem API de nuvem, sem egress de dados. O que tornou isso viável agora é o RDMA sobre Thunderbolt 5, que a Stabilise.io mediu em 5 a 9 microssegundos de latência entre nós a 80 gigabits por segundo. [ref: the-10k-sovereign-ai-cluster-h]
O argumento de compliance é arquitetural, não de benchmark: pesos e prompts nunca saem do prédio. Para equipes sob GDPR, HIPAA ou NIS2, essa propriedade pode superar qualquer vantagem de throughput de cloud.
Mas o limite é claro. Esses clusters são mais adequados para inferência em batch do que para chat interativo. O setup de RDMA exige comandos manuais no modo de recuperação do macOS. Frameworks Apple Silicon ainda ficam atrás do vLLM em performance absoluta. Para modelos MoE, o tempo de comunicação se aproxima do tempo de computação durante o roteamento de experts — exige tuning manual da camada de memória. É viável. Não é plug-and-play.
E a Lombardia fecha o mapa europeu com uma surpresa regulatória. O conselho regional aprovou sobretaxa de 200% sobre data centers em zonas agrícolas e 100% em zonas rurais. Com 30 GW de capacidade solicitada em toda a Itália e a região autorizando apenas 2 GW — o conselheiro Massimo Sertori chamou de "projetos reais e concretos" — a taxa de sobrevivência do pipeline planejado está em dígito único. A lei nacional cortou o prazo de licenciamento para 10 meses. Mas a lei regional obliterou a economia dos terrenos que os operadores queriam usar. [ref: italy-imposes-200-tax-on-data-]
O takeaway para quem modela expansão europeia é direto: classificação de uso do solo é variável de custo primária antes de assinar qualquer opção de terreno em Lombardia. Brownfield industrial é o único caminho economicamente viável. Uma sobretaxa de 200% sobre greenfield rural, combinada com um teto de autorização de 2 GW contra um pipeline regional de mais de 15 GW, elimina todo o resto.
O custo do token virou linguagem de board — e quem não tiver o equivalente a um Effective Tokens na planilha antes da próxima rodada de aprovação vai repetir o erro da Uber. Na sexta, a Edition vai fundo nos evals de produção e no que o caso Pymetrics e o MDASH da Microsoft revelam sobre auditar agentes antes que eles auditem você. Boa semana.