A equipe de análise da Grab reduziu a participação do trabalho mecânico realizado por analistas humanos de 44% para 30% entre fevereiro e junho de 2026. A queda de 14 pontos percentuais foi impulsionada pela delegação agentica em preparação de dados, alertas e relatórios. O resultado é um gargalo menor de analistas e uma separação mais clara entre o que as máquinas devem gerenciar e o que ainda requer julgamento humano.

A arquitetura funciona em uma escada de autonomia de cinco níveis, emprestada de estruturas de codificação com IA. No Nível 3 — onde a maioria das cargas de trabalho de produção da Grab está — humanos definem a pergunta e revisam o resultado. Agentes lidam com tudo no meio: descoberta de dados, autoria de consultas, execução, verificação de sanidade e redação de rascunhos. O Nível 4 desloca o planejamento e a orquestração para o agente; humanos revisam em portões definidos em vez de a cada passo. O Nível 5 é autonomia ponta a ponta com humanos definindo objetivos, limiares de qualidade e regras de escalação. A responsabilidade humana por definições de métricas, interpretação causal e decisões finais é explicitamente preservada em cada nível.

O sistema central é Spartan, um fluxo de trabalho de análise agentico ponta a ponta integrado no Slack. Ele roteia solicitações em linguagem natural através de 50+ habilidades e 120+ estruturas de análise. Uma pergunta de causa raiz—"por que a receita caiu no segmento de mercado médio das Filipinas nas duas últimas semanas de junho?"—dispara um caminho de diagnóstico através de segmento, mercado e tipo de campanha contra métricas certificadas. Uma pergunta sobre experimento puxa um scorecard pré-computado da plataforma de experimentos em vez de re-consultar o data lake. A distinção de roteamento é importante: o sistema evita computação desnecessária lendo a intenção da pergunta antes de tocar em qualquer dado.

A base de dados que sustenta Spartan é deliberadamente pesada. Grab mantém 5.000+ tabelas e métricas certificadas, 4.000 documentos de contexto e 2.000 registros dourados. ContextIQ — a plataforma que gerencia essa camada — trata o contexto como tendo um ciclo de vida em vez de um documento estático. Uma habilidade lê uma especificação de instrumentação de entrada, propõe as mudanças SQL que se seguem e atualiza o documento de contexto na mesma passagem. A equipe declarou a razão: "Um agente que não conhece a granularidade de uma métrica, suas exclusões e ressalvas vai adivinhar e confiantemente produzir saídas erradas em velocidade e em escala." Contexto é o teto da qualidade do agente; cada falha de produção alimenta de volta para ele.

Scarlet, um agente separado, cobre o lado das operações. Ele lida com falhas de pipeline executando análise de causa raiz, aplica correções de runbook documentadas automaticamente e escala quando nenhum portão definido ou runbook cobre o problema. Exceções aparecem no Slack. Tempos de ciclo nas operações de análise caíram aproximadamente 33% comparando Q1 para Q2 2026.

Os números de autoatendimento revelam a parte mais aguda da história. Entre março e maio, a participação de threads de análise resolvidas sem qualquer envolvimento humano aumentou de 53% para 67% para perguntas de métricas, 63% para 90% para extrações de dados e 50% para 81% para solicitações SQL. Três quartos dos threads agora originam-se fora da equipe de análise—de vendedores de anúncios, gerenciadores de campanhas e equipes de país. 85% recebem uma primeira resposta em menos de um minuto. O portal BriX, que hospeda desenvolvimento de fluxos de trabalho de análise, cresceu mais de 10× em uso desde setembro e enviou 31 implantações de produção, 283 pull requests e 60 recursos em H1.

O líder de análise da Grab, Maanas Prabhakar, levantou a tensão central: "A pergunta mais difícil é o que um analista faz quando um agente lida com a preparação de dados, a análise e tudo mais." A resposta da Grab é que os analistas possuem definição do problema, definições de métricas, a história causal por trás de um movimento, suposições de negócio e a decisão de ir/não ir — o loop, não os passos dentro dele.

Para equipes de plataforma ML que avaliam delegação agentica: o resultado 44-para-30 requer uma base de 5.000 métricas certificadas. Instrumente sua camada de dados antes de instrumentar seus agentes.