Databricks realizou a Grounded Reasoning Cup inaugural, uma competição de agentes ao vivo testando 11 times académicos em sua habilidade de raciocínio sobre coleções de documentos empresariais. O time de Stanford venceu com 63,3% de precisão em um benchmark previamente não visto (120.000 páginas de documentos do Tesouro dos EUA), superando a linha de base média de agentes de fronteira (menos de 30%) por 35 pontos e outros times por 22 pontos. A competição executou seis rodadas de 15 minutos com perguntas progressivamente mais difíceis, com times tendo apenas 36 horas para indexar e se preparar no novo corpus.
A descoberta-chave: generalização de benchmark é frágil. Times desenvolveram e otimizaram em OfficeQA mas descobriram que melhorias não se transferiam confiavelmente para a nova tarefa. A lacuna média entre o melhor e pior time usando o mesmo modelo de fronteira era de 30,4 pontos—sublinhando que arquitetura de sistema (parsing, retrieval, verificação, composição de ferramentas, paralelismo) importa tanto quanto o LLM subjacente. Dezoito por cento de todas as perguntas não foram resolvidas por nenhum time, indicando espaço substancial para melhoria contínua em raciocínio de documento empresarial.
A abordagem vencedora de Stanford combinou uma biblioteca de habilidades reusáveis, estratégias de fallback direcionadas para diferentes representações de documento, decomposição de agente paralela, uso de ferramenta estruturada e loops de verificação end-to-end. Os resultados enfatizam que raciocínio grounded empresarial não é um problema puro de capacidade de modelo; requer orquestração cuidadosa de retrieval, parsing, padrões de uso de ferramentas e validação.
Este padrão se alinha com sinais mais amplos: agentes de fronteira exibem forte capacidade zero-shot mas requerem ajuste substancial para generalização de domínio. Para arquitetos construindo sistemas de raciocínio de documento de produção ou aplicações de busca empresarial, a lacuna de habilidade de 30 pontos e taxa de 18% não resolvida sugerem que avaliação em domínios retidos e orquestração multi-agente são essenciais antes do deployment.