aiexpert
Inicio / Noticias / Nota
Research · 18 ago 2026, 10:34 · 4 fuentes

Grounded Reasoning Cup: Stanford gana con 63,3% en documentos del Tesoro no vistos; baselines fronterizo rezagado a <30% precisión

Databricks realizó la Grounded Reasoning Cup inaugural, una competiçón de agentes en vivo evaluando 11 equipos académicos en su capacidad para razonar sobre colecciones de documentos empresariales. El equipo de Stanford ganó con 63,3% de precisión en un benchmark previamente no visto (120.000 páginas de documentos del Tesoro de EE.UU.), superando la línea de base promedio del agente fronterizo (menos del 30%) por 35 puntos y otros equipos por 22 puntos. La competencia ejecutó seis rondas de 15 minutos con preguntas progresivamente más difíciles, con equipos teniendo solo 36 horas para indexar y prepararse en el nuevo corpus.

El hallazgo clave: la generalización de benchmarks es frágil. Los equipos desarrollaron y optimizaron en OfficeQA pero descubrieron que las mejoras no se transferían de manera confiable a la nueva tarea. La brecha promedio entre el mejor y el peor equipo usando el mismo modelo fronterizo fue de 30,4 puntos—subrayando que la arquitectura del sistema (parsing, recuperación, verificación, composición de herramientas, paralelismo) importa tanto como el LLM subyacente. Dieciocho por ciento de todas las preguntas no fueron resueltas por ningún equipo, lo que indica un espacio sustancial para mejorar continuamente el razonamiento de documentos empresariales.

El enfoque ganador de Stanford combinó una biblioteca de habilidades reutilizables, estrategias de respaldo dirigidas para diferentes representaciones de documentos, descomposición de agentes paralelos, uso de herramientas estructurado y bucles de verificación de extremo a extremo. Los resultados enfatizan que el razonamiento grounded empresarial no es un problema puro de capacidad del modelo; requiere una orquestación cuidadosa de recuperación, parsing, patrones de uso de herramientas y validación.

Este patrón se alinea con señales más amplias: los agentes fronterizos muestran una fuerte capacidad de zero-shot pero requieren ajuste sustancial para la generalización del dominio. Para arquitectos que construyen sistemas de razonamiento de documentos de producción o aplicaciones de búsqueda empresarial, la brecha de habilidad de 30 puntos y la tasa del 18% sin resolver sugieren que la evaluación en dominios retenidos y la orquestación multiagente son esenciales antes del despliegue.

Fuentes

Todo lo que sostiene esta nota
  1. 01 Primary source databricks.com
  2. 02 databricks.com databricks.com “Stanford won with 63.3% accuracy, beating average team by 22 points, average frontier baseline by 35 points. Average frontier agent offline baseline less than 30% accuracy.”
  3. 03 databricks.com databricks.com “Generalization cannot be assumed. Techniques on OfficeQA did not always transfer to new benchmark. 18.8% of questions went unsolved by all teams. Average gap between top and lowest scoring teams using same model was 30.4 points.”
  4. 04 databricks.com databricks.com “Competition used U.S. Treasury Accounts of Receipts and Expenditures (120,000 pages). Teams had 36 hours of prep. Six 15-minute rounds with 15 questions per round, progressively harder.”