Investigadores de Snowflake y la Universidad de Washington lanzaron MidTool el 20 de agosto, un corpus abierto de 20.3B-token y un pipeline para entrenar LLMs en el uso de herramientas entre pretraining y fine-tuning específico de tareas. El mid-training de Qwen3-4B-Base y Qwen3-8B-Base en MidTool-Mix produjo modelos que superan los lanzamientos instruction-tuned oficiales de Qwen3 en MCP Universe en ambos conteos de parámetros, antes de cualquier post-training específico de tareas.

La afirmación central: el conocimiento para el tool-use confiable—cuándo llamar una función, cómo extraer argumentos del contexto ruidoso, cómo recuperarse cuando falta un campo—reside en documentación de desarrolladores, especificaciones de API, repositorios de código y PDFs, no en trayectorias de agentes curadas. El post-training ve muy poco de este material demasiado tarde. MidTool adelanta la exposición.

El pipeline construye MidTool-Mix a partir de cuatro fuentes: páginas web, PDFs, repositorios de código y artefactos de herramientas estructuradas. Dos ramas de síntesis convierten el material bruto en señal de entrenamiento. El aumento de trayectoria con grounding de contexto toma documentación y código para producir supervisión para reconocer límites de herramientas, inferir parámetros y reconstruir la estructura de workflow a partir de texto desordenado e incompleto. La síntesis de trayectoria agentic nativa construye trayectorias multi-turn ejecutables a partir de APIs en vivo y definiciones de skill de MCP, con validación explícita de schema grounding, completitud de argumentos, ordenamiento de turnos y consistencia de tool-response.

El corpus se enfoca en cuatro capacidades atómicas: reconocer affordances de herramientas del lenguaje natural, grounding de call arguments del contexto largo ruidoso, componer múltiples herramientas en workflows secuenciales y recuperarse cuando falta información requerida. Estos se mapean directamente a modos de fallo en producción—JSON malformado en schemas anidados, valores de argumentos alucinados, tareas abandonadas cuando una API retorna null. El SFT estándar aborda el camino feliz; MidTool codifica casos de error.

Después del mid-training, el equipo aplica post-training convencional bajo SFT y RL, evaluando en BFCL, τ²-Bench y MCP Universe. MidTool-Mix mejora los resultados en ambos pipelines en los tres benchmarks. El titular: los modelos 4B y 8B con mid-training superan los modelos instruction-tuned oficiales de Qwen3 en MCP Universe. El paper presenta el mid-training como compuesto con, no como sustitución de, post-training—la etapa mid-training instala un prior estructural que mejora la eficiencia del SFT y RL posteriores.

Un paper relacionado de mid-training (arxiv 2607.12463) probó un corpus de FIM solo Python en agentes de coding y encontró ganancias transferidas a τ-bench y BFCL a pesar de no contener trayectorias de tool-use. El mecanismo propuesto: las llamadas de función y los pasos de action-observation del agente comparten una estructura de cuatro partes. MidTool se dirige a este isomorfismo directamente, explicando el tamaño de 20.3B-token versus el corpus de coding de 2.6B-token—el conocimiento de tool-use es más heterogéneo que la estructura de código.

El corpus, modelos y pipeline se publican en hf.co/collections/MidTool/midtool-release. Para arquitectos que deciden si incorporar tool-calling en un modelo base antes de fine-tuning específico de tareas, MidTool proporciona una receta reproducible con pesos públicos en dos escalas de parámetros que realizan benchmark contra un baseline oficial.