LangChain evaluó NVIDIA NeMo Switchyard—una biblioteca de ruta de modelos de código abierto que selecciona automáticamente qué modelo maneja cada paso de un flujo de trabajo de agente—en su suite de evaluación interna Deep Agents de 145 tareas agentic multi-turn promediando 6,3 llamadas de modelo cada una. Las tareas mapean cargas de trabajo de producción: soporte al cliente bajo restricciones de política, investigación de incidentes on-call y automatización de flujo de trabajo multi-etapa. Los resultados mostraron que el enrutamiento entre un modelo abierto de 30B parámetros (Nemotron 3.5 Lightning) y Claude Opus 4.8 logró una reducción de costo del 74% en comparación con ejecutar Opus solo, manteniendo el 93% de su precisión.
La estrategia de enrutamiento funcionó enviando el 93% de las llamadas a Nemotron 3.5 Lightning (que manejaba el 10,4% del gasto) y escalando solo el 7% a Opus (que representaba el 68,4% del gasto). El enrutador de escalada de LangChain comienza cada tarea en el modelo más barato y promueve sesiones al modelo fronterizo después de dos veredictos negativos consecutivos de un pequeño modelo juez. Para las mismas tareas completadas, el costo por ejecución cayó de $11,45 (Opus solo) a $3,00 (enrutado) a $0,72 (Lightning solo), con precisión declinando del 86% al 80% en el caso enrutado—un canje de seis puntos.
Para arquitectos: este benchmark valida que los modelos fronterizos no son uniformemente necesarios en flujos de trabajo agentic. Las reducciones en el consumo de tokens y la lógica de enrutamiento en la capa de orquestación importan más para el control de costos que la velocidad de modelo bruto. Los equipos que consideran implementaciones de agentes deben calcular si los ahorros de costos justifican compromisos de precisión utilizando la fórmula proporcionada por LangChain (costo dividido por la brecha de precio), ya que la viabilidad del enrutamiento depende de la proximidad de precio del modelo.