LangChain lanzó Evaluadores Ajustados en LangSmith el 18 de agosto de 2026 — un juez administrado y post-entrenado que adjunta retroalimentación de calidad a cada conversación en producción sin requerir que los equipos construyan, etiqueten o mantengan un evaluador. El primer lanzamiento se orienta a Error Percibido: detección de conversaciones donde un agente cometió un error, malinterpretó una solicitud o llevó la interacción en la dirección equivocada.

Los equipos adjuntan un Evaluador Ajustado a un proyecto de rastreo LangSmith existente. LangSmith identifica threads elegibles — aquellos que contienen al menos dos pares de mensajes humano-IA que han alcanzado el período de inactividad configurado — y ejecuta el juez contra cada uno. Los resultados y explicaciones se adjuntan al rastreo como retroalimentación estructurada. Los equipos luego filtran conversaciones marcadas, comparan modos de fallo repetidos, envían threads ambiguos para revisión humana o canalizan ejemplos etiquetados en datasets de evaluación. LangChain es propietaria del prompt del evaluador, selección del modelo juez, versionado e infraestructura de inferencia.

El juez marca correcciones de usuarios, solicitudes repetidas y acciones rechazadas. También infiere problemas a partir de respuestas contradictorias, errores reconocidos, malentendidos persistentes y resultados sin resolver — patrones de fallo que nunca aparecen en calificaciones de pulgar hacia arriba/pulgar hacia abajo.

La reducción de 82% en costos proviene de llamadas de modelos frontier. Algunas cargas de trabajo de socios iniciales alcanzaron ahorros del 98%. LangChain dice que el modelo post-entrenado especializado superó cada modelo frontier en su benchmark interno. La evaluación se completa dentro de 12 horas después de que un thread se vuelve elegible. Para equipos que restringen la evaluación de modelos frontier a una fracción del tráfico en producción porque la cobertura completa es demasiado costosa, esto cambia el rango operativo: obtienen señal en cada conversación, no en una porción verificada.

Vanta fue un socio inicial. Kevin Royer, Ingeniero Principal de ML/IA en Vanta, llamó al evaluador "una red de seguridad para capturar modos de fallo desde el primer día, mientras construíamos nuestros propios evaluadores específicos del negocio." Los Evaluadores Ajustados sirven como cobertura de línea de base que un equipo establece inmediatamente mientras escribe evaluadores que reflejan los criterios de calidad de su producto.

Construir el evaluador siempre ha requerido resolver casos de etiquetado ambiguos, producir datos etiquetados para calibrar un juez, hacer benchmarking de opciones de modelo y mantener todo esto mientras el comportamiento en producción se desvía. La mayoría de los equipos saltaron este trabajo y ejecutaron modelos frontier en una muestra. Los Evaluadores Ajustados reducen el tiempo de construcción a cero para el caso de Error Percibido. La compensación: ejecutas el modelo post-entrenado de LangChain, no tu propio prompt que puedas inspeccionar y ajustar. Los criterios de elegibilidad y ventanas de evaluación también son fijos — threads con menos de dos pares humano-IA no califican, y los resultados se retrasan hasta 12 horas.

El evaluador de Error Percibido está disponible ahora en los planos LangSmith Plus y Cloud Enterprise en EE.UU. LangChain no ha divulgado qué Evaluadores Ajustados adicionales están en el pipeline o si el juez administrado se expondrá para ajuste fino en datos etiquetados específicos del equipo.

Si tu agente se lanza sin cobertura sistemática de Error Percibido porque construir el evaluador parecía costoso, adjúntalo inmediatamente. Ahorros del 82% sobre jueces frontier con cobertura de rastreo completo es la razón para hacerlo hoy.