LangChain lançou Tuned Evaluators, serviço de avaliação gerenciado que anexa automaticamente feedback de qualidade a traces de agentes em produção sem ajuste de prompt manual ou custos de modelo frontier. O primeiro avaliador, Perceived Error, detecta conver sas onde um agente entendeu errado uma solicitação, cometeu um erro, ou levou a interação na direção errada—tanto de sinais explícitos (correções de usuário, rejeições) quanto inferidos (contradições, resultados não resolvidos). O avaliador está disponível agora para planos Plus e Cloud Enterprise do LangSmith nos EUA.
Perceived Error usa modelo especializado LangChain pos-treinado em traces de conver sas rotuladas que superou cada modelo frontier em benchmarking ao reduzir custo em até 82% (98% em algumas workloads de parceiros iniciais). Diferente de abordagens frontier model-as-judge, equipes não precisam mais escrever prompts, selecionar juizes LLM, ou gerenciar infraestrutura de inferência—LangChain gerencia versionamento, benchmarking, e gestão de credenciais fim-a-fim. Uma thread se torna elível para avaliação após pelo menos dois pares de mensagens human-AI e período ocioso, com resultados anexados em 12 horas.
Para construtores de agente: avaliação de qualidade em escala de produção é alavanca bloqueadora para melhoria de agente. A maioria dos usuários nunca submete classificações explícitas, então Perceived Error (inferindo erros de sinais de conversa) é proxy de fidelidade mais alto que estrelas de usuário. A redução de custo de 82% vs juizes frontier torna avaliação contínua viável para equipes conscientes de custo; Vanta (parceiro inicial) descreve como "rede de segurança para capturar modos de falha desde o primeiro dia" enquanto constróem avaliadores específicos de domínio. Este padrão—avaliadores turnkey + ajuste fino específ ico de equipe—está se tornando fluxo de trabalho padrão desenvolvimento de agente.