LangChain lançou Avaliadores Ajustados no LangSmith em 18 de agosto de 2026 — um juiz gerenciado e pós-treinado que anexa feedback de qualidade a cada conversa em produção sem exigir que equipes construam, rotulem ou mantenham um avaliador. O primeiro lançamento tem como alvo Erro Percebido: detecção de conversas onde um agente cometeu um erro, entendeu mal uma requisição ou levou a interação na direção errada.
As equipes anexam um Avaliador Ajustado a um projeto de rastreamento LangSmith existente. O LangSmith identifica threads elegíveis — aquelas contendo pelo menos dois pares de mensagens humano-IA que atingiram o período de inatividade configurado — e executa o juiz contra cada uma. Resultados e explicações se anexam ao rastreamento como feedback estruturado. As equipes então filtram conversas sinalizadas, comparam modos de falha repetidos, encaminham threads ambíguas para revisão humana ou alimentam exemplos marcados em datasets de avaliação. LangChain é proprietária do prompt do avaliador, seleção do modelo juiz, versionamento e infraestrutura de inferência.
O juiz sinaliza correções do usuário, requisições repetidas e ações rejeitadas. Também infere problemas a partir de respostas contraditórias, erros reconhecidos, incompreensões persistentes e resultados não resolvidos — padrões de falha que nunca aparecem em avaliações de polegar para cima/polegar para baixo.
A redução de 82% nos custos vem de chamadas de modelos frontier. Algumas cargas de trabalho de parceiros iniciais atingiram economias de 98%. LangChain diz que o modelo pós-treinado especializado superou todo modelo frontier em seu benchmark interno. A avaliação é concluída em até 12 horas após uma thread se tornar elegível. Para equipes que restringem avaliação de modelos frontier a uma fração do tráfego em produção porque cobertura completa é muito cara, isso muda o envelope operacional: você obtém sinal em cada conversa, não em uma fatia verificada.
Vanta foi um parceiro inicial. Kevin Royer, Engenheiro de ML/IA Sênior na Vanta, chamou o avaliador de "uma rede de segurança para capturar modos de falha desde o primeiro dia, enquanto construíamos nossos próprios avaliadores específicos do negócio." Avaliadores Ajustados servem como cobertura de linha de base que uma equipe estabelece imediatamente enquanto escreve avaliadores que refletem os critérios de qualidade do seu produto.
Construir o avaliador sempre exigiu resolver casos ambíguos de rotulação, produzir dados rotulados para calibrar um juiz, fazer benchmarking de escolhas de modelo e manter tudo isso enquanto o comportamento em produção varia. A maioria das equipes pulou esse trabalho e executou modelos frontier em uma amostra. Avaliadores Ajustados reduzem o tempo de construção a zero para o caso Erro Percebido. A troca: você executa o modelo pós-treinado de LangChain, não seu próprio prompt que você pode inspecionar e ajustar. Critérios de elegibilidade e janelas de avaliação também são fixos — threads sob dois pares humano-IA não se qualificam, e resultados atrasam até 12 horas.
O avaliador Erro Percebido está disponível agora nos planos LangSmith Plus e Cloud Enterprise nos EUA. LangChain não divulgou quais Avaliadores Ajustados adicionais estão no pipeline ou se o juiz gerenciado será exposto para ajuste fino em dados rotulados específicos da equipe.
Se seu agente é entregue sem cobertura sistemática de Erro Percebido porque construir o avaliador parecia caro, anexe isto imediatamente. Economias de 82% sobre juízes frontier em cobertura de rastreamento completo é a razão para fazer isso hoje.