aiexpert
Início / Notícias / Nota
Breaking · 29 de jul. de 2026, 17:34 · 3 fontes

LangChain Deep Agents v0.7: corte de tokens base de 65% via harness de prompt refinado; todos opt-in, override de middleware

LangChain lançou Deep Agents v0.7, refatorando seu harness de agente base para cortar tokens de entrada em 65% (6k → 2k tokens por turno) mantendo ou melhorando o desempenho das tarefas. Mudanças incluem: (1) remoção do prompt de sistema padrão e prosa de orientação de ferramenta geral, (2) refinamento de 43% de descrições de ferramentas integradas, (3) TodoListMiddleware agora opt-in em vez de padrão. A premissa espelha a descoberta recente da Anthropic de que o prompt de sistema do Claude Code foi reduzido > 80% para modelos Opus 5 / Fable 5 sem degradação de eval, validando a tese de que modelos de fronteira modernos estão sobre-construídos.

A validação foi executada em uma nova suite de eval abrangendo autônomo (coding, análise de dados), conversacional (interação com usuário de múltiplas volta), e long-context (recuperação + raciocínio) tarefas em quatro modelos: GPT-5.6-Luna, Gemini-3.6-Flash, Claude Sonnet 4.6, e Claude Opus 4.8. GPT-5.6-Luna mostrou redução de token de 34% e redução de custo de 15% com lift de recompensa de +4%. A maioria dos modelos se manteve firme em recompensa enquanto reduzia tokens/custo. Claude Sonnet 4.6 foi uma exceção (custo aumentado em duas tarefas autônomas desafiadoras), sinalizado em traços de LangSmith.

Para times de plataforma: esta é uma vitória de ops de produção. Reduzir tokens de harness base de 6k para 2k por turno significa inferência mais barata, latência mais baixa, e mais espaço para contexto em implantações restritas. A abordagem de middleware opt-in (TodoListMiddleware, override de SummarizationMiddleware) dá aos construtores controle fino sobre estratégia de prompt sem lutar contra o framework. O timing se alinha com um padrão mais amplo: à medida que a capacidade do modelo se estabiliza, eficiência de nível de harness torna-se a alavanca.

Fontes

Tudo que sustenta esta nota
  1. 01 Primary source langchain.com
  2. 02 Deep Agents v0.7 langchain.com “simplifies the base harness, resulting in 65% fewer base input tokens at comparable performance”
  3. 03 Token reduction via prompt trimming langchain.com “drop base input tokens on a default-agent turn by 65% (~6k → ~2k)”