aiexpert
Inicio / Noticias / Nota
Breaking · 29 jul 2026, 17:34 · 3 fuentes

LangChain Deep Agents v0.7: reducción de tokens base del 65% mediante arnés de solicitud refinado; todos opt-in, anulación de middleware

LangChain lanzó Deep Agents v0.7, refactorizando su arnés de agente base para reducir tokens de entrada en un 65% (6k → 2k tokens por turno) manteniendo o mejorando el rendimiento de las tareas. Los cambios incluyen: (1) eliminación de la solicitud del sistema predeterminada y la prosa de orientación de herramientas general, (2) reducción del 43% de las descripciones de herramientas integradas, (3) TodoListMiddleware ahora es opt-in en lugar del valor predeterminado. La premisa refleja el hallazgo reciente de Anthropic de que la solicitud del sistema de Claude Code se redujo en más del 80% para los modelos Opus 5 / Fable 5 sin degradación de evaluación, validando la tesis de que los modelos fronterizos modernos están sobre-andamiados.

La validación se ejecutó en una nueva suite de evaluación que abarca tareas autónomas (codificación, análisis de datos), conversacionales (interacción multiturno con el usuario) y long-context (recuperación + razonamiento) en cuatro modelos: GPT-5.6-Luna, Gemini-3.6-Flash, Claude Sonnet 4.6, y Claude Opus 4.8. GPT-5.6-Luna mostró una reducción de tokens del 34% y una reducción de costos del 15% con un aumento de recompensa del +4%. La mayoría de los modelos se mantuvieron firmes en recompensa mientras reducían tokens/costos. Claude Sonnet 4.6 fue una excepción (costo aumentado en dos tareas autónomas desafiantes), señalado en trazas de LangSmith.

Para equipos de plataforma: esta es una victoria de ops de producción. Reducir tokens de arnés base de 6k a 2k por turno significa inferencia más barata, latencia más baja, y más espacio para contexto en implementaciones restringidas. El enfoque de middleware opt-in (TodoListMiddleware, anulación de SummarizationMiddleware) ofrece a los constructores un control fino sobre la estrategia de solicitud sin luchar contra el marco. El cronograma se alinea con un patrón más amplio: a medida que la capacidad del modelo se estabiliza, la eficiencia de nivel de arnés se convierte en la palanca.

Fuentes

Todo lo que sostiene esta nota
  1. 01 Primary source langchain.com
  2. 02 Deep Agents v0.7 langchain.com “simplifies the base harness, resulting in 65% fewer base input tokens at comparable performance”
  3. 03 Token reduction via prompt trimming langchain.com “drop base input tokens on a default-agent turn by 65% (~6k → ~2k)”