aiexpert
Início / Notícias / Nota
Research · 11 de ago. de 2026, 14:04 · 2 fontes

IBM ALTK-Evolve memória de agente reduz custos de token para 1/7 da linha de base ACE em modelos mais fracos

IBM Research publicou ALTK-Evolve, um sistema de memória agentic que consolida modos de falha aprendidos e lições de um agente em diretrizes selecionáveis—alcançando até 7x menor consumo de token do que ACE (Agentic Context Engineering) em tarefas de raciocínio multi-passo. Em um modelo fraco (gpt-oss-120b), ALTK-Evolve igualou a taxa de conclusão de gol 54,8% de ACE no benchmark AppWorld enquanto consumia 116K tokens por tarefa versus 777K de ACE. Em modelos mais fortes (DeepSeek-V3.2), ALTK-Evolve melhorou precisão (89,3% vs 80,4%) enquanto reduzia custos para 40% dos 634K tokens de ACE.

Ambos os sistemas aprendem com trajetórias de agentes sem atualizações de peso ou rótulos humanos. ACE e ALTK-Evolve concordam em um princípio central: nunca comprimir as lições duramente conquistadas de um agente em resumos breves; em vez disso, preservar armazena ricos e itens com contadores de suporte mostrando quantos episódios independentes produziram cada diretriz. A divergência é na entrega: ACE injeta o playbook abrangente completo a cada passo de inferência; ALTK-Evolve usa recu­peração seletiva, enviando um núcleo fixo de diretrizes de alto suporte além de lições específicas de tarefa selecionadas via similaridade cosseno ou classificação de LLM.

A eficiência de token vem desta troca de recu­peração versus injeção. Em tarefas mais difíceis onde modelos devem escolher a lição certa em vez de atravessar instruções genéricas, seleção curada fica à frente. ALTK-Evolve também extrai diretrizes tipadas (estratégia, recuperação, otimização) com atribuição causal volta a trajetórias de origem e em granularidade de subtarefa, permitindo transferência em domínios de agentes. O trabalho testa ambos os sistemas em AppWorld, um benchmark de agentes multi-passo abrangendo divisão de contas, busca de música, e reconciliação de pedidos em APIs simuladas.

Para arquitetos: custo de memória agentic importa em escala. Se você executa dezenas de agentes concurrent ao longo de meses, eficiência de token por tarefa determina capex. A estratégia de recu­peração seletiva de ALTK-Evolve transfere entre modelos fracos e fronteiriços. A tipagem e prov­enância causal permitem reuso em domínios de agentes não relacionados—uma lição aprendida por um app pode servir outro. Fique atento para desdobramentos em produção; a 7x redução de token em modelos fracos, a economia muda quem pode arcar com memória agentic persistente.

Fontes

Tudo que sustenta esta nota
  1. 01 Primary source huggingface.co
  2. 02 huggingface.co huggingface.co “On the weak model we edge ACE 56.0 to 54.8 — close enough that we call it a tie on accuracy — at about one-seventh the cost. On the strong model we're better on both metrics at ~40% of ACE's inference cost.”