aiexpert
Início / Notícias / Nota
Breaking · 05 de ago. de 2026, 01:05 · 3 fontes

Liquid AI Lança Modelo Agente LFM2.5-2.6B em Dispositivo; 220 tok/s em M5 Max, Corresponde a Modelos 4-10B

Liquid AI lançou LFM2.5-2.6B em 4 de agosto de 2026, um modelo de 2,6 bilhões de parâmetros projetado para cargas de trabalho agentes em dispositivo sem dependência em nuvem. O modelo executa a 220 tokens/segundo em Apple M5 Max, 113 tok/s em AMD Ryzen CPU e até 30 tok/s em telefones, tudo dentro de 2,5 GB de memória. Foi pré-treinado em ~34 trilhões de tokens com janela de contexto de 128K e pós-treinado em quatro estágios: afinação supervisionada, especialização de especialistas, destilação on-policy multi-domínio e aprendizado por reforço agência dentro de armações ativas (OpenClaw, Hermes Agent).

LFM2.5-2.6B é competitivo com modelos 4-10x maiores em uso de ferramentas, seguimento de instruções e tarefas agências multi-etapas. Em benchmarks de uso de ferramentas (BFCLv4, ToolSandbox, Claw-Eval), ele combina ou supera modelos Gemma 5-8B e Qwen 4,7-9,7B. A arquitetura usa principalmente convoluções curtas com camadas de atenção seletiva (convoluções LIV), que mantêm estado de tamanho constante por token e eliminam sobrecarga de cache KV—uma vantagem de eficiência chave sobre transformers densos. A inferência de GPU atinge 15K tokens de saída/segundo em um único H100 em alta concorrência.

Para arquitetos enviando agentes: modelos agentes em dispositivo eliminam custos por token e permitem inferência com privacidade por padrão. O treinamento LFM2.5-2.6B dentro de armações reais (não traços sintéticos) deve melhorar a compatibilidade de uso de ferramenta real. Os 30 tok/s em telefones abrem casos de uso de robótica e IA incorporada. O flip de modelo de custo—de restrição de gasto de token para restrição de taxa de transferência local—permite agentes de fundo contínuo. A ênfase da Líquida em arquiteturas baseadas em convolução em vez de pura atenção pode sinalizar para onde os modelos de borda eficientes estão indo.

Fontes

Tudo que sustenta esta nota
  1. 01 Primary source huggingface.co
  2. 02 Hugging Face / Liquid AI huggingface.co “LFM2.5-2.6B is built to power capable agents entirely on-device... Efficient inference: 220 tok/s on an Apple M5 Max and 113 tok/s on an AMD Ryzen CPU, in under 2.5 GB of memory”
  3. 03 Hugging Face / Liquid AI huggingface.co “We evaluated LFM2.5-2.6B against models up to ~4x its size on STEM, instruction following, tool use, and agentic tasks. It is the smallest model in the group, yet it competes with and often beats the rest”