Muthaiah Venkatachalam de Intel y Tate Berenbaum de Not Community Labs publicaron un artículo el 19 de agosto demostrando que las Intel AI PC estándar pueden ejecutar inferencia distribuida de LLM sin kernels personalizados ni hardware en la nube. Una configuración Llama 3.1 8B de dos nodos alcanzó 43,97 tokens por segundo sirviendo a dos usuarios concurrentes—1,79× el rendimiento de una única máquina. Una flota Lunar Lake de cuatro nodos ejecutó un modelo 70B a velocidad interactiva; ninguna máquina individual podría ejecutarlo.
La arquitectura particiona modelos en los límites de capas en fragmentos por etapa, cada uno precompilado como OpenVINO IR INT4. Las máquinas cargan su fragmento, decodifican un paso y pasan activaciones al siguiente nodo a través de TCP. Los viajes de ida y vuelta por token dominan la latencia. La decodificación especulativa—generando múltiples tokens por pasada hacia adelante—mitiga esto, pero los modelos OpenVINO con estado encuentran un obstáculo: el rebobinado de KV-cache cuesta 48 milisegundos por llamada en Arc B390 con un cache de 72-token, eliminando ganancias.
Primera solución: poner a cero las posiciones attention_mask en lugar de recortar físicamente el cache. Esto es exactamente igual al recorte físico y cuesta casi nada, desbloqueando 1,33× aceleración media en especulación de un solo nodo, aumentando a 1,6× en generaciones de 2048-token. Segunda solución: inyección de beam_idx Gather. Las herramientas de exportación estándar fallan en fragmentos modernos debido al flujo de control dinámico en incrustaciones rotatorias y operaciones de KV cache. El equipo cambió a torch.jit.trace con incrustaciones rotatorias precomputadas, luego inyectó parámetros beam_idx y nodos Gather post-exportación. Esto activa la fusión IndirectKVCache de OpenVINO en el complemento GPU. Sin ella, los fragmentos se ejecutan 13–23% más lentamente que los modelos monolíticos. Con ella, coinciden con el rendimiento monolítico dentro del 4%.
Tercero: micro-batching. Los objetos OpenVINO InferRequest portan KV caches con estado, permitiendo que flujos de usuario separados se intercalen en etapas de pipeline sin cambios de framework. Dos flujos producen 1,80× escalado de rendimiento del sistema. Con latencia WAN inferior a 100 milisegundos, la pila combinada—fragmentación, especulación y micro-batching—entrega 4,04× el rendimiento de decodificación naive de pipeline, que cae por debajo del umbral interactivo en ese escenario.
Brechas conocidas permanecen. El crecimiento de KV cache aún erosiona el rendimiento en despliegues 70B de contexto largo. El soporte NPU existe pero los benchmarks se ejecutan en iGPU. El caching INT8 KV fue más lentamente y fue descartado.
El código, logs y scripts de reproducción están en github.com/labscommunity/pipeline-sharded-inference-paper bajo CC BY 4.0. La inferencia distribuida de LLM en edge en Intel AI PC fue limitada por tres brechas específicas de gráfico y programación en OpenVINO—cada una ahora cerrada con parches listos para despliegue.