Eficiencia de Entrenamiento GEM de Meta Duplicada a 20-25% MFU; Kernels Personalizados Cierran Brecha Recomendación-LLM
Meta publicó el 3 de agosto de 2026 detalles de ingeniería sobre cómo duplicó la eficiencia de entrenamiento end-to-end de su Generative Ads Recommendation Model (GEM) a 20-25% Model FLOPs Utilization (MFU) mientras escala 4x entrenamiento FLOPs en 12 meses. GEM es el modelo de fundación más grande para sistemas de recomendación jamás construido, entrenado a escala LLM en miles de GPUs. El modelo alimenta recomendaciones de anuncios en Facebook e Instagram y ha entregado elevación de conversión del 5% en Instagram y 3% en Facebook Feed desde el lanzamiento, con ganancias Q3 doblándose en relación a Q2.
El entrenamiento GEM presenta desafíos únicos no encontrados en cargas de trabajo LLM: longitudes de secuencia altamente variables (el historial de actividad del usuario varía de cientos a decenas de miles de tokens), patrones asimétricos de atención (historial de secuencia larga, ventanas de interacción anuncio-usuario cortas) y operaciones dispersas ligadas a memoria. Meta construyó kernels de GPU personalizados—Jagged Flash Attention (JFA), Generalized Dot-Product Attention (GDPA), BlockAttention—que operan directamente en tensores jagged y entrenamiento de precisión ultra baja mixta (MXFP8) afinado para cargas de trabajo de recomendación. Un esquema de paralelismo 5D consciente de topología con colectivos sin SM co-diseñado alrededor de la jerarquía de red multinivel de Meta redujo la sobrecarga de comunicación.
Para constructores de infra: el resultado es transferible. La prueba de Meta de que los modelos a escala de recomendación pueden seguir leyes de eficiencia similares a LLM (si codiña kernels + precisión + paralelismo juntos) se aplica a cualquier modelo de fundación heterogénea que combine incrustaciones dispersas con transformadores densos. El escalado 4x FLOP en 12 meses y MFU duplicado muestran que la innovación a nivel de sistema puede desbloquear ganancias de eficiencia comparables a avances a nivel de arquitectura—relevante para equipos que entrenan modelos multitarea o multimodales a escala.
Fuentes
- Primary source
- Meta Engineering
“doubling end-to-end (E2E) training efficiency to 20–25% Model FLOPs Utilization (MFU) while scaling training FLOPs 4x in 12 months”
- Meta Engineering
“custom recommendation kernel library — Jagged Flash Attention (JFA), Generalized Dot-Product Attention (GDPA), BlockAttention, etc. — and mixed ultra-low precision training (including MXFP8 attention and MLP)”