aiexpert
Inicio / Noticias / Nota
Research · 05 ago 2026, 01:04 · 3 fuentes

Eficiencia de Entrenamiento GEM de Meta Duplicada a 20-25% MFU; Kernels Personalizados Cierran Brecha Recomendación-LLM

Meta publicó el 3 de agosto de 2026 detalles de ingeniería sobre cómo duplicó la eficiencia de entrenamiento end-to-end de su Generative Ads Recommendation Model (GEM) a 20-25% Model FLOPs Utilization (MFU) mientras escala 4x entrenamiento FLOPs en 12 meses. GEM es el modelo de fundación más grande para sistemas de recomendación jamás construido, entrenado a escala LLM en miles de GPUs. El modelo alimenta recomendaciones de anuncios en Facebook e Instagram y ha entregado elevación de conversión del 5% en Instagram y 3% en Facebook Feed desde el lanzamiento, con ganancias Q3 doblándose en relación a Q2.

El entrenamiento GEM presenta desafíos únicos no encontrados en cargas de trabajo LLM: longitudes de secuencia altamente variables (el historial de actividad del usuario varía de cientos a decenas de miles de tokens), patrones asimétricos de atención (historial de secuencia larga, ventanas de interacción anuncio-usuario cortas) y operaciones dispersas ligadas a memoria. Meta construyó kernels de GPU personalizados—Jagged Flash Attention (JFA), Generalized Dot-Product Attention (GDPA), BlockAttention—que operan directamente en tensores jagged y entrenamiento de precisión ultra baja mixta (MXFP8) afinado para cargas de trabajo de recomendación. Un esquema de paralelismo 5D consciente de topología con colectivos sin SM co-diseñado alrededor de la jerarquía de red multinivel de Meta redujo la sobrecarga de comunicación.

Para constructores de infra: el resultado es transferible. La prueba de Meta de que los modelos a escala de recomendación pueden seguir leyes de eficiencia similares a LLM (si codiña kernels + precisión + paralelismo juntos) se aplica a cualquier modelo de fundación heterogénea que combine incrustaciones dispersas con transformadores densos. El escalado 4x FLOP en 12 meses y MFU duplicado muestran que la innovación a nivel de sistema puede desbloquear ganancias de eficiencia comparables a avances a nivel de arquitectura—relevante para equipos que entrenan modelos multitarea o multimodales a escala.

Fuentes

Todo lo que sostiene esta nota
  1. 01 Primary source engineering.fb.com
  2. 02 Meta Engineering engineering.fb.com “doubling end-to-end (E2E) training efficiency to 20–25% Model FLOPs Utilization (MFU) while scaling training FLOPs 4x in 12 months”
  3. 03 Meta Engineering engineering.fb.com “custom recommendation kernel library — Jagged Flash Attention (JFA), Generalized Dot-Product Attention (GDPA), BlockAttention, etc. — and mixed ultra-low precision training (including MXFP8 attention and MLP)”