Eficiência de Treinamento GEM da Meta Dobrada para 20-25% MFU; Kernels Personalizados Fecham Lacuna Recomendação-LLM
Meta publicou em 3 de agosto de 2026 detalhes de engenharia sobre como dobrou a eficiência de treinamento end-to-end de seu Generative Ads Recommendation Model (GEM) para 20-25% Model FLOPs Utilization (MFU) enquanto escala 4x treinamento FLOPs ao longo de 12 meses. GEM é o maior modelo de fundação para sistemas de recomendação já construídos, treinados em escala LLM em milhares de GPUs. O modelo alimenta recomendações de anúncios em Facebook e Instagram e entregou elevador de conversão de 5% no Instagram e 3% no Facebook Feed desde o lançamento, com ganhos Q3 dobrando em relação ao Q2.
O treinamento GEM apresenta desafios únicos não encontrados em cargas de trabalho LLM: comprimentos de seqüência altamente variáveis (histórico de atividade do usuário varia de centenas a dezenas de milhares de tokens), padrões assimétricos de atenção (histórico de seqüência longa, janelas de interação de publicidade de usuário curtas) e operações esparsas ligadas à memória. Meta construiu kernels de GPU personalizados—Jagged Flash Attention (JFA), Generalized Dot-Product Attention (GDPA), BlockAttention—que operam diretamente em tensores jagged e treinamento de precisão ultra-baixa mista (MXFP8) afinado para cargas de trabalho de recomendação. Um esquema de paralelismo 5D consciente de topologia com colectivos sem SM co-projetado em torno da rede multi-tier da Meta reduziu a sobrecarga de comunicação.
Para construtores de infra: o resultado é transferível. A prova da Meta de que modelos em escala de recomendação podem seguir leis de eficiência semelhantes a LLM (se você co-projetar kernels + precisão + paralelismo juntos) se aplica a qualquer modelo de fundação heterogênea combinando embeddings esparsos com transformers densos. A escala 4x FLOP em 12 meses e MFU dobrado mostram que inovação de nível de sistema pode desbloquear ganhos de eficiência comparáveis a avances de nível de arquitetura—relevante para times treinando modelos multi-tarefa ou multi-modal em escala.
Fontes
- Primary source
- Meta Engineering
“doubling end-to-end (E2E) training efficiency to 20–25% Model FLOPs Utilization (MFU) while scaling training FLOPs 4x in 12 months”
- Meta Engineering
“custom recommendation kernel library — Jagged Flash Attention (JFA), Generalized Dot-Product Attention (GDPA), BlockAttention, etc. — and mixed ultra-low precision training (including MXFP8 attention and MLP)”