aiexpert
Início / Notícias / Nota
Research · 10 de ago. de 2026, 11:03 · 3 fontes

Multiverse Computing publica técnica eficiente de destilação reduzindo VRAM de destilação 50% no treinamento de LLM de contexto longo

A Multiverse Computing publicou um artigo de pesquisa em 10 de agosto de 2026, intitulado "Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss", introduzindo otimizações de sistemas que reduzem drasticamente os requisitos de VRAM para destilação de conhecimento (treinamento de um modelo estudante menor para imitar um professor maior). Destilação—o processo de comprimir modelos de parâmetros de trilhão como Kimi-K3 (2,8T parâmetros) em variantes menores implantáveis—tornou-se prática crítica, mas permanece proibitivamente cara: a destilação online padrão atinge ~250GB de VRAM, exigindo centenas de GPUs. A nova abordagem reduz picos para ~128GB, cortando custos o suficiente para permitir destilação de contexto longo em uma GPU única H200/B200.

A técnica usa duas mudanças de sistemas-chave: (1) destilação offline, armazenando em cache apenas os logits top-K do professor uma única vez em vez de recomputar o forward pass completo a cada etapa, eliminando o professor da memória inteiramente; (2) uma perda KL-divergence em chunks fundida que evita materializar a matriz completa vocabulário×comprimento-de-seqüência, processando chunks de seqüência end-to-end e descartando-os após backward pass. Juntas, estas reduzem o pico de memória por etapa da destilação de ~250GB para abaixo de 128GB, enquanto mantém qualidade de treinamento.

O avanço importa porque a compressão de modelo aberto (Nemotron da Nvidia, Hypernova da Multiverse, variantes destiladas em breve de Qwen/GLM/gpt-oss) permanece um dos maiores custos do pipeline de modelo aberto. Praticantes implantando professores de parâmetros de trilhão foram estrangulados pelo custo de destilação; estas economias desbloqueiam experimentação distribuída e varre de-múltiplas-ablações em hardware modesto, acelerando o ritmo em que a destilação de modelo aberto e a otimização podem iterar.

Fontes

Tudo que sustenta esta nota
  1. 01 Primary source huggingface.co
  2. 02 huggingface.co huggingface.co “Our latest paper, Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss, tackles this with two systems changes: caching the teacher's top-K logits once so the teacher never has to sit in memory alongside the student”
  3. 03 huggingface.co huggingface.co “Dense KL spikes to roughly 250GB, above a single H200's 141GB capacity. The fused chunked loss never forms that spike and peaks at about 128GB”