NVIDIA quantizou o Qwen3-35B-A3B da Alibaba para FP4, reduzindo custo de inferência com apenas 3B parâmetros ativados por token em arquitetura MoE, mantendo janela de contexto de 262K e suporte a texto, imagem e vídeo.
The lab published no verifiable benchmark for this model.
Quantização FP4 aplicada exclusivamente aos pesos e ativações dos operadores lineares nos blocos MoE reduz pegada de memória e latência sem exigir retreinamento, tornando o modelo viável em configurações de GPU únicas onde a versão BF16 exigiria multi-nó.
Com apenas 3B parâmetros ativados por token, o custo de FLOP por requisição se aproxima de modelos pequenos, enquanto a capacidade total de 35B e o contexto de 262K competem com modelos densos significativamente mais caros de operar — uma equação relevante para equipes que precificam inferência por token.
Arquitetos de infraestrutura de IA que operam frota Hopper ou Blackwell e buscam reduzir custo por token em pipelines de RAG com contexto longo, agentes de suporte multimodal ou sistemas de análise de documentos extensos — especialmente em setores como telecom, finanças e saúde onde o volume de requisições torna a eficiência de compute diretamente relevante ao P&L.