Nemotron-3-Nano-30B-A3B-BF16 é um MoE híbrido com apenas 3,5B parâmetros ativos em 30B totais, projetado pela NVIDIA para raciocínio configurável com desempenho superior ao Qwen3-30B-A3B em codificação e provas matemáticas formais.
The lab published no verifiable benchmark for this model.
Com 3,5B parâmetros ativos, o modelo requer hardware equivalente a modelos densos de mesma faixa de ativação, mas entrega benchmarks que competem com modelos 5–6× maiores: 99,2% no AIME25 com ferramentas (contra 98,7% do GPT-OSS-20B) e 79,9% no MiniF2F pass@32 — contra 16,8% do Qwen3-30B-A3B e 43,0% do GPT-OSS-20B, uma diferença expressiva em provas formais.
A arquitetura híbrida Mamba-2 reduz o custo de atenção em sequências longas em comparação a transformers densos, tornando o modelo economicamente relevante para workloads de raciocínio prolongado em inferência on-premises ou em edge servers com GPUs de capacidade limitada.
Arquitetos de sistemas agenticos e líderes de engenharia em empresas com restrições de latência ou custo de inferência — especialmente em domínios de código, matemática e raciocínio científico — que precisam de um modelo com raciocínio configurável e footprint de ativação compatível com GPUs de menor memória, sem abrir mão de desempenho em benchmarks de competição e prova formal.