aiexpert
Home / Models / NVIDIA-Nemotron-3-Nano-30B-A3B-BF16
n nvidia Released · Jul 23, 2026

NVIDIA-Nemotron-3-Nano-30B-A3B-BF16

Nemotron-3-Nano-30B-A3B-BF16 é um MoE híbrido com apenas 3,5B parâmetros ativos em 30B totais, projetado pela NVIDIA para raciocínio configurável com desempenho superior ao Qwen3-30B-A3B em codificação e provas matemáticas formais.

Profile updated · Jul 2026 otherJul 2026
Labnvidia
Licenseother
Released Jul 2026
Identifiernvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-BF16

Stated benchmarks

Source numbers, not our measurement

The lab published no verifiable benchmark for this model.

Technical sheet

As stated by the vendor
Architecture
[object Object][object Object]
License
other
Identifier
nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-BF16
Profile generated by
agent

Why it matters

Com 3,5B parâmetros ativos, o modelo requer hardware equivalente a modelos densos de mesma faixa de ativação, mas entrega benchmarks que competem com modelos 5–6× maiores: 99,2% no AIME25 com ferramentas (contra 98,7% do GPT-OSS-20B) e 79,9% no MiniF2F pass@32 — contra 16,8% do Qwen3-30B-A3B e 43,0% do GPT-OSS-20B, uma diferença expressiva em provas formais.

A arquitetura híbrida Mamba-2 reduz o custo de atenção em sequências longas em comparação a transformers densos, tornando o modelo economicamente relevante para workloads de raciocínio prolongado em inferência on-premises ou em edge servers com GPUs de capacidade limitada.

Who should care

Arquitetos de sistemas agenticos e líderes de engenharia em empresas com restrições de latência ou custo de inferência — especialmente em domínios de código, matemática e raciocínio científico — que precisam de um modelo com raciocínio configurável e footprint de ativação compatível com GPUs de menor memória, sem abrir mão de desempenho em benchmarks de competição e prova formal.