NVIDIA quantiza o Gemma 4 31B do Google em NVFP4 via ModelOpt, mantendo degradação abaixo de 0,5 pp em benchmarks críticos (GPQA Diamond: 85,35%; AIME 2025: 87,60%) e viabilizando inferência multimodal de 256K tokens em hardware Blackwell com vLLM.
The lab published no verifiable benchmark for this model.
A quantização NVFP4 reduz a pegada de memória do modelo sem degradação mensurável para a maioria dos casos de uso: a queda máxima observada nos benchmarks reportados é de 0,45 pp (GPQA Diamond), o que situa o modelo quantizado ainda acima de referências anteriores de modelos maiores. Isso torna viável rodar capacidade de fronteira em raciocínio científico e código dentro de uma única GPU Blackwell de alto desempenho.
Com dados de treinamento com corte em janeiro de 2025 e cobertura de mais de 140 idiomas, o modelo combina alcance multilíngue com desempenho de topo em benchmarks de ciência (GPQA Diamond 85,35%) e código (LiveCodeBench pass@1 82,27%), ampliando o espaço de implantação para organizações que não operam infraestrutura de múltiplos nós.
Arquitetos de inferência e CTOs que operam em ambientes com restrição de VRAM — especialmente em workstations ou clusters Blackwell de nó único — e precisam de capacidade multimodal com janela de 256K tokens para pipelines de RAG de documentos longos, análise de código ou extração de dados visuais sem escalar para infraestrutura multi-GPU de precisão total.