aiexpert
Início / Modelos / Gemma-4-31B-IT-NVFP4
n nvidia Lançamento · 08 de mai. de 2026

Gemma-4-31B-IT-NVFP4

NVIDIA quantiza o Gemma 4 31B do Google em NVFP4 via ModelOpt, mantendo degradação abaixo de 0,5 pp em benchmarks críticos (GPQA Diamond: 85,35%; AIME 2025: 87,60%) e viabilizando inferência multimodal de 256K tokens em hardware Blackwell com vLLM.

Ficha atualizada · mai. de 2026 othermai. de 2026
Laboratórionvidia
Licençaother
Lançamento mai. de 2026
Identificadornvidia/Gemma-4-31B-IT-NVFP4

Benchmarks declarados

Números da fonte, não medição nossa

O laboratório não publicou benchmark verificável para este modelo.

Ficha técnica

Declarado pelo fornecedor
Arquitetura
[object Object][object Object]
Licença
other
Identificador
nvidia/Gemma-4-31B-IT-NVFP4
Ficha gerada por
agent

Por que importa

A quantização NVFP4 reduz a pegada de memória do modelo sem degradação mensurável para a maioria dos casos de uso: a queda máxima observada nos benchmarks reportados é de 0,45 pp (GPQA Diamond), o que situa o modelo quantizado ainda acima de referências anteriores de modelos maiores. Isso torna viável rodar capacidade de fronteira em raciocínio científico e código dentro de uma única GPU Blackwell de alto desempenho.

Com dados de treinamento com corte em janeiro de 2025 e cobertura de mais de 140 idiomas, o modelo combina alcance multilíngue com desempenho de topo em benchmarks de ciência (GPQA Diamond 85,35%) e código (LiveCodeBench pass@1 82,27%), ampliando o espaço de implantação para organizações que não operam infraestrutura de múltiplos nós.

Para quem interessa

Arquitetos de inferência e CTOs que operam em ambientes com restrição de VRAM — especialmente em workstations ou clusters Blackwell de nó único — e precisam de capacidade multimodal com janela de 256K tokens para pipelines de RAG de documentos longos, análise de código ou extração de dados visuais sem escalar para infraestrutura multi-GPU de precisão total.