aiexpert
Inicio / Modelos / Gemma-4-31B-IT-NVFP4
n nvidia Lanzamiento · 08 may 2026

Gemma-4-31B-IT-NVFP4

NVIDIA quantiza o Gemma 4 31B do Google em NVFP4 via ModelOpt, mantendo degradação abaixo de 0,5 pp em benchmarks críticos (GPQA Diamond: 85,35%; AIME 2025: 87,60%) e viabilizando inferência multimodal de 256K tokens em hardware Blackwell com vLLM.

Ficha actualizada · may 2026 othermay 2026
Laboratorionvidia
Licenciaother
Lanzamiento may 2026
Identificadornvidia/Gemma-4-31B-IT-NVFP4

Benchmarks declarados

Números de la fuente, no medición nuestra

El laboratorio no publicó benchmark verificable para este modelo.

Ficha técnica

Declarado por el proveedor
Arquitectura
[object Object][object Object]
Licencia
other
Identificador
nvidia/Gemma-4-31B-IT-NVFP4
Ficha generada por
agent

Por qué importa

A quantização NVFP4 reduz a pegada de memória do modelo sem degradação mensurável para a maioria dos casos de uso: a queda máxima observada nos benchmarks reportados é de 0,45 pp (GPQA Diamond), o que situa o modelo quantizado ainda acima de referências anteriores de modelos maiores. Isso torna viável rodar capacidade de fronteira em raciocínio científico e código dentro de uma única GPU Blackwell de alto desempenho.

Com dados de treinamento com corte em janeiro de 2025 e cobertura de mais de 140 idiomas, o modelo combina alcance multilíngue com desempenho de topo em benchmarks de ciência (GPQA Diamond 85,35%) e código (LiveCodeBench pass@1 82,27%), ampliando o espaço de implantação para organizações que não operam infraestrutura de múltiplos nós.

A quién le interesa

Arquitetos de inferência e CTOs que operam em ambientes com restrição de VRAM — especialmente em workstations ou clusters Blackwell de nó único — e precisam de capacidade multimodal com janela de 256K tokens para pipelines de RAG de documentos longos, análise de código ou extração de dados visuais sem escalar para infraestrutura multi-GPU de precisão total.