aiexpert
Início / Modelos / Qwen3.5-397B-A17B-NVFP4
n nvidia Lançamento · 30 de jun. de 2026

Qwen3.5-397B-A17B-NVFP4

NVIDIA quantiza o Qwen3.5-397B-A17B da Alibaba para NVFP4, reduzindo footprint de memória com paridade ou ganho mensurável frente à versão FP8 em benchmarks como GPQA Diamond (0.871) e LiveCodeBench V6 (0.843 vs 0.837).

Ficha atualizada · jul. de 2026 apache-2.0jun. de 2026
Laboratórionvidia
Licençaapache-2.0
Lançamento jun. de 2026
Identificadornvidia/Qwen3.5-397B-A17B-NVFP4

Benchmarks declarados

Números da fonte, não medição nossa

O laboratório não publicou benchmark verificável para este modelo.

Ficha técnica

Declarado pelo fornecedor
Arquitetura
[object Object][object Object]
Licença
apache-2.0
Identificador
nvidia/Qwen3.5-397B-A17B-NVFP4
Ficha gerada por
agent

Por que importa

FP4 reduz em até 50% a largura de banda de memória em relação ao FP16, viabilizando implantação do modelo em configurações com menos GPUs Blackwell — relevante em um cenário em que H100 e B200 continuam escassos e caros. O fato de NVFP4 igualar ou superar FP8 em cinco dos sete benchmarks reportados (incluindo AIME 2025 com ~0.918) desafia a premissa de que quantizações abaixo de 8 bits implicam necessariamente degradação perceptível.

A distribuição direta via HuggingFace com suporte nativo a vLLM e SGLang elimina etapas de otimização manual, reduzindo o ciclo de avaliação para equipes que já operam infraestrutura Blackwell.

Para quem interessa

Arquitetos de infraestrutura de IA e CTOs avaliando implantação de modelos frontier em clusters Blackwell — especialmente equipes que precisam maximizar throughput por GPU em pipelines de agentes, RAG de contexto longo (até 262K tokens) ou aplicações de raciocínio científico e matemático onde AIME 2025 e GPQA Diamond são proxies de qualidade relevantes.