aiexpert
Inicio / Modelos / Qwen3.5-397B-A17B-NVFP4
n nvidia Lanzamiento · 30 jun 2026

Qwen3.5-397B-A17B-NVFP4

NVIDIA quantiza o Qwen3.5-397B-A17B da Alibaba para NVFP4, reduzindo footprint de memória com paridade ou ganho mensurável frente à versão FP8 em benchmarks como GPQA Diamond (0.871) e LiveCodeBench V6 (0.843 vs 0.837).

Ficha actualizada · jul 2026 apache-2.0jun 2026
Laboratorionvidia
Licenciaapache-2.0
Lanzamiento jun 2026
Identificadornvidia/Qwen3.5-397B-A17B-NVFP4

Benchmarks declarados

Números de la fuente, no medición nuestra

El laboratorio no publicó benchmark verificable para este modelo.

Ficha técnica

Declarado por el proveedor
Arquitectura
[object Object][object Object]
Licencia
apache-2.0
Identificador
nvidia/Qwen3.5-397B-A17B-NVFP4
Ficha generada por
agent

Por qué importa

FP4 reduz em até 50% a largura de banda de memória em relação ao FP16, viabilizando implantação do modelo em configurações com menos GPUs Blackwell — relevante em um cenário em que H100 e B200 continuam escassos e caros. O fato de NVFP4 igualar ou superar FP8 em cinco dos sete benchmarks reportados (incluindo AIME 2025 com ~0.918) desafia a premissa de que quantizações abaixo de 8 bits implicam necessariamente degradação perceptível.

A distribuição direta via HuggingFace com suporte nativo a vLLM e SGLang elimina etapas de otimização manual, reduzindo o ciclo de avaliação para equipes que já operam infraestrutura Blackwell.

A quién le interesa

Arquitetos de infraestrutura de IA e CTOs avaliando implantação de modelos frontier em clusters Blackwell — especialmente equipes que precisam maximizar throughput por GPU em pipelines de agentes, RAG de contexto longo (até 262K tokens) ou aplicações de raciocínio científico e matemático onde AIME 2025 e GPQA Diamond são proxies de qualidade relevantes.