aiexpert
Inicio / Modelos / gemma-4-E4B-it-qat-w4a16-ct
g google Lanzamiento · 20 jul 2026

gemma-4-E4B-it-qat-w4a16-ct

Gemma 4 E4B-IT em formato Compressed Tensors (w4a16) traz um modelo multimodal MoE de 4,5B parâmetros efetivos com janela de 128K tokens, pronto para inferência otimizada em vLLM sob licença Apache 2.0.

Ficha actualizada · ago 2026 apache-2.0jul 2026
Laboratoriogoogle
Licenciaapache-2.0
Lanzamiento jul 2026
Identificadorgoogle/gemma-4-E4B-it-qat-w4a16-ct

Benchmarks declarados

Números de la fuente, no medición nuestra

El laboratorio no publicó benchmark verificable para este modelo.

Ficha técnica

Declarado por el proveedor
Arquitectura
[object Object][object Object]
Licencia
apache-2.0
Identificador
google/gemma-4-E4B-it-qat-w4a16-ct
Ficha generada por
agent

Por qué importa

A serialização em Compressed Tensors elimina etapas de conversão para equipes que operam vLLM em produção: o checkpoint carrega diretamente no servidor de inferência sem recompilação ou conversão de formato, reduzindo fricção operacional em pipelines de ML existentes.

O QAT w4a16 mantém qualidade próxima à precisão total enquanto reduz substancialmente o footprint de VRAM — um compromisso relevante para organizações que precisam servir modelos multimodais em GPUs de médio porte sem migrar para hardware A100/H100. A combinação de suporte a áudio, imagem e contexto de 128K em menos de 5B parâmetros efetivos posiciona este modelo como opção concreta para workloads agenticos com restrição de custo por token.

A quién le interesa

Arquitetos de inferência que operam clusters vLLM e precisam de um modelo multimodal instruction-tuned com baixo custo de VRAM; equipes de produto em empresas de médio porte que buscam capacidades de áudio e visão sem o custo operacional de modelos acima de 30B parâmetros; e engenheiros de plataforma avaliando modelos Apache 2.0 para implantação em ambientes regulados onde restrições de licença comercial são impeditivas.