aiexpert
Inicio / Modelos
Fichas generadas por la redacción

Catálogo de modelos

Una ficha por modelo: lo que el laboratorio declaró, los benchmarks que publicó y la cobertura en que apareció. Los números son de la fuente — no hacemos evaluación propia.

50Modelos
11Laboratorios
google

gemma-4-E4B-it-qat-w4a16-ct

Gemma 4 E4B-IT em formato Compressed Tensors (w4a16) traz um modelo multimodal MoE de 4,5B parâmetros efetivos com janela de 128K tokens, pronto para inferência otimizada em vLLM sob licença Apache 2.0.

Lanzado jul 2026 · apache-2.0 Sin benchmark declarado
google

gemma-4-E2B-it-qat-w4a16-ct

Google lança variante QAT w4a16 do Gemma 4 E2B em formato Compressed Tensors, preservando qualidade bfloat16 com footprint de memória drasticamente reduzido para inferência nativa no vLLM — aposta direta em edge e GPU de consumidor.

Lanzado jul 2026 · apache-2.0 Sin benchmark declarado
google

diffusiongemma-26B-A4B-it

DiffusionGemma 26B A4B é um modelo multimodal MoE da Google DeepMind que substitui autogressão token-a-token por difusão discreta em blocos, atingindo mais de 1.100 tokens/s em H100 FP8 — com tradeoff mensurável de qualidade frente ao Gemma 4 base.

Lanzado jun 2026 · apache-2.0 Sin benchmark declarado
google

gemma-4-12B-it-qat-w4a16-ct

Google lança Gemma 4 12B em formato QAT w4a16 via compressed-tensors, viabilizando inferência otimizada no vLLM com qualidade próxima ao bfloat16 e janela de contexto de 256K tokens sob licença Apache 2.0.

Lanzado jun 2026 · apache-2.0 Sin benchmark declarado
google

gemma-4-31B-it-qat-w4a16-ct

Google DeepMind lança versão quantizada com QAT do Gemma 4 31B denso em formato compressed-tensors w4a16, permitindo inferência nativa no vLLM com qualidade próxima ao bfloat16 e footprint de memória drasticamente reduzido — relevante para equipes que precisam rodar 31B parâmetros em hardware de workstation.

Lanzado jun 2026 · apache-2.0 Sin benchmark declarado
google

gemma-4-E2B-it

Gemma 4 E2B é um modelo denso multimodal de 2,3B parâmetros efetivos (5,1B com embeddings) da Google DeepMind, licenciado em Apache 2.0, com suporte a texto, imagem e áudio em janela de contexto de 128K tokens — posicionado para inferência local em dispositivos móveis e laptops.

Lanzado may 2026 · apache-2.0 Sin benchmark declarado
google

gemma-4-E4B-it

Gemma 4 E4B é um modelo denso multimodal de 4,5B parâmetros efetivos (8B com embeddings) da Google DeepMind, licenciado em Apache 2.0, com janela de contexto de 128K tokens e suporte nativo a texto, imagem e áudio — projetado para execução local em laptops e dispositivos móveis.

Lanzado may 2026 · apache-2.0 Sin benchmark declarado
google

gemma-4-26B-A4B-it

Gemma 4 26B A4B é um modelo MoE multimodal do Google DeepMind com 25,2B parâmetros totais e apenas 3,8B ativos por inferência, janela de 256K tokens e licença Apache 2.0 — entregando desempenho próximo ao 31B denso com custo computacional de um modelo 4B.

Lanzado may 2026 · apache-2.0 Sin benchmark declarado
google

gemma-4-31B-it

Gemma 4 31B é um modelo denso multimodal de 30,7B parâmetros, Apache 2.0, com janela de 256K tokens e 89,2% no AIME 2026 sem ferramentas — desempenho de raciocínio que rivaliza com modelos proprietários de maior escala.

Lanzado may 2026 · apache-2.0 Sin benchmark declarado
google

gemma-4-E2B

Gemma 4 E2B é um modelo denso multimodal de 2,3B parâmetros efetivos (5,1B com embeddings) da Google DeepMind, licenciado sob Apache 2.0, otimizado para execução local em dispositivos móveis e laptops com suporte a texto, imagem e áudio em janela de contexto de 128K tokens.

Lanzado abr 2026 · apache-2.0 Sin benchmark declarado

De dónde vienen los números

Cada ficha guarda la lista de fuentes de donde salieron los números. Ningún índice de esta página lo producimos nosotros — cuando el laboratorio no divulga, la ficha lo dice.

Leer la metodología