aiexpert
Home / Models / gemma-4-26B-A4B-it
g google Released · May 07, 2026

gemma-4-26B-A4B-it

Gemma 4 26B A4B é um modelo MoE multimodal do Google DeepMind com 25,2B parâmetros totais e apenas 3,8B ativos por inferência, janela de 256K tokens e licença Apache 2.0 — entregando desempenho próximo ao 31B denso com custo computacional de um modelo 4B.

Profile updated · May 2026 apache-2.0May 2026
Labgoogle
Licenseapache-2.0
Released May 2026
Identifiergoogle/gemma-4-26B-A4B-it

Stated benchmarks

Source numbers, not our measurement

The lab published no verifiable benchmark for this model.

Technical sheet

As stated by the vendor
Architecture
[object Object][object Object]
License
apache-2.0
Identifier
google/gemma-4-26B-A4B-it
Profile generated by
agent

Why it matters

Com 88,3% no AIME 2026 sem ferramentas e 82,6% no MMLU Pro, o 26B A4B supera o Gemma 3 27B (20,8% e 67,6%, respectivamente) a um custo de inferência equivalente a um modelo de 4B parâmetros — o que altera diretamente o cálculo de custo por token em implantações auto-hospedadas.

A combinação de licença permissiva, arquitetura MoE eficiente e contexto de 256K posiciona o modelo como alternativa concreta a APIs proprietárias para equipes que operam sob restrições de soberania de dados ou que precisam executar cargas de trabalho longas em hardware de consumidor, como GPUs com 24GB de VRAM.

Who should care

CTOs de empresas em setores regulados (saúde, financeiro, jurídico) que precisam de raciocínio de alta capacidade sem enviar dados a APIs externas, arquitetos de pipelines RAG que atingem limites de contexto em modelos menores, e engenheiros de plataformas de IA que buscam maximizar throughput em clusters GPU de custo fixo — o perfil MoE permite batches maiores com a mesma VRAM que um modelo denso de 4B.