Gemma 4 E2B é um modelo denso multimodal de 2,3B parâmetros efetivos (5,1B com embeddings) da Google DeepMind, licenciado sob Apache 2.0, otimizado para execução local em dispositivos móveis e laptops com suporte a texto, imagem e áudio em janela de contexto de 128K tokens.
The lab published no verifiable benchmark for this model.
Com MMLU Pro de 60,0% e LiveCodeBench v6 de 44,0%, o E2B supera o Gemma 3 27B (sem thinking) em AIME 2026 — 37,5% contra 20,8% — apesar de operar com uma fração do tamanho, o que redefine a relação custo-capacidade para inferência on-device. A janela de 128K tokens em um modelo executável em smartphones habilita casos de uso de contexto longo historicamente restritos a infraestrutura de servidor.
O suporte nativo a áudio no menor modelo da família, combinado com licença permissiva e arquitetura otimizada para hardware de borda, posiciona o E2B como opção concreta para cenários offline e de baixa latência — relevante para setores regulados onde dados não podem sair do dispositivo.
CTOs de empresas em setores regulados (saúde, finanças, jurídico) que precisam de inferência local com restrições de privacidade, engenheiros de produto desenvolvendo assistentes multimodais para mobile e edge, e arquitetos de sistemas embarcados que buscam capacidade de raciocínio e contexto longo sem dependência de API externa ou GPU dedicada.