Gemma 4 E2B é um modelo denso multimodal de 2,3B parâmetros efetivos (5,1B com embeddings) da Google DeepMind, licenciado em Apache 2.0, com suporte a texto, imagem e áudio em janela de contexto de 128K tokens — posicionado para inferência local em dispositivos móveis e laptops.
The lab published no verifiable benchmark for this model.
A relação entre capacidade e custo de inferência é o argumento central: com apenas 2,3B parâmetros efetivos ativos, o E2B entrega suporte multimodal completo — incluindo áudio, ausente nos modelos maiores da família — em hardware de borda sem dependência de GPU de servidor. No benchmark MMLU Pro, atinge 60,0% e 37,5% no AIME 2026 sem ferramentas, números competitivos para a faixa de tamanho.
A licença Apache 2.0 elimina restrições de uso comercial que afetam modelos concorrentes de porte similar, e o suporte nativo a system prompt e function calling posiciona o E2B como opção concreta para pipelines agênticos executados localmente — relevante em contextos regulatórios onde dados não podem trafegar para APIs externas.
CTOs de empresas em setores regulados (saúde, financeiro, jurídico) que precisam de inferência multimodal on-premise sem envio de dados à nuvem, e engenheiros de produto desenvolvendo assistentes móveis ou de borda que necessitam processar texto, imagem e áudio em um único modelo com footprint de memória controlado.