Google open-weights — quantizações nativas (INT4/MX), bom equilíbrio capacidade/custo pra small models.
Família pequena (2B/9B/27B) otimizada pra edge. Quantizações MX-format saem direto da Google com qualidade preservada. Ideal pra inference on-device ou serverless de baixa latência. Não compete em capacidade com Llama 4 70B+, mas no espaço small open-weights está entre os melhores. Pilotar em workloads onde o caso é "modelo pequeno + bom o suficiente" em vez de "frontier".