Mistral lança Shieldstral, classificador de segurança 3B igualando modelos 7x maiores em moderação multimodal
Mistral lançou Shieldstral em 4 de agosto de 2026, um classificador de segurança multimodal de 3B de código aberto sob Apache 2.0 que iguala ou supera modelos até 7x seu tamanho em segurança de texto, detecção de recusa e adaptabilidade de política. Diferentemente dos modelos tradicionais de proteção que codificam uma taxonomia fixa durante o treinamento, Shieldstral aceita políticas de segurança em linguagem natural no tempo de inferência, tornando um único checkpoint adaptável a novas regras de moderação sem retreinamento. O modelo roda em um único GPU NVIDIA de 16GB e unifica classificação de prompt, moderação de resposta, detecção de recusa e detecção de toxicidade em uma tarefa de pergunta-resposta binária.
Shieldstral leva três entradas na inferência: um campo <Instruct> definindo contexto de avaliação e rigor, um campo <Query> com uma pergunta de segurança sim/não (ex., 'Este conteúdo promove violência?'), e um campo <Document> contendo o conteúdo a avaliar (texto, imagem ou texto+imagem). O modelo produz apenas os logits sim/não, que são softmax-normalizados em um escore de segurança contínuo calibrado. Mistral treinou em 54,1M amostras de dados públicos e sintéticos com taxonomias divergentes, usando fine-tuning LoRA em Ministral-3B-Base-2512. Alcança 84,9% de F1 médio em benchmarks de segurança e resultados multimodais de ponta, com limitações documentadas em cobertura de idiomas árabe e indonésio.
Para construtores de infraestrutura implantando moderação: a injeção de política em tempo de inferência de Shieldstral é uma vitória estrutural para sistemas multi-inquilino ou com comutação de contexto. Modelos tradicionais de taxonomia fixa forçam retreinamento por domínio; a abordagem baseada em prompt de Mistral significa que equipes podem entregar diferentes posturas de segurança a diferentes públicos sem proliferação de modelos. Isto é relevante para qualquer produto moderando saídas de LLM, imagens ou conteúdo gerado pelo usuário em escala, onde a deriva de política acontece mais rápido que ciclos de retreinamento. Shieldstral é o terceiro modelo de moderação da Mistral, mas o primeiro lançado como código aberto—sinalizando um deslocamento de fossos de API proprietários para construção de ecossistema em segurança de conteúdo.
Fontes
- Primary source
- Mistral: Introducing Shieldstral
“3B open-weights multimodal safety classifier that outperforms models up to 7x its size”
- Hugging Face: Shieldstral model card
“Runs on single 16GB NVIDIA GPU, policy-adaptive, matches models up to 7x larger”
- arXiv: Shieldstral technical report
“Matches or outperforms models nearly 7x its size, 84.9% F1 on safety benchmarks”