Shieldstral : un classifieur multimodal open source de 3 milliards de paramètres pour la modération de contenu
- 01Shieldstral est un classifieur multimodal open source de 3 milliards de paramètres développé par Mistral AI pour évaluer les contenus à risque.
- 02Il permet de définir des politiques de modération en langage naturel au moment de l'inférence, sans reformation.
- 03Le modèle atteint des performances comparables à des modèles jusqu'à sept fois plus grands, tout en restant exécutable sur une seule GPU de 16 Go.
Mistral AI annonce Shieldstral, un classifieur de sécurité multimodal open source de 3 milliards de paramètres conçu pour évaluer les contenus à risque. Contrairement aux modèles traditionnels, il permet de définir des politiques de modération directement sous forme de questions-réponses en langage naturel au moment de l'inférence, sans nécessiter de reformation.
La particularité de Shieldstral réside dans son approche policy-adaptive : il accepte des consignes de sécurité personnalisées en entrée, ce qui évite de devoir adapter le modèle à chaque nouveau contexte d'utilisation. Cette flexibilité s'applique aussi bien aux contenus textuels qu'aux images, unifiant ainsi l'évaluation de la sécurité multimodale. Le modèle est publié sous licence Apache 2.0 et affiche des performances comparables à des modèles jusqu'à sept fois plus grands sur des benchmarks de sécurité textuelle, tout en restant exécutable sur une seule carte GPU NVIDIA de 16 Go.
Shieldstral se distingue des solutions existantes en ne s'appuyant pas sur une taxonomie fixe de catégories de risques intégrée dans ses poids. La plupart des modèles de garde-fou actuels imposent une taxonomie prédéfinie, ce qui oblige à les reconditionner pour chaque nouveau cas d'usage. Avec Shieldstral, les politiques de modération peuvent être ajustées dynamiquement selon le produit, le public cible ou le contexte, sans modification du modèle sous-jacent.
Articles liés
Mistral publie Shieldstral, un classificateur de sécurité open source de 3 milliards de paramètres
Découvrez comment ce petit modèle open source repousse les limites de la sécurité IA avec des performances supérieures à des modèles 7 fois plus grands.
Mistral publie Shieldstral, un classifieur de sécurité multimodal open weights de 3 milliards de paramètres
Découvrez Shieldstral, un outil open-weights pour évaluer la sécurité des modèles multimodaux, avec des performances supérieures à des modèles 7 fois plus grands.

OpenAI expérimente une technique de raisonnement à récurrence opaque avec Astra
Décryptage de la nouvelle méthode de raisonnement d'OpenAI, ses implications pour la sécurité des IA et les débats qu'elle suscite.