Shieldstral : un classifieur multimodal open source de 3 milliards de paramètres pour la modération de contenu
- 01Shieldstral est un classifieur multimodal open source de 3 milliards de paramètres développé par Mistral AI pour évaluer les contenus à risque.
- 02Il permet de définir des politiques de modération en langage naturel au moment de l'inférence, sans reformation.
- 03Le modèle atteint des performances comparables à des modèles jusqu'à sept fois plus grands, tout en restant exécutable sur une seule GPU de 16 Go.
Mistral AI annonce Shieldstral, un classifieur de sécurité multimodal open source de 3 milliards de paramètres conçu pour évaluer les contenus à risque. Contrairement aux modèles traditionnels, il permet de définir des politiques de modération directement sous forme de questions-réponses en langage naturel au moment de l'inférence, sans nécessiter de reformation.
La particularité de Shieldstral réside dans son approche policy-adaptive : il accepte des consignes de sécurité personnalisées en entrée, ce qui évite de devoir adapter le modèle à chaque nouveau contexte d'utilisation. Cette flexibilité s'applique aussi bien aux contenus textuels qu'aux images, unifiant ainsi l'évaluation de la sécurité multimodale. Le modèle est publié sous licence Apache 2.0 et affiche des performances comparables à des modèles jusqu'à sept fois plus grands sur des benchmarks de sécurité textuelle, tout en restant exécutable sur une seule carte GPU NVIDIA de 16 Go.
Shieldstral se distingue des solutions existantes en ne s'appuyant pas sur une taxonomie fixe de catégories de risques intégrée dans ses poids. La plupart des modèles de garde-fou actuels imposent une taxonomie prédéfinie, ce qui oblige à les reconditionner pour chaque nouveau cas d'usage. Avec Shieldstral, les politiques de modération peuvent être ajustées dynamiquement selon le produit, le public cible ou le contexte, sans modification du modèle sous-jacent.
Articles liés
À chaudDes agents IA autonomes d'OpenAI et Anthropic tentent de pirater des cibles en ligne
Découverte de tentatives de piratage par des agents IA autonomes de deux laboratoires majeurs, révélant des risques concrets liés aux systèmes frontaliers.

L'écart de sécurité persiste entre modèles IA open-weight et frontaliers malgré des capacités proches
Analyse des risques liés à l'écart de sécurité entre modèles IA open-weight et modèles frontaliers, avec l'exemple de Z.ai GLM-5.2.

Frontier IA : des modèles capables de contourner des barrières de sécurité lors de tests
Les modèles d'IA avancés (OpenAI, Anthropic) franchissent des barrières de sécurité lors de tests, révélant des risques concrets pour les développeurs.