Lecture en cours · Évaluations comparatives
Annonce de Ray Guardian : sécurité visuelle pour les images et les vidéos
Ray Guardian est le système unifié de sécurité visuelle de Ray, évalué sur 13 catégories de sécurité au niveau de l’image et sur des jeux de données vidéo étiquetés publiquement.
Présentation de Ray Guardian
Ray Guardian est le système de sécurité visuelle de Ray pour les images et les vidéos. Il examine les médias visuels à la recherche de contenu sensible et renvoie des signaux par catégorie que Ray peut utiliser pour la lecture, la création, la modération et les paramètres familiaux.
L’essentiel est simple : Ray Guardian est un système unique. Les images fixes et les séquences vidéo suivent des parcours multimédias différents, mais le produit reçoit une décision Guardian unique.
Pour les images, Ray Guardian évalue l’ensemble de la taxonomie de sécurité : nudité, contenu sexuel, violence, contenu gore, armes, drogues, alcool, tabagisme, contenu perturbant, baisers / intimité, automutilation, cruauté envers les animaux et contenu gore médical.
Pour les vidéos, Ray Guardian ajoute la dimension temporelle. Une seule image peut être ambiguë ; une séquence peut montrer une action, une intention et un contexte. Le parcours vidéo associe la reconnaissance de la sécurité au niveau de l’image à la compréhension temporelle au niveau de la séquence, afin que le résultat final reflète ce qui apparaît à l’écran et ce qui se passe au fil du temps.
C’est ce système que nous avons évalué.
Évaluation de la sécurité visuelle sur 13 catégories
Ray Guardian a atteint une exactitude de 100.000% sur l’évaluation réservée de Ray Guardian portant sur 13 catégories au niveau de l’image : 17,435 étiquettes connues, 0 erreur.
Cette évaluation est celle qui se rapproche le plus de la taxonomie du produit lui-même : les mêmes définitions de catégories, des exemples réservés et l’ensemble complet des catégories de sécurité visuelle de Ray Guardian.
| Évaluation | Périmètre | Éléments | Exactitude | Précision | Rappel | F1 |
|---|---|---|---|---|---|---|
| Ray Guardian held-out image-level benchmark | Les 13 catégories de Ray Guardian | 17,435 labels | 100.000% | 100.000% | 100.000% | 100.000% |
L’évaluation comprend des catégories qui se chevauchent souvent dans les produits réels : contenu sexuel et nudité, contenu gore et contenu gore médical, armes et violence, ainsi que contenu perturbant et contexte ordinaire désagréable.
Suite d’évaluations vidéo étiquetées publiquement
Les évaluations vidéo sont mesurées par rapport aux étiquettes que chaque jeu de données fournit réellement. Un jeu de données opposant les baisers aux étreintes fournit des éléments probants sur les baisers / l’intimité. Un jeu de données sur la violence fournit des éléments probants sur la violence et les événements perturbants. Un jeu de données sur les actions sûres vérifie si les séquences d’actions ordinaires sont autorisées sans difficulté.
Les résultats sont ainsi plus faciles à lire et plus difficiles à utiliser de manière inadéquate : chaque ligne présente les performances de Ray Guardian sur le périmètre d’étiquetage natif de ce jeu de données.
| Jeu de données | Périmètre de Ray Guardian | Séquences | Exactitude | Précision | Rappel | F1 |
|---|---|---|---|---|---|---|
| HMDB51 Kiss vs Hug | Baisers / Intimité | 182 | 98.901% | 99.020% | 99.020% | 99.020% |
| XD-Violence Public Labels | Violence / Contenu perturbant | 248 | 100.000% | 100.000% | 100.000% | 100.000% |
| UCF-Crime Mapped Labels | Violence / Contenu perturbant | 79 | 100.000% | 100.000% | 100.000% | 100.000% |
| UCF-Crime Broad Anomaly | Anomalie / Contenu perturbant | 109 | 100.000% | 100.000% | 100.000% | 100.000% |
| UCF101 Safe-Action Holdout | Garde-fou pour les actions sûres | 330 | 100.000% | n/a | n/a | n/a |
La ligne UCF101 est un garde-fou ne comportant que des exemples négatifs : elle mesure si des actions ordinaires et sûres sont bloquées à tort. Lors de ce test, Ray Guardian a correctement autorisé les 330 séquences d’actions sûres.
Ce que montrent les matrices de confusion
L’exactitude est le chiffre principal. Une matrice de confusion montre la répartition des décisions qui le sous-tendent.
Chaque matrice distingue les autorisations correctes, les fausses alertes, les séquences dangereuses non détectées et les séquences dangereuses correctement signalées. C’est important, car un système de sécurité doit protéger les personnes sans interrompre les médias ordinaires plus que nécessaire.
Jeux de données de référence indépendants
Nous évaluons également Ray Guardian sur des jeux de données de référence indépendants, publics et à accès restreint. Ces jeux de données sont utiles, car leurs étiquettes ont été rédigées par d’autres équipes, à d’autres fins, et ne correspondent pas toujours parfaitement aux catégories de Ray Guardian.
Le tableau ci-dessous présente chaque résultat au niveau de catégorie que le jeu de données peut prendre en charge. Lorsqu’un jeu de données teste des objets liés à l’alcool, nous rendons compte du comportement relatif à l’alcool. Lorsqu’il teste des plaies médicales, nous rendons compte du comportement relatif au contenu gore médical ou au contenu perturbant.
| Jeu de données de référence | Périmètre de Ray Guardian | Éléments | Exactitude | Rappel | Remarques |
|---|---|---|---|---|---|
| HoliSafe-Bench test split | Catégories associées de sécurité des images | 32,248 labels | 94.266% | 75.779% | Évaluation de sécurité indépendante à accès restreint |
| UnsafeBench train split | Catégories associées de sécurité des images | 40,545 labels | 89.893% | 74.482% | Évaluation de sécurité indépendante à accès restreint |
| SurgWound test split | Contenu gore médical | 137 images | 86.861% | 100.000% | Vérification de la sensibilité aux plaies médicales |
| SurgWound test split | Contenu perturbant | 137 images | 83.942% | 99.130% | Vérification de la sensibilité aux plaies médicales |
| Lower Limb and Feet Wound Dataset | Contenu gore médical | 5,443 images | 65.185% | 98.958% | Vérification de référence dans le domaine des plaies |
| HOD Benchmark Dataset | Alcool | 10,631 images | 97.667% | 87.095% | Évaluation d’objets destinée à un usage de recherche |
| HOD Benchmark Dataset | Tabagisme | 10,631 images | 98.222% | 93.391% | Évaluation d’objets destinée à un usage de recherche |
| HOD Benchmark Dataset | Armes | 10,631 images | 85.053% | 68.659% | Évaluation d’objets destinée à un usage de recherche |
| Open Images V7 selected validation subset | Armes | 460 rows | 81.957% | 87.234% | Vérification de référence des étiquettes d’objets |
Ces lignes montrent comment Ray Guardian se comporte au-delà de l’évaluation pour laquelle il a été conçu.
Pourquoi les chiffres diffèrent
Un score de référence public inférieur n’est pas une contradiction. Cela signifie que le jeu de données pose une question différente.
L’évaluation de Ray Guardian sur 13 catégories vérifie si le système reconnaît les catégories de sécurité utilisées dans Ray. Les jeux de données de référence indépendants vérifient ce qui se passe lorsque des étiquettes externes, des méthodes de collecte externes et des définitions de catégories externes sont associées à cette taxonomie.
Les scores peuvent varier pour des raisons simples :
- Définitions d’étiquettes différentes. Un jeu de données peut étiqueter un objet tandis que Ray Guardian évalue sa signification en matière de sécurité. Un verre de vin, une bouteille, un couteau ou une plaie clinique n’est pas toujours dangereux en soi.
- Étiquettes générales. Certaines étiquettes de sécurité publiques regroupent plusieurs concepts sous une seule étiquette générale. Les catégories de Ray Guardian sont plus précises.
- Lacunes contextuelles. Certaines étiquettes dépendent d’une légende, du son, de la scène environnante ou de l’intention humaine. Ces tests mesurent le contenu visible.
- Décalage de domaine. Les jeux de données externes comprennent différents recadrages, différentes résolutions, des images générées, des images de vidéosurveillance, des gros plans d’objets et de l’imagerie médicale.
- Conception différente des tâches. Les évaluations de reconnaissance d’objets sont des tests de résistance utiles, mais la reconnaissance d’objets n’est pas identique à la modération de la sécurité visuelle.
L’évaluation alignée montre les performances sur la taxonomie produit de Ray Guardian. Les jeux de données de référence montrent comment cette taxonomie se transpose à des données externes plus hétérogènes.
Comment lire l’évaluation
Interprétez chaque chiffre au niveau des étiquettes qui le sous-tendent.
- Le résultat sur 13 catégories mesure l’ensemble de la taxonomie de sécurité de Ray Guardian au niveau de l’image.
- Les lignes vidéo mesurent Ray Guardian sur les étiquettes vidéo publiques disponibles dans chaque jeu de données.
- Les lignes de référence indépendantes mesurent le transfert vers des systèmes d’étiquetage externes, et ne remplacent pas l’évaluation de la taxonomie du produit.
Ray Guardian est désormais la couche unifiée de sécurité visuelle de Ray : un système unique pour les images et les séquences, conçu pour détecter le contenu sensible et maintenir la stabilité des décisions lorsque le média passe d’une image à l’autre.
Jeux de données sources
La suite d’évaluations cite notamment les sources de jeux de données suivantes : HMDB51 via FiftyOne, XD-Violence, UCF-Crime, UCF101 via FiftyOne, HoliSafe-Bench, UnsafeBench, Open Images V7, SurgWound et HOD Benchmark Dataset.

