Skip to main content
Bibliothèque

Lecture en cours · Évaluations comparatives

Annonce de Ray Guardian : sécurité visuelle pour les images et les vidéos

Ray Guardian est le système unifié de sécurité visuelle de Ray, évalué sur 13 catégories de sécurité au niveau de l’image et sur des jeux de données vidéo étiquetés publiquement.

Ray Team4 AOÛT 20267 min read

Présentation de Ray Guardian

Ray Guardian est le système de sécurité visuelle de Ray pour les images et les vidéos. Il examine les médias visuels à la recherche de contenu sensible et renvoie des signaux par catégorie que Ray peut utiliser pour la lecture, la création, la modération et les paramètres familiaux.

L’essentiel est simple : Ray Guardian est un système unique. Les images fixes et les séquences vidéo suivent des parcours multimédias différents, mais le produit reçoit une décision Guardian unique.

Pour les images, Ray Guardian évalue l’ensemble de la taxonomie de sécurité : nudité, contenu sexuel, violence, contenu gore, armes, drogues, alcool, tabagisme, contenu perturbant, baisers / intimité, automutilation, cruauté envers les animaux et contenu gore médical.

Pour les vidéos, Ray Guardian ajoute la dimension temporelle. Une seule image peut être ambiguë ; une séquence peut montrer une action, une intention et un contexte. Le parcours vidéo associe la reconnaissance de la sécurité au niveau de l’image à la compréhension temporelle au niveau de la séquence, afin que le résultat final reflète ce qui apparaît à l’écran et ce qui se passe au fil du temps.

C’est ce système que nous avons évalué.

Évaluation de la sécurité visuelle sur 13 catégories

Ray Guardian a atteint une exactitude de 100.000% sur l’évaluation réservée de Ray Guardian portant sur 13 catégories au niveau de l’image : 17,435 étiquettes connues, 0 erreur.

Cette évaluation est celle qui se rapproche le plus de la taxonomie du produit lui-même : les mêmes définitions de catégories, des exemples réservés et l’ensemble complet des catégories de sécurité visuelle de Ray Guardian.

ÉvaluationPérimètreÉlémentsExactitudePrécisionRappelF1
Ray Guardian held-out image-level benchmarkLes 13 catégories de Ray Guardian17,435 labels100.000%100.000%100.000%100.000%

L’évaluation comprend des catégories qui se chevauchent souvent dans les produits réels : contenu sexuel et nudité, contenu gore et contenu gore médical, armes et violence, ainsi que contenu perturbant et contexte ordinaire désagréable.

Suite d’évaluations vidéo étiquetées publiquement

Les évaluations vidéo sont mesurées par rapport aux étiquettes que chaque jeu de données fournit réellement. Un jeu de données opposant les baisers aux étreintes fournit des éléments probants sur les baisers / l’intimité. Un jeu de données sur la violence fournit des éléments probants sur la violence et les événements perturbants. Un jeu de données sur les actions sûres vérifie si les séquences d’actions ordinaires sont autorisées sans difficulté.

Les résultats sont ainsi plus faciles à lire et plus difficiles à utiliser de manière inadéquate : chaque ligne présente les performances de Ray Guardian sur le périmètre d’étiquetage natif de ce jeu de données.

Jeu de donnéesPérimètre de Ray GuardianSéquencesExactitudePrécisionRappelF1
HMDB51 Kiss vs HugBaisers / Intimité18298.901%99.020%99.020%99.020%
XD-Violence Public LabelsViolence / Contenu perturbant248100.000%100.000%100.000%100.000%
UCF-Crime Mapped LabelsViolence / Contenu perturbant79100.000%100.000%100.000%100.000%
UCF-Crime Broad AnomalyAnomalie / Contenu perturbant109100.000%100.000%100.000%100.000%
UCF101 Safe-Action HoldoutGarde-fou pour les actions sûres330100.000%n/an/an/a

La ligne UCF101 est un garde-fou ne comportant que des exemples négatifs : elle mesure si des actions ordinaires et sûres sont bloquées à tort. Lors de ce test, Ray Guardian a correctement autorisé les 330 séquences d’actions sûres.

Ce que montrent les matrices de confusion

L’exactitude est le chiffre principal. Une matrice de confusion montre la répartition des décisions qui le sous-tendent.

Chaque matrice distingue les autorisations correctes, les fausses alertes, les séquences dangereuses non détectées et les séquences dangereuses correctement signalées. C’est important, car un système de sécurité doit protéger les personnes sans interrompre les médias ordinaires plus que nécessaire.

Jeux de données de référence indépendants

Nous évaluons également Ray Guardian sur des jeux de données de référence indépendants, publics et à accès restreint. Ces jeux de données sont utiles, car leurs étiquettes ont été rédigées par d’autres équipes, à d’autres fins, et ne correspondent pas toujours parfaitement aux catégories de Ray Guardian.

Le tableau ci-dessous présente chaque résultat au niveau de catégorie que le jeu de données peut prendre en charge. Lorsqu’un jeu de données teste des objets liés à l’alcool, nous rendons compte du comportement relatif à l’alcool. Lorsqu’il teste des plaies médicales, nous rendons compte du comportement relatif au contenu gore médical ou au contenu perturbant.

Jeu de données de référencePérimètre de Ray GuardianÉlémentsExactitudeRappelRemarques
HoliSafe-Bench test splitCatégories associées de sécurité des images32,248 labels94.266%75.779%Évaluation de sécurité indépendante à accès restreint
UnsafeBench train splitCatégories associées de sécurité des images40,545 labels89.893%74.482%Évaluation de sécurité indépendante à accès restreint
SurgWound test splitContenu gore médical137 images86.861%100.000%Vérification de la sensibilité aux plaies médicales
SurgWound test splitContenu perturbant137 images83.942%99.130%Vérification de la sensibilité aux plaies médicales
Lower Limb and Feet Wound DatasetContenu gore médical5,443 images65.185%98.958%Vérification de référence dans le domaine des plaies
HOD Benchmark DatasetAlcool10,631 images97.667%87.095%Évaluation d’objets destinée à un usage de recherche
HOD Benchmark DatasetTabagisme10,631 images98.222%93.391%Évaluation d’objets destinée à un usage de recherche
HOD Benchmark DatasetArmes10,631 images85.053%68.659%Évaluation d’objets destinée à un usage de recherche
Open Images V7 selected validation subsetArmes460 rows81.957%87.234%Vérification de référence des étiquettes d’objets

Ces lignes montrent comment Ray Guardian se comporte au-delà de l’évaluation pour laquelle il a été conçu.

Pourquoi les chiffres diffèrent

Un score de référence public inférieur n’est pas une contradiction. Cela signifie que le jeu de données pose une question différente.

L’évaluation de Ray Guardian sur 13 catégories vérifie si le système reconnaît les catégories de sécurité utilisées dans Ray. Les jeux de données de référence indépendants vérifient ce qui se passe lorsque des étiquettes externes, des méthodes de collecte externes et des définitions de catégories externes sont associées à cette taxonomie.

Les scores peuvent varier pour des raisons simples :

  • Définitions d’étiquettes différentes. Un jeu de données peut étiqueter un objet tandis que Ray Guardian évalue sa signification en matière de sécurité. Un verre de vin, une bouteille, un couteau ou une plaie clinique n’est pas toujours dangereux en soi.
  • Étiquettes générales. Certaines étiquettes de sécurité publiques regroupent plusieurs concepts sous une seule étiquette générale. Les catégories de Ray Guardian sont plus précises.
  • Lacunes contextuelles. Certaines étiquettes dépendent d’une légende, du son, de la scène environnante ou de l’intention humaine. Ces tests mesurent le contenu visible.
  • Décalage de domaine. Les jeux de données externes comprennent différents recadrages, différentes résolutions, des images générées, des images de vidéosurveillance, des gros plans d’objets et de l’imagerie médicale.
  • Conception différente des tâches. Les évaluations de reconnaissance d’objets sont des tests de résistance utiles, mais la reconnaissance d’objets n’est pas identique à la modération de la sécurité visuelle.

L’évaluation alignée montre les performances sur la taxonomie produit de Ray Guardian. Les jeux de données de référence montrent comment cette taxonomie se transpose à des données externes plus hétérogènes.

Comment lire l’évaluation

Interprétez chaque chiffre au niveau des étiquettes qui le sous-tendent.

  • Le résultat sur 13 catégories mesure l’ensemble de la taxonomie de sécurité de Ray Guardian au niveau de l’image.
  • Les lignes vidéo mesurent Ray Guardian sur les étiquettes vidéo publiques disponibles dans chaque jeu de données.
  • Les lignes de référence indépendantes mesurent le transfert vers des systèmes d’étiquetage externes, et ne remplacent pas l’évaluation de la taxonomie du produit.

Ray Guardian est désormais la couche unifiée de sécurité visuelle de Ray : un système unique pour les images et les séquences, conçu pour détecter le contenu sensible et maintenir la stabilité des décisions lorsque le média passe d’une image à l’autre.

Jeux de données sources

La suite d’évaluations cite notamment les sources de jeux de données suivantes : HMDB51 via FiftyOne, XD-Violence, UCF-Crime, UCF101 via FiftyOne, HoliSafe-Bench, UnsafeBench, Open Images V7, SurgWound et HOD Benchmark Dataset.

Subscribe to the Ray newsletter. Product updates, release notes, and customer news.

No spam. Just the Ray newsletter and important product updates.

Ray JournalÉvaluations comparatives2026-08-04

Annonce de Ray Guardian : sécurité visuelle pour les images et les vidéos

Ray Guardian est le système unifié de sécurité visuelle de Ray, évalué sur 13 catégories de sécurité au niveau de l’image et sur des jeux de données vidéo étiquetés publiquement.

Ray Team2026-08-047 min read

Présentation de Ray Guardian

Ray Guardian est le système de sécurité visuelle de Ray pour les images et les vidéos. Il examine les médias visuels à la recherche de contenu sensible et renvoie des signaux par catégorie que Ray peut utiliser pour la lecture, la création, la modération et les paramètres familiaux.

L’essentiel est simple : Ray Guardian est un système unique. Les images fixes et les séquences vidéo suivent des parcours multimédias différents, mais le produit reçoit une décision Guardian unique.

Pour les images, Ray Guardian évalue l’ensemble de la taxonomie de sécurité : nudité, contenu sexuel, violence, contenu gore, armes, drogues, alcool, tabagisme, contenu perturbant, baisers / intimité, automutilation, cruauté envers les animaux et contenu gore médical.

Pour les vidéos, Ray Guardian ajoute la dimension temporelle. Une seule image peut être ambiguë ; une séquence peut montrer une action, une intention et un contexte. Le parcours vidéo associe la reconnaissance de la sécurité au niveau de l’image à la compréhension temporelle au niveau de la séquence, afin que le résultat final reflète ce qui apparaît à l’écran et ce qui se passe au fil du temps.

C’est ce système que nous avons évalué.

Évaluation de la sécurité visuelle sur 13 catégories

Ray Guardian a atteint une exactitude de 100.000% sur l’évaluation réservée de Ray Guardian portant sur 13 catégories au niveau de l’image : 17,435 étiquettes connues, 0 erreur.

Cette évaluation est celle qui se rapproche le plus de la taxonomie du produit lui-même : les mêmes définitions de catégories, des exemples réservés et l’ensemble complet des catégories de sécurité visuelle de Ray Guardian.

ÉvaluationPérimètreÉlémentsExactitudePrécisionRappelF1
Ray Guardian held-out image-level benchmarkLes 13 catégories de Ray Guardian17,435 labels100.000%100.000%100.000%100.000%

L’évaluation comprend des catégories qui se chevauchent souvent dans les produits réels : contenu sexuel et nudité, contenu gore et contenu gore médical, armes et violence, ainsi que contenu perturbant et contexte ordinaire désagréable.

Suite d’évaluations vidéo étiquetées publiquement

Les évaluations vidéo sont mesurées par rapport aux étiquettes que chaque jeu de données fournit réellement. Un jeu de données opposant les baisers aux étreintes fournit des éléments probants sur les baisers / l’intimité. Un jeu de données sur la violence fournit des éléments probants sur la violence et les événements perturbants. Un jeu de données sur les actions sûres vérifie si les séquences d’actions ordinaires sont autorisées sans difficulté.

Les résultats sont ainsi plus faciles à lire et plus difficiles à utiliser de manière inadéquate : chaque ligne présente les performances de Ray Guardian sur le périmètre d’étiquetage natif de ce jeu de données.

Jeu de donnéesPérimètre de Ray GuardianSéquencesExactitudePrécisionRappelF1
HMDB51 Kiss vs HugBaisers / Intimité18298.901%99.020%99.020%99.020%
XD-Violence Public LabelsViolence / Contenu perturbant248100.000%100.000%100.000%100.000%
UCF-Crime Mapped LabelsViolence / Contenu perturbant79100.000%100.000%100.000%100.000%
UCF-Crime Broad AnomalyAnomalie / Contenu perturbant109100.000%100.000%100.000%100.000%
UCF101 Safe-Action HoldoutGarde-fou pour les actions sûres330100.000%n/an/an/a

La ligne UCF101 est un garde-fou ne comportant que des exemples négatifs : elle mesure si des actions ordinaires et sûres sont bloquées à tort. Lors de ce test, Ray Guardian a correctement autorisé les 330 séquences d’actions sûres.

Ce que montrent les matrices de confusion

L’exactitude est le chiffre principal. Une matrice de confusion montre la répartition des décisions qui le sous-tendent.

Chaque matrice distingue les autorisations correctes, les fausses alertes, les séquences dangereuses non détectées et les séquences dangereuses correctement signalées. C’est important, car un système de sécurité doit protéger les personnes sans interrompre les médias ordinaires plus que nécessaire.

Jeux de données de référence indépendants

Nous évaluons également Ray Guardian sur des jeux de données de référence indépendants, publics et à accès restreint. Ces jeux de données sont utiles, car leurs étiquettes ont été rédigées par d’autres équipes, à d’autres fins, et ne correspondent pas toujours parfaitement aux catégories de Ray Guardian.

Le tableau ci-dessous présente chaque résultat au niveau de catégorie que le jeu de données peut prendre en charge. Lorsqu’un jeu de données teste des objets liés à l’alcool, nous rendons compte du comportement relatif à l’alcool. Lorsqu’il teste des plaies médicales, nous rendons compte du comportement relatif au contenu gore médical ou au contenu perturbant.

Jeu de données de référencePérimètre de Ray GuardianÉlémentsExactitudeRappelRemarques
HoliSafe-Bench test splitCatégories associées de sécurité des images32,248 labels94.266%75.779%Évaluation de sécurité indépendante à accès restreint
UnsafeBench train splitCatégories associées de sécurité des images40,545 labels89.893%74.482%Évaluation de sécurité indépendante à accès restreint
SurgWound test splitContenu gore médical137 images86.861%100.000%Vérification de la sensibilité aux plaies médicales
SurgWound test splitContenu perturbant137 images83.942%99.130%Vérification de la sensibilité aux plaies médicales
Lower Limb and Feet Wound DatasetContenu gore médical5,443 images65.185%98.958%Vérification de référence dans le domaine des plaies
HOD Benchmark DatasetAlcool10,631 images97.667%87.095%Évaluation d’objets destinée à un usage de recherche
HOD Benchmark DatasetTabagisme10,631 images98.222%93.391%Évaluation d’objets destinée à un usage de recherche
HOD Benchmark DatasetArmes10,631 images85.053%68.659%Évaluation d’objets destinée à un usage de recherche
Open Images V7 selected validation subsetArmes460 rows81.957%87.234%Vérification de référence des étiquettes d’objets

Ces lignes montrent comment Ray Guardian se comporte au-delà de l’évaluation pour laquelle il a été conçu.

Pourquoi les chiffres diffèrent

Un score de référence public inférieur n’est pas une contradiction. Cela signifie que le jeu de données pose une question différente.

L’évaluation de Ray Guardian sur 13 catégories vérifie si le système reconnaît les catégories de sécurité utilisées dans Ray. Les jeux de données de référence indépendants vérifient ce qui se passe lorsque des étiquettes externes, des méthodes de collecte externes et des définitions de catégories externes sont associées à cette taxonomie.

Les scores peuvent varier pour des raisons simples :

  • Définitions d’étiquettes différentes. Un jeu de données peut étiqueter un objet tandis que Ray Guardian évalue sa signification en matière de sécurité. Un verre de vin, une bouteille, un couteau ou une plaie clinique n’est pas toujours dangereux en soi.
  • Étiquettes générales. Certaines étiquettes de sécurité publiques regroupent plusieurs concepts sous une seule étiquette générale. Les catégories de Ray Guardian sont plus précises.
  • Lacunes contextuelles. Certaines étiquettes dépendent d’une légende, du son, de la scène environnante ou de l’intention humaine. Ces tests mesurent le contenu visible.
  • Décalage de domaine. Les jeux de données externes comprennent différents recadrages, différentes résolutions, des images générées, des images de vidéosurveillance, des gros plans d’objets et de l’imagerie médicale.
  • Conception différente des tâches. Les évaluations de reconnaissance d’objets sont des tests de résistance utiles, mais la reconnaissance d’objets n’est pas identique à la modération de la sécurité visuelle.

L’évaluation alignée montre les performances sur la taxonomie produit de Ray Guardian. Les jeux de données de référence montrent comment cette taxonomie se transpose à des données externes plus hétérogènes.

Comment lire l’évaluation

Interprétez chaque chiffre au niveau des étiquettes qui le sous-tendent.

  • Le résultat sur 13 catégories mesure l’ensemble de la taxonomie de sécurité de Ray Guardian au niveau de l’image.
  • Les lignes vidéo mesurent Ray Guardian sur les étiquettes vidéo publiques disponibles dans chaque jeu de données.
  • Les lignes de référence indépendantes mesurent le transfert vers des systèmes d’étiquetage externes, et ne remplacent pas l’évaluation de la taxonomie du produit.

Ray Guardian est désormais la couche unifiée de sécurité visuelle de Ray : un système unique pour les images et les séquences, conçu pour détecter le contenu sensible et maintenir la stabilité des décisions lorsque le média passe d’une image à l’autre.

Jeux de données sources

La suite d’évaluations cite notamment les sources de jeux de données suivantes : HMDB51 via FiftyOne, XD-Violence, UCF-Crime, UCF101 via FiftyOne, HoliSafe-Bench, UnsafeBench, Open Images V7, SurgWound et HOD Benchmark Dataset.

Subscribe to the Ray newsletter. Product updates, release notes, and customer news.

No spam. Just the Ray newsletter and important product updates.

Poursuivre la lecture

Benchmark ASR de Ray : 98 langues, résultats complets3 min readPourquoi chaque sous-titre que vous téléchargez est un pari — et comment Ray résout le problème2 min readFAQ Ray : tout ce que vous devez savoir2 min read