Afspiller nu · Benchmarks
Præsentation af Ray Guardian: Visuel sikkerhed for billeder og video
Ray Guardian er Rays samlede system til visuel sikkerhed, benchmarktestet på tværs af 13 sikkerhedskategorier på billedniveau og offentligt mærkede videodatasæt.
Introduktion til Ray Guardian
Ray Guardian er Rays visuelle sikkerhedssystem til billeder og video. Det gennemgår visuelle medier for følsomt indhold og returnerer kategorisignaler, som Ray kan bruge til afspilning, oprettelse, moderation og familieindstillinger.
Det vigtige er enkelt: Ray Guardian er ét system. Stillbilleder og videoklip kommer ind via forskellige medieforløb, men produktet modtager én Guardian-afgørelse.
For billeder evaluerer Ray Guardian hele sikkerhedstaksonomien: nøgenhed, seksuelt indhold, vold, blodigt indhold, våben, stoffer, alkohol, rygning, foruroligende indhold, kys / intimitet, selvskade, dyremishandling og medicinsk blodigt indhold.
For video tilføjer Ray Guardian tid. Et enkelt billede kan være tvetydigt; et klip kan vise handling, hensigt og kontekst. Videoforløbet kombinerer sikkerhedsgenkendelse på billedniveau med tidsmæssig forståelse på klipniveau, så det endelige resultat afspejler, hvad der vises på skærmen, og hvad der sker over tid.
Det er det system, vi benchmarktestede.
Benchmark for visuel sikkerhed med 13 kategorier
Ray Guardian opnåede 100.000% nøjagtighed på Ray Guardians tilbageholdte billedbenchmark med 13 kategorier: 17,435 kendte mærkater, 0 fejl.
Dette benchmark ligger tættest på selve produkttaksonomien: de samme kategoridefinitioner, tilbageholdte eksempler og det fulde sæt af Ray Guardians kategorier for visuel sikkerhed.
| Benchmark | Omfang | Elementer | Nøjagtighed | Præcision | Genkaldelse | F1 |
|---|---|---|---|---|---|---|
| Ray Guardians tilbageholdte benchmark på billedniveau | Alle 13 Ray Guardian-kategorier | 17,435 labels | 100.000% | 100.000% | 100.000% | 100.000% |
Benchmarket omfatter kategorier, der ofte overlapper i virkelige produkter: seksuelt indhold kontra nøgenhed, blodigt indhold kontra medicinsk blodigt indhold, våben kontra vold og foruroligende indhold kontra almindelig ubehagelig kontekst.
Benchmarkserie med offentligt mærkede videoer
Videobenchmarks måles i forhold til de mærkater, som hvert datasæt faktisk indeholder. Et datasæt med kys kontra kram understøtter evidens for kys / intimitet. Et voldsdatasæt understøtter evidens for vold og foruroligende hændelser. Et datasæt med sikre handlinger tester, om almindelige handlingsklip får lov til at passere uden problemer.
Det gør resultaterne lettere at læse og sværere at misbruge: Hver række rapporterer Ray Guardians ydeevne inden for det pågældende datasæts oprindelige mærkatomfang.
| Datasæt | Ray Guardian-omfang | Klip | Nøjagtighed | Præcision | Genkaldelse | F1 |
|---|---|---|---|---|---|---|
| HMDB51 Kiss vs Hug | Kys / intimitet | 182 | 98.901% | 99.020% | 99.020% | 99.020% |
| XD-Violence Public Labels | Vold / foruroligende indhold | 248 | 100.000% | 100.000% | 100.000% | 100.000% |
| UCF-Crime Mapped Labels | Vold / foruroligende indhold | 79 | 100.000% | 100.000% | 100.000% | 100.000% |
| UCF-Crime Broad Anomaly | Anomali / foruroligende indhold | 109 | 100.000% | 100.000% | 100.000% | 100.000% |
| UCF101 Safe-Action Holdout | Sikkerhedsbarriere for sikre handlinger | 330 | 100.000% | n/a | n/a | n/a |
UCF101-rækken er en sikkerhedsbarriere med kun negative eksempler: Den måler, om almindelige sikre handlinger fejlagtigt blokeres. I denne test tillod Ray Guardian korrekt alle 330 klip med sikre handlinger.
Hvad forvekslingsmatricerne viser
Nøjagtighed er det overordnede tal. En forvekslingsmatrix viser formen på de afgørelser, der ligger bag.
Hver matrix adskiller korrekte tilladelser, falske alarmer, oversete usikre klip og korrekt markerede usikre klip. Det er vigtigt, fordi et sikkerhedssystem skal beskytte mennesker uden at afbryde almindelige medier mere end nødvendigt.
Uafhængige referencedatasæt
Vi evaluerer også Ray Guardian på uafhængige offentlige og adgangsbegrænsede referencedatasæt. Disse datasæt er nyttige, fordi deres mærkater blev udarbejdet af andre teams, til andre formål, og ikke altid passer perfekt med Ray Guardian-kategorierne.
Tabellen nedenfor rapporterer hvert resultat på det kategoriniveau, som datasættet kan understøtte. Når et datasæt tester alkoholgenstande, rapporterer vi alkoholadfærd. Når det tester medicinske sår, rapporterer vi medicinsk blodigt indhold eller foruroligende adfærd.
| Referencedatasæt | Ray Guardian-omfang | Elementer | Nøjagtighed | Genkaldelse | Bemærkninger |
|---|---|---|---|---|---|
| HoliSafe-Bench test split | Kortlagte billedsikkerhedskategorier | 32,248 labels | 94.266% | 75.779% | Uafhængigt adgangsbegrænset sikkerhedsbenchmark |
| UnsafeBench train split | Kortlagte billedsikkerhedskategorier | 40,545 labels | 89.893% | 74.482% | Uafhængigt adgangsbegrænset sikkerhedsbenchmark |
| SurgWound test split | Medicinsk blodigt indhold | 137 images | 86.861% | 100.000% | Sensitivitetstest for medicinske sår |
| SurgWound test split | Foruroligende indhold | 137 images | 83.942% | 99.130% | Sensitivitetstest for medicinske sår |
| Lower Limb and Feet Wound Dataset | Medicinsk blodigt indhold | 5,443 images | 65.185% | 98.958% | Referencetest for sårdomænet |
| HOD Benchmark Dataset | Alkohol | 10,631 images | 97.667% | 87.095% | Objektbenchmark til forskningsbrug |
| HOD Benchmark Dataset | Rygning | 10,631 images | 98.222% | 93.391% | Objektbenchmark til forskningsbrug |
| HOD Benchmark Dataset | Våben | 10,631 images | 85.053% | 68.659% | Objektbenchmark til forskningsbrug |
| Open Images V7 selected validation subset | Våben | 460 rows | 81.957% | 87.234% | Referencetest af objektmærkater |
Disse rækker viser, hvordan Ray Guardian fungerer ud over det benchmark, som systemet blev udviklet i forhold til.
Hvorfor tallene er forskellige
En lavere offentlig referencescore er ikke en modsigelse. Det betyder, at datasættet stiller et andet spørgsmål.
Ray Guardian-benchmarket med 13 kategorier spørger, om systemet genkender de sikkerhedskategorier, der bruges i Ray. De uafhængige referencedatasæt spørger, hvad der sker, når eksterne mærkater, eksterne indsamlingsmetoder og eksterne kategoridefinitioner kortlægges til denne taksonomi.
Scorerne kan ændre sig af enkle årsager:
- Forskellige mærkatdefinitioner. Et datasæt kan mærke en genstand, mens Ray Guardian vurderer dens sikkerhedsmæssige betydning. Et vinglas, en flaske, en kniv eller et klinisk sår er ikke altid usikkert i sig selv.
- Groft definerede mærkater. Nogle offentlige sikkerhedsmærkater kombinerer flere begreber i ét bredt mærkat. Ray Guardian-kategorierne er mere specifikke.
- Manglende kontekst. Nogle mærkater afhænger af billedtekst, lyd, den omgivende scene eller menneskelig hensigt. Disse tests måler synligt indhold.
- Domæneskift. Eksterne datasæt omfatter forskellige beskæringer, opløsninger, genererede billeder, overvågningsoptagelser, nærbilleder af genstande og medicinske billeder.
- Forskelligt opgavedesign. Benchmarks for objektgenkendelse er nyttige stresstests, men objektgenkendelse er ikke identisk med moderation af visuel sikkerhed.
Det tilpassede benchmark viser ydeevnen på Ray Guardians produkttaksonomi. Referencedatasættene viser, hvordan denne taksonomi overføres til mere uensartede eksterne data.
Sådan læses benchmarket
Læs hvert tal på niveauet for de mærkater, der ligger bag det.
- Resultatet med 13 kategorier måler hele Ray Guardians sikkerhedstaksonomi på billedniveau.
- Videorækkerne måler Ray Guardian på de offentlige videomærkater, der er tilgængelige i hvert datasæt.
- De uafhængige referencerækker måler overførsel til eksterne mærkatsystemer og erstatter ikke benchmarket for produkttaksonomien.
Ray Guardian er nu Rays samlede lag til visuel sikkerhed: ét system til billeder og klip, udviklet til at registrere følsomt indhold og holde afgørelser stabile, mens medier bevæger sig fra billede til billede.
Kildedatasæt
Benchmarkserien henviser til datasætkilder, herunder HMDB51 via FiftyOne, XD-Violence, UCF-Crime, UCF101 via FiftyOne, HoliSafe-Bench, UnsafeBench, Open Images V7, SurgWound og HOD Benchmark Dataset.

