Spilles nå · Referansetester
Vi lanserer Ray Guardian: Visuell sikkerhet for bilder og video
Ray Guardian er Rays enhetlige system for visuell sikkerhet, evaluert på tvers av 13 sikkerhetskategorier på bildenivå og offentlig merkede videodatasett.
Vi introduserer Ray Guardian
Ray Guardian er Rays system for visuell sikkerhet for bilder og video. Det gjennomgår visuelt medieinnhold for sensitivt innhold og returnerer kategorisignaler som Ray kan bruke til avspilling, oppretting, moderering og familieinnstillinger.
Det viktigste er enkelt: Ray Guardian er ett system. Stillbilder og videoklipp kommer inn gjennom forskjellige mediebaner, men produktet mottar én Guardian-avgjørelse.
For bilder evaluerer Ray Guardian hele sikkerhetstaksonomien: nakenhet, seksuelt innhold, vold, blodig innhold, våpen, narkotika, alkohol, røyking, urovekkende innhold, kyssing / intimitet, selvskading, dyremishandling og medisinsk blodig innhold.
For video legger Ray Guardian til tid. Ett enkelt bilde kan være tvetydig; et klipp kan vise handling, hensikt og kontekst. Videobanen kombinerer sikkerhetsgjenkjenning på bildenivå med tidsforståelse på klippnivå, slik at sluttresultatet gjenspeiler hva som vises på skjermen, og hva som skjer over tid.
Det er dette systemet vi evaluerte.
Referansetest for visuell sikkerhet med 13 kategorier
Ray Guardian oppnådde 100.000% nøyaktighet på Ray Guardians holdt-utenfor-bildereferansetest med 13 kategorier: 17,435 kjente etiketter, 0 feil.
Denne referansetesten ligger nærmest selve produkttaksonomien: de samme kategoridefinisjonene, eksempler som er holdt utenfor, og hele settet av kategorier for visuell sikkerhet i Ray Guardian.
| Referansetest | Omfang | Elementer | Nøyaktighet | Presisjon | Gjenkalling | F1 |
|---|---|---|---|---|---|---|
| Ray Guardian held-out image-level benchmark | Alle de 13 Ray Guardian-kategoriene | 17,435 labels | 100.000% | 100.000% | 100.000% | 100.000% |
Referansetesten omfatter kategorier som ofte overlapper i virkelige produkter: seksuelt innhold kontra nakenhet, blodig innhold kontra medisinsk blodig innhold, våpen kontra vold og urovekkende innhold kontra vanlig ubehagelig kontekst.
Pakke med offentlig merkede videoreferansetester
Videoreferansetestene måles mot etikettene hvert datasett faktisk inneholder. Et datasett for kyss kontra klem gir evidens for kyssing / intimitet. Et voldsdatasett gir evidens for vold og urovekkende hendelser. Et datasett med trygge handlinger tester om vanlige handlingsklipp slippes gjennom uten problemer.
Det gjør resultatene enklere å lese og vanskeligere å misbruke: Hver rad rapporterer ytelsen til Ray Guardian innenfor datasettets opprinnelige etikettomfang.
| Datasett | Ray Guardian-omfang | Klipp | Nøyaktighet | Presisjon | Gjenkalling | F1 |
|---|---|---|---|---|---|---|
| HMDB51 Kiss vs Hug | Kyssing / intimitet | 182 | 98.901% | 99.020% | 99.020% | 99.020% |
| XD-Violence Public Labels | Vold / urovekkende innhold | 248 | 100.000% | 100.000% | 100.000% | 100.000% |
| UCF-Crime Mapped Labels | Vold / urovekkende innhold | 79 | 100.000% | 100.000% | 100.000% | 100.000% |
| UCF-Crime Broad Anomaly | Avvik / urovekkende innhold | 109 | 100.000% | 100.000% | 100.000% | 100.000% |
| UCF101 Safe-Action Holdout | Sikkerhetsmekanisme for trygge handlinger | 330 | 100.000% | n/a | n/a | n/a |
UCF101-raden er en sikkerhetsmekanisme med bare negative eksempler: Den måler om vanlige, trygge handlinger blokkeres feilaktig. I denne testen tillot Ray Guardian alle 330 klippene med trygge handlinger på riktig måte.
Hva forvekslingsmatrisene viser
Nøyaktighet er hovedtallet. En forvekslingsmatrise viser strukturen i avgjørelsene bak det.
Hver matrise skiller mellom riktige tillatelser, falske alarmer, oversette utrygge klipp og korrekt flaggede utrygge klipp. Det er viktig fordi et sikkerhetssystem må beskytte mennesker uten å avbryte vanlig medieinnhold mer enn nødvendig.
Uavhengige referansedatasett
Vi evaluerer også Ray Guardian på uavhengige offentlige og tilgangsbegrensede referansedatasett. Disse datasettene er nyttige fordi etikettene deres ble skrevet av andre team, for andre formål, og ikke alltid samsvarer perfekt med Ray Guardian-kategoriene.
Tabellen nedenfor rapporterer hvert resultat på det kategorinivået datasettet kan støtte. Når et datasett tester alkoholobjekter, rapporterer vi alkoholatferd. Når det tester medisinske sår, rapporterer vi medisinsk blodig innhold eller urovekkende atferd.
| Referansedatasett | Ray Guardian-omfang | Elementer | Nøyaktighet | Gjenkalling | Merknader |
|---|---|---|---|---|---|
| HoliSafe-Bench test split | Tilordnede kategorier for bildesikkerhet | 32,248 labels | 94.266% | 75.779% | Uavhengig, tilgangsbegrenset sikkerhetsreferansetest |
| UnsafeBench train split | Tilordnede kategorier for bildesikkerhet | 40,545 labels | 89.893% | 74.482% | Uavhengig, tilgangsbegrenset sikkerhetsreferansetest |
| SurgWound test split | Medisinsk blodig innhold | 137 images | 86.861% | 100.000% | Sensitivitetstest for medisinske sår |
| SurgWound test split | Urovekkende innhold | 137 images | 83.942% | 99.130% | Sensitivitetstest for medisinske sår |
| Lower Limb and Feet Wound Dataset | Medisinsk blodig innhold | 5,443 images | 65.185% | 98.958% | Referansetest for sårdomene |
| HOD Benchmark Dataset | Alkohol | 10,631 images | 97.667% | 87.095% | Objektreferansetest for forskningsbruk |
| HOD Benchmark Dataset | Røyking | 10,631 images | 98.222% | 93.391% | Objektreferansetest for forskningsbruk |
| HOD Benchmark Dataset | Våpen | 10,631 images | 85.053% | 68.659% | Objektreferansetest for forskningsbruk |
| Open Images V7 selected validation subset | Våpen | 460 rows | 81.957% | 87.234% | Referansetest for objektetiketter |
Disse radene viser hvordan Ray Guardian oppfører seg utenfor referansetesten systemet ble bygget mot.
Hvorfor tallene er forskjellige
En lavere poengsum på en offentlig referansetest er ikke en selvmotsigelse. Det betyr at datasettet stiller et annet spørsmål.
Ray Guardian-referansetesten med 13 kategorier spør om systemet gjenkjenner sikkerhetskategoriene som brukes i Ray. De uavhengige referansedatasettene spør hva som skjer når eksterne etiketter, eksterne innsamlingsmetoder og eksterne kategoridefinisjoner tilordnes denne taksonomien.
Poengsummer kan endre seg av enkle årsaker:
- Ulike etikettdefinisjoner. Et datasett kan merke et objekt, mens Ray Guardian vurderer sikkerhetsbetydningen. Et vinglass, en flaske, en kniv eller et klinisk sår er ikke alltid utrygt i seg selv.
- Grove etiketter. Noen offentlige sikkerhetsetiketter kombinerer flere konsepter i én bred etikett. Ray Guardian-kategoriene er mer spesifikke.
- Manglende kontekst. Noen etiketter avhenger av bildetekst, lyd, den omkringliggende scenen eller menneskelig hensikt. Disse testene måler synlig innhold.
- Domeneskifte. Eksterne datasett omfatter forskjellige beskjæringer, oppløsninger, genererte bilder, overvåkingsopptak, nærbilder av objekter og medisinske bilder.
- Ulik oppgaveutforming. Referansetester for objektgjenkjenning er nyttige stresstester, men objektgjenkjenning er ikke det samme som moderering av visuell sikkerhet.
Den tilpassede referansetesten viser ytelsen på Ray Guardians produkttaksonomi. Referansedatasettene viser hvordan denne taksonomien overføres til mer uoversiktlige eksterne data.
Slik leser du referansetesten
Les hvert tall på nivået til etikettene som ligger bak det.
- Resultatet med 13 kategorier måler hele Ray Guardians sikkerhetstaksonomi på bildenivå.
- Videoradene måler Ray Guardian mot de offentlige videoetikettene som er tilgjengelige i hvert datasett.
- De uavhengige referanseradene måler overføring til eksterne etikettsystemer, ikke en erstatning for referansetesten av produkttaksonomien.
Ray Guardian er nå Rays enhetlige lag for visuell sikkerhet: ett system for bilder og klipp, bygget for å oppdage sensitivt innhold og holde avgjørelsene stabile når medieinnhold beveger seg fra bilde til bilde.
Kildedatasett
Referansetestpakken viser til datasettkilder, blant annet HMDB51 via FiftyOne, XD-Violence, UCF-Crime, UCF101 via FiftyOne, HoliSafe-Bench, UnsafeBench, Open Images V7, SurgWound og HOD Benchmark Dataset.

