Spelas nu · Benchmarktester
Vi presenterar Ray Guardian: visuell säkerhet för bilder och video
Ray Guardian är Rays enhetliga system för visuell säkerhet, testat mot 13 säkerhetskategorier på bildnivå och offentligt etiketterade videodatauppsättningar.
Vi presenterar Ray Guardian
Ray Guardian är Rays system för visuell säkerhet för bilder och video. Det granskar visuella medier efter känsligt innehåll och returnerar kategorisignaler som Ray kan använda för uppspelning, skapande, moderering och familjeinställningar.
Det viktiga är enkelt: Ray Guardian är ett enda system. Stillbilder och videoklipp kommer in genom olika medieflöden, men produkten får ett enda beslut från Guardian.
För bilder utvärderar Ray Guardian hela säkerhetstaxonomin: nakenhet, sexuellt innehåll, våld, blodigt innehåll, vapen, droger, alkohol, rökning, obehagligt innehåll, kyssar / intimitet, självskada, djurplågeri och medicinskt blodigt innehåll.
För video lägger Ray Guardian till tidsdimensionen. En enskild bildruta kan vara tvetydig; ett klipp kan visa handling, avsikt och sammanhang. Videoflödet kombinerar säkerhetsidentifiering på bildrutenivå med tidsmässig förståelse på klippnivå, så att slutresultatet återspeglar vad som syns på skärmen och vad som händer över tid.
Det är systemet vi benchmarktestade.
Benchmarktest av visuell säkerhet i 13 kategorier
Ray Guardian uppnådde 100.000% träffsäkerhet i Ray Guardians held-out-bildbenchmark för 13 kategorier: 17,435 kända etiketter, 0 fel.
Detta benchmarktest ligger närmast själva produkttaxonomin: samma kategoridefinitioner, held-out-exempel och hela uppsättningen kategorier för visuell säkerhet i Ray Guardian.
| Benchmarktest | Omfattning | Poster | Träffsäkerhet | Precision | Sensitivitet | F1 |
|---|---|---|---|---|---|---|
| Ray Guardians held-out-benchmark på bildnivå | Alla 13 Ray Guardian-kategorier | 17,435 labels | 100.000% | 100.000% | 100.000% | 100.000% |
Benchmarktestet omfattar kategorier som ofta överlappar i verkliga produkter: sexuellt innehåll kontra nakenhet, blodigt innehåll kontra medicinskt blodigt innehåll, vapen kontra våld samt obehagligt innehåll kontra vanliga obehagliga sammanhang.
Benchmarksvit med offentligt etiketterad video
Videobenchmarktester mäts mot de etiketter som varje datauppsättning faktiskt tillhandahåller. En datauppsättning för kyssar kontra kramar ger evidens för kyssar / intimitet. En datauppsättning för våld ger evidens för våld och obehagliga händelser. En datauppsättning med säkra handlingar testar om vanliga handlingsklipp släpps igenom utan problem.
Det gör resultaten enklare att läsa och svårare att använda felaktigt: varje rad redovisar Ray Guardians prestanda inom datauppsättningens ursprungliga etikettomfattning.
| Datauppsättning | Ray Guardian-omfattning | Klipp | Träffsäkerhet | Precision | Sensitivitet | F1 |
|---|---|---|---|---|---|---|
| HMDB51 Kiss vs Hug | Kyssar / Intimitet | 182 | 98.901% | 99.020% | 99.020% | 99.020% |
| XD-Violence Public Labels | Våld / Obehagligt innehåll | 248 | 100.000% | 100.000% | 100.000% | 100.000% |
| UCF-Crime Mapped Labels | Våld / Obehagligt innehåll | 79 | 100.000% | 100.000% | 100.000% | 100.000% |
| UCF-Crime Broad Anomaly | Avvikelse / Obehagligt innehåll | 109 | 100.000% | 100.000% | 100.000% | 100.000% |
| UCF101 Safe-Action Holdout | Skyddsräcke för säkra handlingar | 330 | 100.000% | n/a | n/a | n/a |
UCF101-raden är ett skyddsräcke med enbart negativa exempel: den mäter om vanliga säkra handlingar blockeras felaktigt. I det testet tillät Ray Guardian korrekt alla 330 klipp med säkra handlingar.
Vad förväxlingsmatriserna visar
Träffsäkerheten är huvudresultatet. En förväxlingsmatris visar strukturen hos de beslut som ligger bakom det.
Varje matris skiljer mellan korrekta tillåtelser, falsklarm, missade osäkra klipp och korrekt flaggade osäkra klipp. Det är viktigt eftersom ett säkerhetssystem måste skydda människor utan att störa vanliga medier mer än nödvändigt.
Oberoende referensdatauppsättningar
Vi utvärderar även Ray Guardian mot oberoende offentliga och åtkomstbegränsade referensdatauppsättningar. Dessa datauppsättningar är användbara eftersom deras etiketter har skapats av andra team, för andra syften, och inte alltid överensstämmer helt med Ray Guardian-kategorierna.
Tabellen nedan redovisar varje resultat på den kategorinivå som datauppsättningen kan stödja. När en datauppsättning testar alkoholobjekt redovisar vi beteende för alkohol. När den testar medicinska sår redovisar vi beteende för medicinskt blodigt innehåll eller obehagligt innehåll.
| Referensdatauppsättning | Ray Guardian-omfattning | Poster | Träffsäkerhet | Sensitivitet | Anmärkningar |
|---|---|---|---|---|---|
| HoliSafe-Bench test split | Mappade kategorier för bildsäkerhet | 32,248 labels | 94.266% | 75.779% | Oberoende åtkomstbegränsat säkerhetsbenchmark |
| UnsafeBench train split | Mappade kategorier för bildsäkerhet | 40,545 labels | 89.893% | 74.482% | Oberoende åtkomstbegränsat säkerhetsbenchmark |
| SurgWound test split | Medicinskt blodigt innehåll | 137 images | 86.861% | 100.000% | Sensitivitetskontroll för medicinska sår |
| SurgWound test split | Obehagligt innehåll | 137 images | 83.942% | 99.130% | Sensitivitetskontroll för medicinska sår |
| Lower Limb and Feet Wound Dataset | Medicinskt blodigt innehåll | 5,443 images | 65.185% | 98.958% | Referenskontroll för sårdomänen |
| HOD Benchmark Dataset | Alkohol | 10,631 images | 97.667% | 87.095% | Objektbenchmark för forskningsanvändning |
| HOD Benchmark Dataset | Rökning | 10,631 images | 98.222% | 93.391% | Objektbenchmark för forskningsanvändning |
| HOD Benchmark Dataset | Vapen | 10,631 images | 85.053% | 68.659% | Objektbenchmark för forskningsanvändning |
| Open Images V7 selected validation subset | Vapen | 460 rows | 81.957% | 87.234% | Referenskontroll för objektetiketter |
Dessa rader visar hur Ray Guardian fungerar utanför det benchmarktest som systemet byggdes mot.
Varför siffrorna skiljer sig
Ett lägre offentligt referensresultat är inte en motsägelse. Det betyder att datauppsättningen ställer en annan fråga.
Ray Guardians benchmarktest för 13 kategorier frågar om systemet känner igen säkerhetskategorierna som används i Ray. De oberoende referensdatauppsättningarna frågar vad som händer när externa etiketter, externa insamlingsmetoder och externa kategoridefinitioner mappas till denna taxonomi.
Resultaten kan förändras av enkla skäl:
- Olika etikettdefinitioner. En datauppsättning kan etikettera ett objekt medan Ray Guardian bedömer dess säkerhetsmässiga innebörd. Ett vinglas, en flaska, en kniv eller ett kliniskt sår är inte alltid osäkert i sig.
- Grova etiketter. Vissa offentliga säkerhetsetiketter kombinerar flera begrepp i en enda bred etikett. Ray Guardian-kategorierna är mer specifika.
- Luckor i sammanhanget. Vissa etiketter beror på bildtext, ljud, den omgivande scenen eller mänsklig avsikt. Dessa tester mäter synligt innehåll.
- Domänskifte. Externa datauppsättningar innehåller olika beskärningar, upplösningar, genererade bilder, övervakningsmaterial, närbilder av objekt och medicinska bilder.
- Olika uppgiftsdesign. Benchmarktester för objektigenkänning är användbara stresstester, men objektigenkänning är inte identiskt med moderering av visuell säkerhet.
Det anpassade benchmarktestet visar prestandan för Ray Guardians produkttaxonomi. Referensdatauppsättningarna visar hur denna taxonomi överförs till mer svårhanterliga externa data.
Så läser du benchmarktestet
Läs varje siffra på nivån för de bakomliggande etiketterna.
- Resultatet för 13 kategorier mäter Ray Guardians fullständiga säkerhetstaxonomi på bildnivå.
- Videoraderna mäter Ray Guardian mot de offentliga videoetiketter som finns i varje datauppsättning.
- De oberoende referensraderna mäter överföring till externa etikettsystem, inte en ersättning för benchmarktestet av produkttaxonomin.
Ray Guardian är nu Rays enhetliga lager för visuell säkerhet: ett system för bilder och klipp, byggt för att upptäcka känsligt innehåll och hålla besluten stabila när medier rör sig från bildruta till bildruta.
Källdatauppsättningar
Benchmarksviten hänvisar till datauppsättningskällor som HMDB51 via FiftyOne, XD-Violence, UCF-Crime, UCF101 via FiftyOne, HoliSafe-Bench, UnsafeBench, Open Images V7, SurgWound och HOD Benchmark Dataset.

