Nu afgespeeld · Benchmarks
Aankondiging van Ray Guardian: visuele veiligheid voor afbeeldingen en video
Ray Guardian is het geïntegreerde visuele veiligheidssysteem van Ray, gebenchmarkt voor 13 veiligheidscategorieën op afbeeldingsniveau en openbaar gelabelde videodatasets.
Introductie van Ray Guardian
Ray Guardian is het visuele veiligheidssysteem van Ray voor afbeeldingen en video. Het beoordeelt visuele media op gevoelige inhoud en retourneert categoriesignalen die Ray kan gebruiken voor afspelen, creatie, moderatie en gezinsinstellingen.
Het belangrijkste is eenvoudig: Ray Guardian is één systeem. Stilstaande afbeeldingen en videoclips komen via verschillende mediapaden binnen, maar het product ontvangt één Guardian-beslissing.
Voor afbeeldingen beoordeelt Ray Guardian de volledige veiligheidstaxonomie: naaktheid, seksuele inhoud, geweld, bloederig geweld, wapens, drugs, alcohol, roken, schokkende inhoud, kussen / intimiteit, zelfbeschadiging, dierenmishandeling en medisch bloederige beelden.
Voor video voegt Ray Guardian tijd toe. Eén frame kan ambigu zijn; een clip kan handeling, intentie en context tonen. Het videopad combineert veiligheidsherkenning op frameniveau met temporeel begrip op clipniveau, zodat het eindresultaat weerspiegelt wat op het scherm verschijnt en wat er in de loop van de tijd gebeurt.
Dat is het systeem dat we hebben gebenchmarkt.
Visuele veiligheidsbenchmark met 13 categorieën
Ray Guardian behaalde 100.000% nauwkeurigheid op de apart gehouden Ray Guardian-afbeeldingsbenchmark met 13 categorieën: 17,435 bekende labels, 0 fouten.
Deze benchmark sluit het nauwst aan bij de producttaxonomie zelf: dezelfde categoriedefinities, apart gehouden voorbeelden en de volledige reeks visuele veiligheidscategorieën van Ray Guardian.
| Benchmark | Reikwijdte | Items | Nauwkeurigheid | Precisie | Recall | F1 |
|---|---|---|---|---|---|---|
| Apart gehouden benchmark van Ray Guardian op afbeeldingsniveau | Alle 13 Ray Guardian-categorieën | 17,435 labels | 100.000% | 100.000% | 100.000% | 100.000% |
De benchmark omvat categorieën die in echte producten vaak overlappen: seksuele inhoud versus naaktheid, bloederig geweld versus medisch bloederige beelden, wapens versus geweld en schokkende inhoud versus een gewone onaangename context.
Suite met openbaar gelabelde videobenchmarks
Videobenchmarks worden gemeten aan de hand van de labels die elke dataset daadwerkelijk biedt. Een dataset voor kus versus knuffel levert bewijs voor kussen / intimiteit. Een dataset voor geweld levert bewijs voor geweld en schokkende gebeurtenissen. Een dataset met veilige handelingen test of gewone actieclips zonder problemen worden doorgelaten.
Daardoor zijn de resultaten gemakkelijker te lezen en moeilijker verkeerd te gebruiken: elke rij rapporteert de prestaties van Ray Guardian binnen de eigen labelreikwijdte van die dataset.
| Dataset | Reikwijdte van Ray Guardian | Clips | Nauwkeurigheid | Precisie | Recall | F1 |
|---|---|---|---|---|---|---|
| HMDB51 Kus versus knuffel | Kussen / Intimiteit | 182 | 98.901% | 99.020% | 99.020% | 99.020% |
| XD-Violence Openbare labels | Geweld / Schokkend | 248 | 100.000% | 100.000% | 100.000% | 100.000% |
| UCF-Crime Toegewezen labels | Geweld / Schokkend | 79 | 100.000% | 100.000% | 100.000% | 100.000% |
| UCF-Crime Brede anomalie | Anomalie / Schokkend | 109 | 100.000% | 100.000% | 100.000% | 100.000% |
| UCF101 Apart gehouden veilige handelingen | Beveiligingscontrole voor veilige handelingen | 330 | 100.000% | n/a | n/a | n/a |
De UCF101-rij is een beveiligingscontrole met uitsluitend negatieve voorbeelden: deze meet of gewone veilige handelingen ten onrechte worden geblokkeerd. In die test liet Ray Guardian alle 330 clips met veilige handelingen correct door.
Wat de verwarringsmatrices tonen
Nauwkeurigheid is het belangrijkste cijfer. Een verwarringsmatrix toont de structuur van de beslissingen erachter.
Elke matrix maakt onderscheid tussen correct toegestane clips, foutieve waarschuwingen, gemiste onveilige clips en correct gemarkeerde onveilige clips. Dat is belangrijk omdat een veiligheidssysteem mensen moet beschermen zonder gewone media vaker dan nodig te onderbreken.
Onafhankelijke referentiedatasets
We evalueren Ray Guardian ook op onafhankelijke openbare en afgeschermde referentiedatasets. Deze datasets zijn nuttig omdat hun labels door andere teams en voor andere doelen zijn geschreven, en niet altijd perfect aansluiten op de categorieën van Ray Guardian.
De onderstaande tabel rapporteert elk resultaat op het categorieniveau dat de dataset kan ondersteunen. Wanneer een dataset alcoholobjecten test, rapporteren we gedrag voor alcohol. Wanneer deze medische wonden test, rapporteren we gedrag voor medisch bloederige beelden of schokkende inhoud.
| Referentiedataset | Reikwijdte van Ray Guardian | Items | Nauwkeurigheid | Recall | Opmerkingen |
|---|---|---|---|---|---|
| HoliSafe-Bench test-split | Toegewezen categorieën voor afbeeldingsveiligheid | 32,248 labels | 94.266% | 75.779% | Onafhankelijke afgeschermde veiligheidsbenchmark |
| UnsafeBench trainings-split | Toegewezen categorieën voor afbeeldingsveiligheid | 40,545 labels | 89.893% | 74.482% | Onafhankelijke afgeschermde veiligheidsbenchmark |
| SurgWound test-split | Medisch bloederige beelden | 137 afbeeldingen | 86.861% | 100.000% | Gevoeligheidscontrole voor medische wonden |
| SurgWound test-split | Schokkend | 137 afbeeldingen | 83.942% | 99.130% | Gevoeligheidscontrole voor medische wonden |
| Lower Limb and Feet Wound Dataset | Medisch bloederige beelden | 5,443 afbeeldingen | 65.185% | 98.958% | Referentiecontrole voor het wonddomein |
| HOD Benchmark Dataset | Alcohol | 10,631 afbeeldingen | 97.667% | 87.095% | Objectbenchmark voor onderzoeksgebruik |
| HOD Benchmark Dataset | Roken | 10,631 afbeeldingen | 98.222% | 93.391% | Objectbenchmark voor onderzoeksgebruik |
| HOD Benchmark Dataset | Wapens | 10,631 afbeeldingen | 85.053% | 68.659% | Objectbenchmark voor onderzoeksgebruik |
| Open Images V7 geselecteerde validatiesubset | Wapens | 460 rijen | 81.957% | 87.234% | Referentiecontrole voor objectlabels |
Deze rijen tonen hoe Ray Guardian zich gedraagt buiten de benchmark waarvoor het is ontwikkeld.
Waarom de cijfers verschillen
Een lagere score op een openbare referentie is geen tegenspraak. Het betekent dat de dataset een andere vraag stelt.
De Ray Guardian-benchmark met 13 categorieën vraagt of het systeem de veiligheidscategorieën herkent die in Ray worden gebruikt. De onafhankelijke referentiedatasets vragen wat er gebeurt wanneer externe labels, externe verzamelmethoden en externe categoriedefinities aan die taxonomie worden gekoppeld.
Scores kunnen om duidelijke redenen veranderen:
- Verschillende labeldefinities. Een dataset kan een object labelen terwijl Ray Guardian de veiligheidsbetekenis beoordeelt. Een wijnglas, fles, mes of klinische wond is op zichzelf niet altijd onveilig.
- Grove labels. Sommige openbare veiligheidslabels combineren meerdere concepten in één breed label. De categorieën van Ray Guardian zijn specifieker.
- Ontbrekende context. Sommige labels zijn afhankelijk van een bijschrift, audio, de omringende scène of menselijke intentie. Deze tests meten zichtbare inhoud.
- Domeinverschuiving. Externe datasets bevatten verschillende uitsneden, resoluties, gegenereerde afbeeldingen, bewakingsbeelden, close-ups van objecten en medische beelden.
- Verschillend taakontwerp. Benchmarks voor objectherkenning zijn nuttige stresstests, maar objectherkenning is niet hetzelfde als moderatie van visuele veiligheid.
De afgestemde benchmark toont prestaties voor de producttaxonomie van Ray Guardian. De referentiedatasets tonen hoe die taxonomie wordt overgedragen naar rommeligere externe gegevens.
Hoe de benchmark moet worden gelezen
Lees elk cijfer op het niveau van de onderliggende labels.
- Het resultaat met 13 categorieën meet de volledige veiligheidstaxonomie van Ray Guardian op afbeeldingsniveau.
- De videorijen meten Ray Guardian aan de hand van de openbare videolabels die in elke dataset beschikbaar zijn.
- De onafhankelijke referentierijen meten de overdracht naar externe labelsystemen en zijn geen vervanging voor de benchmark van de producttaxonomie.
Ray Guardian is nu de geïntegreerde visuele veiligheidslaag van Ray: één systeem voor afbeeldingen en clips, ontwikkeld om gevoelige inhoud te detecteren en beslissingen stabiel te houden terwijl media van frame naar frame bewegen.
Brondatasets
De benchmarksuite verwijst naar datasetbronnen, waaronder HMDB51 via FiftyOne, XD-Violence, UCF-Crime, UCF101 via FiftyOne, HoliSafe-Bench, UnsafeBench, Open Images V7, SurgWound en HOD Benchmark Dataset.

