Skip to main content
Bibliotheek

Nu afgespeeld · Benchmarks

Aankondiging van Ray Guardian: visuele veiligheid voor afbeeldingen en video

Ray Guardian is het geïntegreerde visuele veiligheidssysteem van Ray, gebenchmarkt voor 13 veiligheidscategorieën op afbeeldingsniveau en openbaar gelabelde videodatasets.

Ray Team4 AUG 20266 min read

Introductie van Ray Guardian

Ray Guardian is het visuele veiligheidssysteem van Ray voor afbeeldingen en video. Het beoordeelt visuele media op gevoelige inhoud en retourneert categoriesignalen die Ray kan gebruiken voor afspelen, creatie, moderatie en gezinsinstellingen.

Het belangrijkste is eenvoudig: Ray Guardian is één systeem. Stilstaande afbeeldingen en videoclips komen via verschillende mediapaden binnen, maar het product ontvangt één Guardian-beslissing.

Voor afbeeldingen beoordeelt Ray Guardian de volledige veiligheidstaxonomie: naaktheid, seksuele inhoud, geweld, bloederig geweld, wapens, drugs, alcohol, roken, schokkende inhoud, kussen / intimiteit, zelfbeschadiging, dierenmishandeling en medisch bloederige beelden.

Voor video voegt Ray Guardian tijd toe. Eén frame kan ambigu zijn; een clip kan handeling, intentie en context tonen. Het videopad combineert veiligheidsherkenning op frameniveau met temporeel begrip op clipniveau, zodat het eindresultaat weerspiegelt wat op het scherm verschijnt en wat er in de loop van de tijd gebeurt.

Dat is het systeem dat we hebben gebenchmarkt.

Visuele veiligheidsbenchmark met 13 categorieën

Ray Guardian behaalde 100.000% nauwkeurigheid op de apart gehouden Ray Guardian-afbeeldingsbenchmark met 13 categorieën: 17,435 bekende labels, 0 fouten.

Deze benchmark sluit het nauwst aan bij de producttaxonomie zelf: dezelfde categoriedefinities, apart gehouden voorbeelden en de volledige reeks visuele veiligheidscategorieën van Ray Guardian.

BenchmarkReikwijdteItemsNauwkeurigheidPrecisieRecallF1
Apart gehouden benchmark van Ray Guardian op afbeeldingsniveauAlle 13 Ray Guardian-categorieën17,435 labels100.000%100.000%100.000%100.000%

De benchmark omvat categorieën die in echte producten vaak overlappen: seksuele inhoud versus naaktheid, bloederig geweld versus medisch bloederige beelden, wapens versus geweld en schokkende inhoud versus een gewone onaangename context.

Suite met openbaar gelabelde videobenchmarks

Videobenchmarks worden gemeten aan de hand van de labels die elke dataset daadwerkelijk biedt. Een dataset voor kus versus knuffel levert bewijs voor kussen / intimiteit. Een dataset voor geweld levert bewijs voor geweld en schokkende gebeurtenissen. Een dataset met veilige handelingen test of gewone actieclips zonder problemen worden doorgelaten.

Daardoor zijn de resultaten gemakkelijker te lezen en moeilijker verkeerd te gebruiken: elke rij rapporteert de prestaties van Ray Guardian binnen de eigen labelreikwijdte van die dataset.

DatasetReikwijdte van Ray GuardianClipsNauwkeurigheidPrecisieRecallF1
HMDB51 Kus versus knuffelKussen / Intimiteit18298.901%99.020%99.020%99.020%
XD-Violence Openbare labelsGeweld / Schokkend248100.000%100.000%100.000%100.000%
UCF-Crime Toegewezen labelsGeweld / Schokkend79100.000%100.000%100.000%100.000%
UCF-Crime Brede anomalieAnomalie / Schokkend109100.000%100.000%100.000%100.000%
UCF101 Apart gehouden veilige handelingenBeveiligingscontrole voor veilige handelingen330100.000%n/an/an/a

De UCF101-rij is een beveiligingscontrole met uitsluitend negatieve voorbeelden: deze meet of gewone veilige handelingen ten onrechte worden geblokkeerd. In die test liet Ray Guardian alle 330 clips met veilige handelingen correct door.

Wat de verwarringsmatrices tonen

Nauwkeurigheid is het belangrijkste cijfer. Een verwarringsmatrix toont de structuur van de beslissingen erachter.

Elke matrix maakt onderscheid tussen correct toegestane clips, foutieve waarschuwingen, gemiste onveilige clips en correct gemarkeerde onveilige clips. Dat is belangrijk omdat een veiligheidssysteem mensen moet beschermen zonder gewone media vaker dan nodig te onderbreken.

Onafhankelijke referentiedatasets

We evalueren Ray Guardian ook op onafhankelijke openbare en afgeschermde referentiedatasets. Deze datasets zijn nuttig omdat hun labels door andere teams en voor andere doelen zijn geschreven, en niet altijd perfect aansluiten op de categorieën van Ray Guardian.

De onderstaande tabel rapporteert elk resultaat op het categorieniveau dat de dataset kan ondersteunen. Wanneer een dataset alcoholobjecten test, rapporteren we gedrag voor alcohol. Wanneer deze medische wonden test, rapporteren we gedrag voor medisch bloederige beelden of schokkende inhoud.

ReferentiedatasetReikwijdte van Ray GuardianItemsNauwkeurigheidRecallOpmerkingen
HoliSafe-Bench test-splitToegewezen categorieën voor afbeeldingsveiligheid32,248 labels94.266%75.779%Onafhankelijke afgeschermde veiligheidsbenchmark
UnsafeBench trainings-splitToegewezen categorieën voor afbeeldingsveiligheid40,545 labels89.893%74.482%Onafhankelijke afgeschermde veiligheidsbenchmark
SurgWound test-splitMedisch bloederige beelden137 afbeeldingen86.861%100.000%Gevoeligheidscontrole voor medische wonden
SurgWound test-splitSchokkend137 afbeeldingen83.942%99.130%Gevoeligheidscontrole voor medische wonden
Lower Limb and Feet Wound DatasetMedisch bloederige beelden5,443 afbeeldingen65.185%98.958%Referentiecontrole voor het wonddomein
HOD Benchmark DatasetAlcohol10,631 afbeeldingen97.667%87.095%Objectbenchmark voor onderzoeksgebruik
HOD Benchmark DatasetRoken10,631 afbeeldingen98.222%93.391%Objectbenchmark voor onderzoeksgebruik
HOD Benchmark DatasetWapens10,631 afbeeldingen85.053%68.659%Objectbenchmark voor onderzoeksgebruik
Open Images V7 geselecteerde validatiesubsetWapens460 rijen81.957%87.234%Referentiecontrole voor objectlabels

Deze rijen tonen hoe Ray Guardian zich gedraagt buiten de benchmark waarvoor het is ontwikkeld.

Waarom de cijfers verschillen

Een lagere score op een openbare referentie is geen tegenspraak. Het betekent dat de dataset een andere vraag stelt.

De Ray Guardian-benchmark met 13 categorieën vraagt of het systeem de veiligheidscategorieën herkent die in Ray worden gebruikt. De onafhankelijke referentiedatasets vragen wat er gebeurt wanneer externe labels, externe verzamelmethoden en externe categoriedefinities aan die taxonomie worden gekoppeld.

Scores kunnen om duidelijke redenen veranderen:

  • Verschillende labeldefinities. Een dataset kan een object labelen terwijl Ray Guardian de veiligheidsbetekenis beoordeelt. Een wijnglas, fles, mes of klinische wond is op zichzelf niet altijd onveilig.
  • Grove labels. Sommige openbare veiligheidslabels combineren meerdere concepten in één breed label. De categorieën van Ray Guardian zijn specifieker.
  • Ontbrekende context. Sommige labels zijn afhankelijk van een bijschrift, audio, de omringende scène of menselijke intentie. Deze tests meten zichtbare inhoud.
  • Domeinverschuiving. Externe datasets bevatten verschillende uitsneden, resoluties, gegenereerde afbeeldingen, bewakingsbeelden, close-ups van objecten en medische beelden.
  • Verschillend taakontwerp. Benchmarks voor objectherkenning zijn nuttige stresstests, maar objectherkenning is niet hetzelfde als moderatie van visuele veiligheid.

De afgestemde benchmark toont prestaties voor de producttaxonomie van Ray Guardian. De referentiedatasets tonen hoe die taxonomie wordt overgedragen naar rommeligere externe gegevens.

Hoe de benchmark moet worden gelezen

Lees elk cijfer op het niveau van de onderliggende labels.

  • Het resultaat met 13 categorieën meet de volledige veiligheidstaxonomie van Ray Guardian op afbeeldingsniveau.
  • De videorijen meten Ray Guardian aan de hand van de openbare videolabels die in elke dataset beschikbaar zijn.
  • De onafhankelijke referentierijen meten de overdracht naar externe labelsystemen en zijn geen vervanging voor de benchmark van de producttaxonomie.

Ray Guardian is nu de geïntegreerde visuele veiligheidslaag van Ray: één systeem voor afbeeldingen en clips, ontwikkeld om gevoelige inhoud te detecteren en beslissingen stabiel te houden terwijl media van frame naar frame bewegen.

Brondatasets

De benchmarksuite verwijst naar datasetbronnen, waaronder HMDB51 via FiftyOne, XD-Violence, UCF-Crime, UCF101 via FiftyOne, HoliSafe-Bench, UnsafeBench, Open Images V7, SurgWound en HOD Benchmark Dataset.

Subscribe to the Ray newsletter. Product updates, release notes, and customer news.

No spam. Just the Ray newsletter and important product updates.

Ray JournalBenchmarks2026-08-04

Aankondiging van Ray Guardian: visuele veiligheid voor afbeeldingen en video

Ray Guardian is het geïntegreerde visuele veiligheidssysteem van Ray, gebenchmarkt voor 13 veiligheidscategorieën op afbeeldingsniveau en openbaar gelabelde videodatasets.

Ray Team2026-08-046 min read

Introductie van Ray Guardian

Ray Guardian is het visuele veiligheidssysteem van Ray voor afbeeldingen en video. Het beoordeelt visuele media op gevoelige inhoud en retourneert categoriesignalen die Ray kan gebruiken voor afspelen, creatie, moderatie en gezinsinstellingen.

Het belangrijkste is eenvoudig: Ray Guardian is één systeem. Stilstaande afbeeldingen en videoclips komen via verschillende mediapaden binnen, maar het product ontvangt één Guardian-beslissing.

Voor afbeeldingen beoordeelt Ray Guardian de volledige veiligheidstaxonomie: naaktheid, seksuele inhoud, geweld, bloederig geweld, wapens, drugs, alcohol, roken, schokkende inhoud, kussen / intimiteit, zelfbeschadiging, dierenmishandeling en medisch bloederige beelden.

Voor video voegt Ray Guardian tijd toe. Eén frame kan ambigu zijn; een clip kan handeling, intentie en context tonen. Het videopad combineert veiligheidsherkenning op frameniveau met temporeel begrip op clipniveau, zodat het eindresultaat weerspiegelt wat op het scherm verschijnt en wat er in de loop van de tijd gebeurt.

Dat is het systeem dat we hebben gebenchmarkt.

Visuele veiligheidsbenchmark met 13 categorieën

Ray Guardian behaalde 100.000% nauwkeurigheid op de apart gehouden Ray Guardian-afbeeldingsbenchmark met 13 categorieën: 17,435 bekende labels, 0 fouten.

Deze benchmark sluit het nauwst aan bij de producttaxonomie zelf: dezelfde categoriedefinities, apart gehouden voorbeelden en de volledige reeks visuele veiligheidscategorieën van Ray Guardian.

BenchmarkReikwijdteItemsNauwkeurigheidPrecisieRecallF1
Apart gehouden benchmark van Ray Guardian op afbeeldingsniveauAlle 13 Ray Guardian-categorieën17,435 labels100.000%100.000%100.000%100.000%

De benchmark omvat categorieën die in echte producten vaak overlappen: seksuele inhoud versus naaktheid, bloederig geweld versus medisch bloederige beelden, wapens versus geweld en schokkende inhoud versus een gewone onaangename context.

Suite met openbaar gelabelde videobenchmarks

Videobenchmarks worden gemeten aan de hand van de labels die elke dataset daadwerkelijk biedt. Een dataset voor kus versus knuffel levert bewijs voor kussen / intimiteit. Een dataset voor geweld levert bewijs voor geweld en schokkende gebeurtenissen. Een dataset met veilige handelingen test of gewone actieclips zonder problemen worden doorgelaten.

Daardoor zijn de resultaten gemakkelijker te lezen en moeilijker verkeerd te gebruiken: elke rij rapporteert de prestaties van Ray Guardian binnen de eigen labelreikwijdte van die dataset.

DatasetReikwijdte van Ray GuardianClipsNauwkeurigheidPrecisieRecallF1
HMDB51 Kus versus knuffelKussen / Intimiteit18298.901%99.020%99.020%99.020%
XD-Violence Openbare labelsGeweld / Schokkend248100.000%100.000%100.000%100.000%
UCF-Crime Toegewezen labelsGeweld / Schokkend79100.000%100.000%100.000%100.000%
UCF-Crime Brede anomalieAnomalie / Schokkend109100.000%100.000%100.000%100.000%
UCF101 Apart gehouden veilige handelingenBeveiligingscontrole voor veilige handelingen330100.000%n/an/an/a

De UCF101-rij is een beveiligingscontrole met uitsluitend negatieve voorbeelden: deze meet of gewone veilige handelingen ten onrechte worden geblokkeerd. In die test liet Ray Guardian alle 330 clips met veilige handelingen correct door.

Wat de verwarringsmatrices tonen

Nauwkeurigheid is het belangrijkste cijfer. Een verwarringsmatrix toont de structuur van de beslissingen erachter.

Elke matrix maakt onderscheid tussen correct toegestane clips, foutieve waarschuwingen, gemiste onveilige clips en correct gemarkeerde onveilige clips. Dat is belangrijk omdat een veiligheidssysteem mensen moet beschermen zonder gewone media vaker dan nodig te onderbreken.

Onafhankelijke referentiedatasets

We evalueren Ray Guardian ook op onafhankelijke openbare en afgeschermde referentiedatasets. Deze datasets zijn nuttig omdat hun labels door andere teams en voor andere doelen zijn geschreven, en niet altijd perfect aansluiten op de categorieën van Ray Guardian.

De onderstaande tabel rapporteert elk resultaat op het categorieniveau dat de dataset kan ondersteunen. Wanneer een dataset alcoholobjecten test, rapporteren we gedrag voor alcohol. Wanneer deze medische wonden test, rapporteren we gedrag voor medisch bloederige beelden of schokkende inhoud.

ReferentiedatasetReikwijdte van Ray GuardianItemsNauwkeurigheidRecallOpmerkingen
HoliSafe-Bench test-splitToegewezen categorieën voor afbeeldingsveiligheid32,248 labels94.266%75.779%Onafhankelijke afgeschermde veiligheidsbenchmark
UnsafeBench trainings-splitToegewezen categorieën voor afbeeldingsveiligheid40,545 labels89.893%74.482%Onafhankelijke afgeschermde veiligheidsbenchmark
SurgWound test-splitMedisch bloederige beelden137 afbeeldingen86.861%100.000%Gevoeligheidscontrole voor medische wonden
SurgWound test-splitSchokkend137 afbeeldingen83.942%99.130%Gevoeligheidscontrole voor medische wonden
Lower Limb and Feet Wound DatasetMedisch bloederige beelden5,443 afbeeldingen65.185%98.958%Referentiecontrole voor het wonddomein
HOD Benchmark DatasetAlcohol10,631 afbeeldingen97.667%87.095%Objectbenchmark voor onderzoeksgebruik
HOD Benchmark DatasetRoken10,631 afbeeldingen98.222%93.391%Objectbenchmark voor onderzoeksgebruik
HOD Benchmark DatasetWapens10,631 afbeeldingen85.053%68.659%Objectbenchmark voor onderzoeksgebruik
Open Images V7 geselecteerde validatiesubsetWapens460 rijen81.957%87.234%Referentiecontrole voor objectlabels

Deze rijen tonen hoe Ray Guardian zich gedraagt buiten de benchmark waarvoor het is ontwikkeld.

Waarom de cijfers verschillen

Een lagere score op een openbare referentie is geen tegenspraak. Het betekent dat de dataset een andere vraag stelt.

De Ray Guardian-benchmark met 13 categorieën vraagt of het systeem de veiligheidscategorieën herkent die in Ray worden gebruikt. De onafhankelijke referentiedatasets vragen wat er gebeurt wanneer externe labels, externe verzamelmethoden en externe categoriedefinities aan die taxonomie worden gekoppeld.

Scores kunnen om duidelijke redenen veranderen:

  • Verschillende labeldefinities. Een dataset kan een object labelen terwijl Ray Guardian de veiligheidsbetekenis beoordeelt. Een wijnglas, fles, mes of klinische wond is op zichzelf niet altijd onveilig.
  • Grove labels. Sommige openbare veiligheidslabels combineren meerdere concepten in één breed label. De categorieën van Ray Guardian zijn specifieker.
  • Ontbrekende context. Sommige labels zijn afhankelijk van een bijschrift, audio, de omringende scène of menselijke intentie. Deze tests meten zichtbare inhoud.
  • Domeinverschuiving. Externe datasets bevatten verschillende uitsneden, resoluties, gegenereerde afbeeldingen, bewakingsbeelden, close-ups van objecten en medische beelden.
  • Verschillend taakontwerp. Benchmarks voor objectherkenning zijn nuttige stresstests, maar objectherkenning is niet hetzelfde als moderatie van visuele veiligheid.

De afgestemde benchmark toont prestaties voor de producttaxonomie van Ray Guardian. De referentiedatasets tonen hoe die taxonomie wordt overgedragen naar rommeligere externe gegevens.

Hoe de benchmark moet worden gelezen

Lees elk cijfer op het niveau van de onderliggende labels.

  • Het resultaat met 13 categorieën meet de volledige veiligheidstaxonomie van Ray Guardian op afbeeldingsniveau.
  • De videorijen meten Ray Guardian aan de hand van de openbare videolabels die in elke dataset beschikbaar zijn.
  • De onafhankelijke referentierijen meten de overdracht naar externe labelsystemen en zijn geen vervanging voor de benchmark van de producttaxonomie.

Ray Guardian is nu de geïntegreerde visuele veiligheidslaag van Ray: één systeem voor afbeeldingen en clips, ontwikkeld om gevoelige inhoud te detecteren en beslissingen stabiel te houden terwijl media van frame naar frame bewegen.

Brondatasets

De benchmarksuite verwijst naar datasetbronnen, waaronder HMDB51 via FiftyOne, XD-Violence, UCF-Crime, UCF101 via FiftyOne, HoliSafe-Bench, UnsafeBench, Open Images V7, SurgWound en HOD Benchmark Dataset.

Subscribe to the Ray newsletter. Product updates, release notes, and customer news.

No spam. Just the Ray newsletter and important product updates.

Lees verder

Ray ASR-benchmark: 98 talen, volledige resultaten3 min readWaarom elke ondertiteling die je downloadt een gok is - en hoe Ray dit oplost2 min readRay FAQ: alles wat je moet weten2 min read