In riproduzione · Benchmark
Presentazione di Ray Guardian: sicurezza visiva per immagini e video
Ray Guardian è il sistema unificato di sicurezza visiva di Ray, valutato tramite benchmark su 13 categorie di sicurezza a livello di immagine e su dataset video con etichette pubbliche.
Presentazione di Ray Guardian
Ray Guardian è il sistema di sicurezza visiva di Ray per immagini e video. Esamina i contenuti visivi per rilevare contenuti sensibili e restituisce segnali di categoria che Ray può utilizzare per la riproduzione, la creazione, la moderazione e le impostazioni familiari.
Il punto importante è semplice: Ray Guardian è un unico sistema. Le immagini statiche e i videoclip vengono elaborati attraverso percorsi multimediali diversi, ma il prodotto riceve un'unica decisione di Guardian.
Per le immagini, Ray Guardian valuta l'intera tassonomia di sicurezza: nudità, contenuti sessuali, violenza, contenuti cruenti, armi, droghe, alcol, fumo, contenuti disturbanti, baci / intimità, autolesionismo, crudeltà verso gli animali e contenuti cruenti di natura medica.
Per i video, Ray Guardian aggiunge la dimensione temporale. Un singolo fotogramma può essere ambiguo; un clip può mostrare azione, intento e contesto. Il percorso video combina il riconoscimento della sicurezza a livello di fotogramma con la comprensione temporale a livello di clip, affinché il risultato finale rifletta ciò che appare sullo schermo e ciò che accade nel tempo.
Questo è il sistema che abbiamo sottoposto a benchmark.
Benchmark di sicurezza visiva su 13 categorie
Ray Guardian ha raggiunto un'accuratezza del 100.000% nel benchmark riservato di Ray Guardian per immagini su 13 categorie: 17,435 etichette note, 0 errori.
Questo benchmark è quello più vicino alla tassonomia del prodotto: le stesse definizioni delle categorie, esempi riservati e l'insieme completo delle categorie di sicurezza visiva di Ray Guardian.
| Benchmark | Ambito | Elementi | Accuratezza | Precisione | Richiamo | F1 |
|---|---|---|---|---|---|---|
| Benchmark riservato di Ray Guardian a livello di immagine | Tutte le 13 categorie di Ray Guardian | 17,435 etichette | 100.000% | 100.000% | 100.000% | 100.000% |
Il benchmark include categorie che spesso si sovrappongono nei prodotti reali: contenuti sessuali rispetto a nudità, contenuti cruenti rispetto a contenuti cruenti di natura medica, armi rispetto a violenza e contenuti disturbanti rispetto a un normale contesto spiacevole.
Suite di benchmark video con etichette pubbliche
I benchmark video vengono misurati rispetto alle etichette effettivamente fornite da ciascun dataset. Un dataset che confronta baci e abbracci fornisce evidenze su baci / intimità. Un dataset sulla violenza fornisce evidenze su violenza ed eventi disturbanti. Un dataset di azioni sicure verifica se i clip di azioni ordinarie vengono autorizzati senza problemi.
Ciò rende i risultati più facili da leggere e più difficili da utilizzare in modo improprio: ogni riga riporta le prestazioni di Ray Guardian nell'ambito delle etichette native di quel dataset.
| Dataset | Ambito di Ray Guardian | Clip | Accuratezza | Precisione | Richiamo | F1 |
|---|---|---|---|---|---|---|
| HMDB51 Kiss vs Hug | Baci / Intimità | 182 | 98.901% | 99.020% | 99.020% | 99.020% |
| XD-Violence Public Labels | Violenza / Contenuti disturbanti | 248 | 100.000% | 100.000% | 100.000% | 100.000% |
| UCF-Crime Mapped Labels | Violenza / Contenuti disturbanti | 79 | 100.000% | 100.000% | 100.000% | 100.000% |
| UCF-Crime Broad Anomaly | Anomalia / Contenuti disturbanti | 109 | 100.000% | 100.000% | 100.000% | 100.000% |
| UCF101 Safe-Action Holdout | Controllo di sicurezza per azioni sicure | 330 | 100.000% | n/a | n/a | n/a |
La riga UCF101 è un controllo di sicurezza composto esclusivamente da esempi negativi: misura se le normali azioni sicure vengono bloccate erroneamente. In questo test, Ray Guardian ha autorizzato correttamente tutti i 330 clip di azioni sicure.
Cosa mostrano le matrici di confusione
L'accuratezza è il dato principale. Una matrice di confusione mostra la struttura delle decisioni che lo determinano.
Ogni matrice distingue autorizzazioni corrette, falsi allarmi, clip non sicuri non rilevati e clip non sicuri contrassegnati correttamente. Questo è importante perché un sistema di sicurezza deve proteggere le persone senza interrompere i normali contenuti multimediali più del necessario.
Dataset di riferimento indipendenti
Valutiamo Ray Guardian anche su dataset di riferimento indipendenti, pubblici e ad accesso controllato. Questi dataset sono utili perché le loro etichette sono state definite da altri team, per altri obiettivi, e non sempre corrispondono perfettamente alle categorie di Ray Guardian.
La tabella seguente riporta ciascun risultato al livello di categoria supportato dal dataset. Quando un dataset verifica oggetti legati all'alcol, riportiamo il comportamento relativo all'alcol. Quando verifica ferite mediche, riportiamo il comportamento relativo ai contenuti cruenti di natura medica o ai contenuti disturbanti.
| Dataset di riferimento | Ambito di Ray Guardian | Elementi | Accuratezza | Richiamo | Note |
|---|---|---|---|---|---|
| HoliSafe-Bench test split | Categorie mappate di sicurezza delle immagini | 32,248 etichette | 94.266% | 75.779% | Benchmark di sicurezza indipendente ad accesso controllato |
| UnsafeBench train split | Categorie mappate di sicurezza delle immagini | 40,545 etichette | 89.893% | 74.482% | Benchmark di sicurezza indipendente ad accesso controllato |
| SurgWound test split | Contenuti cruenti di natura medica | 137 immagini | 86.861% | 100.000% | Controllo della sensibilità alle ferite mediche |
| SurgWound test split | Contenuti disturbanti | 137 immagini | 83.942% | 99.130% | Controllo della sensibilità alle ferite mediche |
| Lower Limb and Feet Wound Dataset | Contenuti cruenti di natura medica | 5,443 immagini | 65.185% | 98.958% | Controllo di riferimento nel dominio delle ferite |
| HOD Benchmark Dataset | Alcol | 10,631 immagini | 97.667% | 87.095% | Benchmark di oggetti destinato all'uso di ricerca |
| HOD Benchmark Dataset | Fumo | 10,631 immagini | 98.222% | 93.391% | Benchmark di oggetti destinato all'uso di ricerca |
| HOD Benchmark Dataset | Armi | 10,631 immagini | 85.053% | 68.659% | Benchmark di oggetti destinato all'uso di ricerca |
| Open Images V7 selected validation subset | Armi | 460 righe | 81.957% | 87.234% | Controllo di riferimento delle etichette degli oggetti |
Queste righe mostrano come si comporta Ray Guardian al di là del benchmark rispetto al quale è stato sviluppato.
Perché i numeri differiscono
Un punteggio inferiore su un riferimento pubblico non è una contraddizione. Significa che il dataset pone una domanda diversa.
Il benchmark di Ray Guardian su 13 categorie verifica se il sistema riconosce le categorie di sicurezza utilizzate in Ray. I dataset di riferimento indipendenti verificano cosa accade quando etichette esterne, metodi di raccolta esterni e definizioni di categoria esterne vengono mappati in tale tassonomia.
I punteggi possono variare per motivi semplici:
- Definizioni delle etichette diverse. Un dataset può etichettare un oggetto mentre Ray Guardian ne valuta il significato in termini di sicurezza. Un bicchiere di vino, una bottiglia, un coltello o una ferita clinica non sono sempre non sicuri di per sé.
- Etichette generiche. Alcune etichette pubbliche di sicurezza combinano diversi concetti in un'unica etichetta ampia. Le categorie di Ray Guardian sono più specifiche.
- Lacune nel contesto. Alcune etichette dipendono dalla didascalia, dall'audio, dalla scena circostante o dall'intento umano. Questi test misurano i contenuti visibili.
- Variazione del dominio. I dataset esterni includono ritagli, risoluzioni, immagini generate, filmati di sorveglianza, primi piani di oggetti e immagini mediche differenti.
- Progettazione diversa dell'attività. I benchmark di riconoscimento degli oggetti sono utili stress test, ma il riconoscimento degli oggetti non equivale alla moderazione della sicurezza visiva.
Il benchmark allineato mostra le prestazioni sulla tassonomia di prodotto di Ray Guardian. I dataset di riferimento mostrano come tale tassonomia si trasferisce a dati esterni meno strutturati.
Come leggere il benchmark
Ogni numero deve essere letto al livello delle etichette su cui si basa.
- Il risultato su 13 categorie misura l'intera tassonomia di sicurezza di Ray Guardian a livello di immagine.
- Le righe relative ai video misurano Ray Guardian sulle etichette video pubbliche disponibili in ciascun dataset.
- Le righe di riferimento indipendenti misurano il trasferimento a sistemi di etichettatura esterni, non sostituiscono il benchmark della tassonomia del prodotto.
Ray Guardian è ora il livello unificato di sicurezza visiva di Ray: un unico sistema per immagini e clip, progettato per rilevare contenuti sensibili e mantenere stabili le decisioni mentre i contenuti multimediali passano da un fotogramma all'altro.
Dataset di origine
La suite di benchmark cita fonti di dataset che includono HMDB51 via FiftyOne, XD-Violence, UCF-Crime, UCF101 via FiftyOne, HoliSafe-Bench, UnsafeBench, Open Images V7, SurgWound e HOD Benchmark Dataset.

