În redare · Evaluări comparative
Prezentăm Ray Guardian: siguranță vizuală pentru imagini și videoclipuri
Ray Guardian este sistemul unificat de siguranță vizuală al Ray, evaluat comparativ în 13 categorii de siguranță la nivel de imagine și pe seturi de date video cu etichete publice.
Prezentarea Ray Guardian
Ray Guardian este sistemul de siguranță vizuală al Ray pentru imagini și videoclipuri. Acesta analizează conținutul media vizual pentru conținut sensibil și returnează semnale pe categorii pe care Ray le poate utiliza pentru redare, creare, moderare și setări pentru familie.
Aspectul important este simplu: Ray Guardian este un singur sistem. Imaginile statice și clipurile video intră prin fluxuri media diferite, dar produsul primește o singură decizie Guardian.
Pentru imagini, Ray Guardian evaluează întreaga taxonomie de siguranță: nuditate, conținut sexual, violență, conținut sângeros, arme, droguri, alcool, fumat, conținut tulburător, sărut / intimitate, autovătămare, cruzime față de animale și conținut medical sângeros.
Pentru videoclipuri, Ray Guardian adaugă dimensiunea temporală. Un singur cadru poate fi ambiguu; un clip poate prezenta acțiunea, intenția și contextul. Fluxul video combină recunoașterea siguranței la nivel de cadru cu înțelegerea temporală la nivel de clip, astfel încât rezultatul final să reflecte ceea ce apare pe ecran și ceea ce se întâmplă în timp.
Acesta este sistemul pe care l-am evaluat comparativ.
Evaluarea comparativă a siguranței vizuale în 13 categorii
Ray Guardian a atins o acuratețe de 100.000% în evaluarea comparativă rezervată pentru imagini Ray Guardian, cu 13 categorii: 17,435 de etichete cunoscute, 0 erori.
Această evaluare comparativă este cea mai apropiată de taxonomia produsului: aceleași definiții ale categoriilor, exemple rezervate și setul complet de categorii de siguranță vizuală Ray Guardian.
| Evaluare comparativă | Domeniu | Elemente | Acuratețe | Precizie | Rapel | F1 |
|---|---|---|---|---|---|---|
| Evaluarea comparativă rezervată Ray Guardian la nivel de imagine | Toate cele 13 categorii Ray Guardian | 17,435 labels | 100.000% | 100.000% | 100.000% | 100.000% |
Evaluarea comparativă include categorii care se suprapun adesea în produse reale: conținut sexual față de nuditate, conținut sângeros față de conținut medical sângeros, arme față de violență și conținut tulburător față de un context neplăcut obișnuit.
Suită de evaluări comparative video cu etichete publice
Evaluările comparative video sunt măsurate în raport cu etichetele pe care le furnizează efectiv fiecare set de date. Un set de date cu săruturi față de îmbrățișări oferă dovezi privind sărutul / intimitatea. Un set de date despre violență oferă dovezi privind violența și evenimentele tulburătoare. Un set de date cu acțiuni sigure testează dacă sunt permise fără probleme clipurile cu acțiuni obișnuite.
Acest lucru face rezultatele mai ușor de citit și mai greu de utilizat necorespunzător: fiecare rând raportează performanța Ray Guardian pentru domeniul nativ al etichetelor din setul de date respectiv.
| Set de date | Domeniul Ray Guardian | Clipuri | Acuratețe | Precizie | Rapel | F1 |
|---|---|---|---|---|---|---|
| HMDB51 Sărut vs îmbrățișare | Sărut / Intimitate | 182 | 98.901% | 99.020% | 99.020% | 99.020% |
| XD-Violence Etichete publice | Violență / Conținut tulburător | 248 | 100.000% | 100.000% | 100.000% | 100.000% |
| UCF-Crime Etichete mapate | Violență / Conținut tulburător | 79 | 100.000% | 100.000% | 100.000% | 100.000% |
| UCF-Crime Anomalie generală | Anomalie / Conținut tulburător | 109 | 100.000% | 100.000% | 100.000% | 100.000% |
| UCF101 Set rezervat de acțiuni sigure | Mecanism de protecție pentru acțiuni sigure | 330 | 100.000% | n/a | n/a | n/a |
Rândul UCF101 reprezintă un mecanism de protecție numai cu exemple negative: măsoară dacă acțiunile sigure obișnuite sunt blocate incorect. În acest test, Ray Guardian a permis corect toate cele 330 de clipuri cu acțiuni sigure.
Ce arată matricele de confuzie
Acuratețea este cifra principală. O matrice de confuzie arată tiparul deciziilor din spatele acesteia.
Fiecare matrice separă permisiunile corecte, alarmele false, clipurile nesigure omise și clipurile nesigure semnalate corect. Acest lucru este important deoarece un sistem de siguranță trebuie să protejeze oamenii fără a întrerupe conținutul media obișnuit mai mult decât este necesar.
Seturi de date de referință independente
Evaluăm Ray Guardian și pe seturi de date de referință independente, publice și cu acces restricționat. Aceste seturi de date sunt utile deoarece etichetele lor au fost redactate de alte echipe, pentru alte obiective, și nu se aliniază întotdeauna perfect cu categoriile Ray Guardian.
Tabelul de mai jos raportează fiecare rezultat la nivelul de categorie pe care îl poate susține setul de date. Când un set de date testează obiecte asociate alcoolului, raportăm comportamentul privind alcoolul. Când testează răni medicale, raportăm comportamentul privind conținutul medical sângeros sau conținutul tulburător.
| Set de date de referință | Domeniul Ray Guardian | Elemente | Acuratețe | Rapel | Note |
|---|---|---|---|---|---|
| Setul de testare HoliSafe-Bench | Categorii mapate de siguranță a imaginilor | 32,248 labels | 94.266% | 75.779% | Evaluare comparativă independentă de siguranță, cu acces restricționat |
| Setul de antrenare UnsafeBench | Categorii mapate de siguranță a imaginilor | 40,545 labels | 89.893% | 74.482% | Evaluare comparativă independentă de siguranță, cu acces restricționat |
| Setul de testare SurgWound | Conținut medical sângeros | 137 images | 86.861% | 100.000% | Verificare a sensibilității la răni medicale |
| Setul de testare SurgWound | Conținut tulburător | 137 images | 83.942% | 99.130% | Verificare a sensibilității la răni medicale |
| Lower Limb and Feet Wound Dataset | Conținut medical sângeros | 5,443 images | 65.185% | 98.958% | Verificare de referință în domeniul rănilor |
| HOD Benchmark Dataset | Alcool | 10,631 images | 97.667% | 87.095% | Evaluare comparativă de obiecte pentru uz de cercetare |
| HOD Benchmark Dataset | Fumat | 10,631 images | 98.222% | 93.391% | Evaluare comparativă de obiecte pentru uz de cercetare |
| HOD Benchmark Dataset | Arme | 10,631 images | 85.053% | 68.659% | Evaluare comparativă de obiecte pentru uz de cercetare |
| Subset de validare selectat Open Images V7 | Arme | 460 rows | 81.957% | 87.234% | Verificare de referință a etichetelor de obiecte |
Aceste rânduri arată cum se comportă Ray Guardian dincolo de evaluarea comparativă pentru care a fost construit.
De ce diferă cifrele
Un scor public de referință mai mic nu reprezintă o contradicție. Înseamnă că setul de date pune o întrebare diferită.
Evaluarea comparativă Ray Guardian cu 13 categorii verifică dacă sistemul recunoaște categoriile de siguranță utilizate în Ray. Seturile de date de referință independente verifică ce se întâmplă atunci când etichete externe, metode externe de colectare și definiții externe ale categoriilor sunt mapate în această taxonomie.
Scorurile pot varia din motive directe:
- Definiții diferite ale etichetelor. Un set de date poate eticheta un obiect, în timp ce Ray Guardian evaluează semnificația sa pentru siguranță. Un pahar de vin, o sticlă, un cuțit sau o rană clinică nu sunt întotdeauna nesigure în sine.
- Etichete generale. Unele etichete publice de siguranță combină mai multe concepte într-o singură etichetă generală. Categoriile Ray Guardian sunt mai specifice.
- Lipsuri de context. Unele etichete depind de legendă, sunet, scena înconjurătoare sau intenția umană. Aceste teste măsoară conținutul vizibil.
- Schimbarea domeniului. Seturile de date externe includ decupaje, rezoluții, imagini generate, înregistrări de supraveghere, prim-planuri ale obiectelor și imagistică medicală diferite.
- Conceperea diferită a sarcinii. Evaluările comparative de recunoaștere a obiectelor sunt teste de rezistență utile, dar recunoașterea obiectelor nu este identică cu moderarea siguranței vizuale.
Evaluarea comparativă aliniată arată performanța pentru taxonomia de produs Ray Guardian. Seturile de date de referință arată cum se transferă această taxonomie asupra unor date externe mai dezordonate.
Cum trebuie citită evaluarea comparativă
Citiți fiecare cifră la nivelul etichetelor pe care se bazează.
- Rezultatul pentru 13 categorii măsoară întreaga taxonomie de siguranță Ray Guardian la nivel de imagine.
- Rândurile video măsoară Ray Guardian pe etichetele video publice disponibile în fiecare set de date.
- Rândurile de referință independente măsoară transferul către sisteme externe de etichetare, nu înlocuiesc evaluarea comparativă a taxonomiei produsului.
Ray Guardian este acum nivelul unificat de siguranță vizuală al Ray: un singur sistem pentru imagini și clipuri, construit pentru a detecta conținutul sensibil și a menține deciziile stabile pe măsură ce conținutul media trece de la un cadru la altul.
Seturi de date sursă
Suita de evaluări comparative citează surse de seturi de date, inclusiv HMDB51 prin FiftyOne, XD-Violence, UCF-Crime, UCF101 prin FiftyOne, HoliSafe-Bench, UnsafeBench, Open Images V7, SurgWound și HOD Benchmark Dataset.

