Právě se přehrává · Benchmarky
Představujeme Ray Guardian: vizuální bezpečnost pro obrázky a videa
Ray Guardian je jednotný systém vizuální bezpečnosti platformy Ray, testovaný ve 13 bezpečnostních kategoriích na úrovni obrázků a na videosouborech dat s veřejnými štítky.
Představujeme Ray Guardian
Ray Guardian je systém vizuální bezpečnosti platformy Ray pro obrázky a videa. Kontroluje vizuální média z hlediska citlivého obsahu a vrací signály kategorií, které může Ray využít při přehrávání, tvorbě, moderování a v rodinných nastaveních.
Podstatné je jednoduché: Ray Guardian je jeden systém. Statické obrázky a videoklipy vstupují různými cestami pro média, ale produkt obdrží jedno rozhodnutí systému Guardian.
U obrázků Ray Guardian vyhodnocuje úplnou taxonomii bezpečnosti: nahotu, sexuální obsah, násilí, krvavý obsah, zbraně, drogy, alkohol, kouření, znepokojivý obsah, líbání / intimitu, sebepoškozování, týrání zvířat a zdravotnický krvavý obsah.
U videa Ray Guardian přidává časovou dimenzi. Jednotlivý snímek může být nejednoznačný, zatímco klip může ukázat děj, záměr a kontext. Cesta zpracování videa kombinuje rozpoznávání bezpečnosti na úrovni snímků s časovým porozuměním na úrovni klipu, aby konečný výsledek odrážel to, co se objevuje na obrazovce, i to, co se odehrává v čase.
Právě tento systém jsme testovali.
Benchmark vizuální bezpečnosti ve 13 kategoriích
Ray Guardian dosáhl 100.000% správnosti ve vyčleněném obrázkovém benchmarku Ray Guardian se 13 kategoriemi: 17,435 známých štítků, 0 chyb.
Tento benchmark nejpřesněji odpovídá samotné taxonomii produktu: používá stejné definice kategorií, vyčleněné příklady a úplnou sadu kategorií vizuální bezpečnosti systému Ray Guardian.
| Benchmark | Rozsah | Položky | Správnost | Preciznost | Úplnost | F1 |
|---|---|---|---|---|---|---|
| Vyčleněný obrázkový benchmark Ray Guardian | Všech 13 kategorií Ray Guardian | 17,435 štítků | 100.000% | 100.000% | 100.000% | 100.000% |
Benchmark zahrnuje kategorie, které se ve skutečných produktech často překrývají: sexuální obsah oproti nahotě, krvavý obsah oproti zdravotnickému krvavému obsahu, zbraně oproti násilí a znepokojivý obsah oproti běžnému nepříjemnému kontextu.
Sada videobenchmarků s veřejnými štítky
Videobenchmarky jsou měřeny podle štítků, které jednotlivé datové sady skutečně poskytují. Datová sada rozlišující polibek od objetí poskytuje podklady pro líbání / intimitu. Datová sada násilí poskytuje podklady pro násilí a znepokojivé události. Datová sada bezpečných činností testuje, zda jsou běžné akční klipy bez problémů povoleny.
Díky tomu se výsledky snáze interpretují a hůře zneužívají: každý řádek uvádí výkon systému Ray Guardian v rozsahu původních štítků dané datové sady.
| Datová sada | Rozsah Ray Guardian | Klipy | Správnost | Preciznost | Úplnost | F1 |
|---|---|---|---|---|---|---|
| HMDB51 Kiss vs Hug | Líbání / intimita | 182 | 98.901% | 99.020% | 99.020% | 99.020% |
| XD-Violence Public Labels | Násilí / znepokojivý obsah | 248 | 100.000% | 100.000% | 100.000% | 100.000% |
| UCF-Crime Mapped Labels | Násilí / znepokojivý obsah | 79 | 100.000% | 100.000% | 100.000% | 100.000% |
| UCF-Crime Broad Anomaly | Anomálie / znepokojivý obsah | 109 | 100.000% | 100.000% | 100.000% | 100.000% |
| UCF101 Safe-Action Holdout | Ochranný test bezpečných činností | 330 | 100.000% | n/a | n/a | n/a |
Řádek UCF101 je ochranný test obsahující pouze negativní příklady: měří, zda nejsou běžné bezpečné činnosti nesprávně blokovány. V tomto testu Ray Guardian správně povolil všech 330 klipů s bezpečnými činnostmi.
Co ukazují matice záměn
Správnost je hlavní uváděnou hodnotou. Matice záměn ukazuje strukturu rozhodnutí, která za ní stojí.
Každá matice rozlišuje správná povolení, falešné poplachy, nezachycené nebezpečné klipy a správně označené nebezpečné klipy. Na tom záleží, protože bezpečnostní systém musí chránit lidi, aniž by běžná média narušoval více, než je nutné.
Nezávislé referenční datové sady
Ray Guardian vyhodnocujeme také na nezávislých veřejných referenčních datových sadách a referenčních datových sadách s omezeným přístupem. Tyto datové sady jsou užitečné, protože jejich štítky vytvořily jiné týmy pro jiné účely a ne vždy se dokonale shodují s kategoriemi Ray Guardian.
Níže uvedená tabulka uvádí každý výsledek na úrovni kategorií, kterou daná datová sada podporuje. Když datová sada testuje objekty spojené s alkoholem, uvádíme chování kategorie alkohol. Když testuje zdravotnické rány, uvádíme chování kategorie zdravotnický krvavý obsah nebo znepokojivý obsah.
| Referenční datová sada | Rozsah Ray Guardian | Položky | Správnost | Úplnost | Poznámky |
|---|---|---|---|---|---|
| HoliSafe-Bench test split | Mapované kategorie bezpečnosti obrázků | 32,248 štítků | 94.266% | 75.779% | Nezávislý bezpečnostní benchmark s omezeným přístupem |
| UnsafeBench train split | Mapované kategorie bezpečnosti obrázků | 40,545 štítků | 89.893% | 74.482% | Nezávislý bezpečnostní benchmark s omezeným přístupem |
| SurgWound test split | Zdravotnický krvavý obsah | 137 obrázků | 86.861% | 100.000% | Kontrola citlivosti na zdravotnické rány |
| SurgWound test split | Znepokojivý obsah | 137 obrázků | 83.942% | 99.130% | Kontrola citlivosti na zdravotnické rány |
| Lower Limb and Feet Wound Dataset | Zdravotnický krvavý obsah | 5,443 obrázků | 65.185% | 98.958% | Referenční kontrola v doméně ran |
| HOD Benchmark Dataset | Alkohol | 10,631 obrázků | 97.667% | 87.095% | Objektový benchmark pro výzkumné použití |
| HOD Benchmark Dataset | Kouření | 10,631 obrázků | 98.222% | 93.391% | Objektový benchmark pro výzkumné použití |
| HOD Benchmark Dataset | Zbraně | 10,631 obrázků | 85.053% | 68.659% | Objektový benchmark pro výzkumné použití |
| Open Images V7 selected validation subset | Zbraně | 460 řádků | 81.957% | 87.234% | Referenční kontrola objektových štítků |
Tyto řádky ukazují, jak se Ray Guardian chová i mimo benchmark, pro který byl vytvořen.
Proč se hodnoty liší
Nižší skóre ve veřejné referenční datové sadě není v rozporu s ostatními výsledky. Znamená to, že datová sada pokládá jinou otázku.
Benchmark Ray Guardian se 13 kategoriemi zjišťuje, zda systém rozpoznává bezpečnostní kategorie používané v platformě Ray. Nezávislé referenční datové sady zjišťují, co se stane, když se do této taxonomie namapují externí štítky, externí metody sběru a externí definice kategorií.
Skóre se mohou měnit z přímočarých důvodů:
- Odlišné definice štítků. Datová sada může označovat objekt, zatímco Ray Guardian posuzuje jeho význam z hlediska bezpečnosti. Sklenice vína, láhev, nůž ani klinická rána nejsou samy o sobě vždy nebezpečné.
- Hrubé štítky. Některé veřejné bezpečnostní štítky slučují několik konceptů do jednoho širokého štítku. Kategorie Ray Guardian jsou konkrétnější.
- Chybějící kontext. Některé štítky závisejí na titulku, zvuku, okolní scéně nebo lidském záměru. Tyto testy měří viditelný obsah.
- Posun domény. Externí datové sady zahrnují odlišné výřezy, rozlišení, generované obrázky, záběry z bezpečnostních kamer, detailní záběry objektů a zdravotnické snímky.
- Odlišný návrh úlohy. Benchmarky rozpoznávání objektů jsou užitečné zátěžové testy, ale rozpoznávání objektů není totožné s moderováním vizuální bezpečnosti.
Sladěný benchmark ukazuje výkon v produktové taxonomii Ray Guardian. Referenční datové sady ukazují, jak se tato taxonomie přenáší na méně uspořádaná externí data.
Jak benchmark interpretovat
Každou hodnotu interpretujte na úrovni štítků, z nichž vychází.
- Výsledek ve 13 kategoriích měří úplnou taxonomii bezpečnosti Ray Guardian na úrovni obrázků.
- Řádky videí měří Ray Guardian podle veřejných štítků videí dostupných v jednotlivých datových sadách.
- Řádky nezávislých referenčních dat měří přenos do externích systémů štítků; nenahrazují benchmark produktové taxonomie.
Ray Guardian je nyní jednotnou vrstvou vizuální bezpečnosti platformy Ray: jeden systém pro obrázky a klipy, vytvořený k zachycování citlivého obsahu a udržování stabilních rozhodnutí při přechodu média ze snímku na snímek.
Zdrojové datové sady
Sada benchmarků uvádí zdroje datových sad včetně HMDB51 via FiftyOne, XD-Violence, UCF-Crime, UCF101 via FiftyOne, HoliSafe-Bench, UnsafeBench, Open Images V7, SurgWound a HOD Benchmark Dataset.

