Teraz odtwarzane · Testy porównawcze
Przedstawiamy Ray Guardian: bezpieczeństwo wizualne obrazów i wideo
Ray Guardian to ujednolicony system bezpieczeństwa wizualnego Ray, przetestowany w 13 kategoriach bezpieczeństwa na poziomie obrazu oraz na zbiorach danych wideo z publicznie dostępnymi etykietami.
Przedstawiamy Ray Guardian
Ray Guardian to system bezpieczeństwa wizualnego Ray przeznaczony do obrazów i wideo. Analizuje media wizualne pod kątem treści wrażliwych i zwraca sygnały kategorii, które Ray może wykorzystywać do odtwarzania, tworzenia, moderacji i ustawień rodzinnych.
Najważniejsza kwestia jest prosta: Ray Guardian jest jednym systemem. Obrazy nieruchome i klipy wideo trafiają do niego różnymi ścieżkami obsługi mediów, ale produkt otrzymuje jedną decyzję Ray Guardian.
W przypadku obrazów Ray Guardian ocenia pełną taksonomię bezpieczeństwa: nagość, treści seksualne, przemoc, drastyczne treści, broń, narkotyki, alkohol, palenie tytoniu, treści niepokojące, pocałunki / intymność, samookaleczenia, okrucieństwo wobec zwierząt oraz drastyczne treści medyczne.
W przypadku wideo Ray Guardian uwzględnia również czas. Pojedyncza klatka może być niejednoznaczna; klip może ukazywać działanie, zamiar i kontekst. Ścieżka wideo łączy rozpoznawanie bezpieczeństwa na poziomie klatek z rozumieniem zależności czasowych na poziomie klipu, dzięki czemu końcowy wynik odzwierciedla zarówno to, co pojawia się na ekranie, jak i to, co dzieje się w czasie.
To właśnie ten system poddaliśmy testom porównawczym.
Test bezpieczeństwa wizualnego obejmujący 13 kategorii
Ray Guardian osiągnął 100.000% dokładności w wydzielonym teście obrazów Ray Guardian obejmującym 13 kategorii: 17,435 znanych etykiet, 0 błędów.
Ten test jest najbliższy samej taksonomii produktu: wykorzystuje te same definicje kategorii, wydzielone przykłady oraz pełny zestaw kategorii bezpieczeństwa wizualnego Ray Guardian.
| Test porównawczy | Zakres | Elementy | Dokładność | Precyzja | Czułość | F1 |
|---|---|---|---|---|---|---|
| Wydzielony test Ray Guardian na poziomie obrazu | Wszystkie 13 kategorii Ray Guardian | 17,435 etykiet | 100.000% | 100.000% | 100.000% | 100.000% |
Test obejmuje kategorie, które często nakładają się na siebie w rzeczywistych produktach: treści seksualne a nagość, drastyczne treści a drastyczne treści medyczne, broń a przemoc oraz treści niepokojące a zwykły nieprzyjemny kontekst.
Zestaw testów wideo z publicznie dostępnymi etykietami
Testy wideo są mierzone względem etykiet faktycznie udostępnianych przez każdy zbiór danych. Zbiór danych rozróżniający pocałunek od uścisku dostarcza dowodów dotyczących pocałunków / intymności. Zbiór danych dotyczący przemocy dostarcza dowodów dotyczących przemocy i niepokojących zdarzeń. Zbiór danych bezpiecznych działań sprawdza, czy zwykłe klipy przedstawiające działania są prawidłowo przepuszczane.
Dzięki temu wyniki są łatwiejsze do odczytania i trudniejsze do niewłaściwego wykorzystania: każdy wiersz przedstawia skuteczność Ray Guardian w natywnym zakresie etykiet danego zbioru danych.
| Zbiór danych | Zakres Ray Guardian | Klipy | Dokładność | Precyzja | Czułość | F1 |
|---|---|---|---|---|---|---|
| HMDB51 Pocałunek kontra uścisk | Pocałunki / Intymność | 182 | 98.901% | 99.020% | 99.020% | 99.020% |
| XD-Violence Etykiety publiczne | Przemoc / Treści niepokojące | 248 | 100.000% | 100.000% | 100.000% | 100.000% |
| UCF-Crime Zmapowane etykiety | Przemoc / Treści niepokojące | 79 | 100.000% | 100.000% | 100.000% | 100.000% |
| UCF-Crime Szeroka anomalia | Anomalia / Treści niepokojące | 109 | 100.000% | 100.000% | 100.000% | 100.000% |
| UCF101 Wydzielony test bezpiecznych działań | Zabezpieczenie dla bezpiecznych działań | 330 | 100.000% | n/a | n/a | n/a |
Wiersz UCF101 jest zabezpieczeniem obejmującym wyłącznie przykłady negatywne: mierzy, czy zwykłe bezpieczne działania są nieprawidłowo blokowane. W tym teście Ray Guardian prawidłowo przepuścił wszystkie 330 klipy przedstawiające bezpieczne działania.
Co pokazują macierze pomyłek
Dokładność jest głównym wynikiem. Macierz pomyłek pokazuje strukturę decyzji, które się za nim kryją.
Każda macierz rozdziela prawidłowe przepuszczenia, fałszywe alarmy, przeoczone niebezpieczne klipy oraz prawidłowo oznaczone niebezpieczne klipy. Ma to znaczenie, ponieważ system bezpieczeństwa musi chronić ludzi, nie zakłócając przy tym korzystania ze zwykłych mediów bardziej, niż jest to konieczne.
Niezależne referencyjne zbiory danych
Oceniamy również Ray Guardian na niezależnych publicznych i kontrolowanych referencyjnych zbiorach danych. Zbiory te są przydatne, ponieważ ich etykiety zostały opracowane przez inne zespoły, do innych celów i nie zawsze są w pełni zgodne z kategoriami Ray Guardian.
Poniższa tabela przedstawia każdy wynik na poziomie kategorii obsługiwanym przez dany zbiór danych. Gdy zbiór danych testuje obiekty związane z alkoholem, raportujemy zachowanie kategorii alkoholu. Gdy testuje rany medyczne, raportujemy zachowanie kategorii drastycznych treści medycznych lub treści niepokojących.
| Referencyjny zbiór danych | Zakres Ray Guardian | Elementy | Dokładność | Czułość | Uwagi |
|---|---|---|---|---|---|
| Podział testowy HoliSafe-Bench | Zmapowane kategorie bezpieczeństwa obrazów | 32,248 etykiet | 94.266% | 75.779% | Niezależny kontrolowany test bezpieczeństwa |
| Podział treningowy UnsafeBench | Zmapowane kategorie bezpieczeństwa obrazów | 40,545 etykiet | 89.893% | 74.482% | Niezależny kontrolowany test bezpieczeństwa |
| Podział testowy SurgWound | Drastyczne treści medyczne | 137 obrazów | 86.861% | 100.000% | Kontrola czułości na rany medyczne |
| Podział testowy SurgWound | Treści niepokojące | 137 obrazów | 83.942% | 99.130% | Kontrola czułości na rany medyczne |
| Lower Limb and Feet Wound Dataset | Drastyczne treści medyczne | 5,443 obrazów | 65.185% | 98.958% | Kontrola referencyjna dla domeny ran |
| HOD Benchmark Dataset | Alkohol | 10,631 obrazów | 97.667% | 87.095% | Test obiektów do użytku badawczego |
| HOD Benchmark Dataset | Palenie tytoniu | 10,631 obrazów | 98.222% | 93.391% | Test obiektów do użytku badawczego |
| HOD Benchmark Dataset | Broń | 10,631 obrazów | 85.053% | 68.659% | Test obiektów do użytku badawczego |
| Wybrany podzbiór walidacyjny Open Images V7 | Broń | 460 wierszy | 81.957% | 87.234% | Kontrola referencyjna etykiet obiektów |
Te wiersze pokazują, jak Ray Guardian zachowuje się poza testem, na podstawie którego został opracowany.
Dlaczego wyniki się różnią
Niższy publiczny wynik referencyjny nie jest sprzecznością. Oznacza, że zbiór danych stawia inne pytanie.
Test Ray Guardian obejmujący 13 kategorii sprawdza, czy system rozpoznaje kategorie bezpieczeństwa używane w Ray. Niezależne referencyjne zbiory danych sprawdzają, co się dzieje, gdy zewnętrzne etykiety, zewnętrzne metody gromadzenia danych i zewnętrzne definicje kategorii zostają zmapowane na tę taksonomię.
Wyniki mogą się zmieniać z prostych powodów:
- Różne definicje etykiet. Zbiór danych może oznaczać obiekt, podczas gdy Ray Guardian ocenia jego znaczenie dla bezpieczeństwa. Kieliszek wina, butelka, nóż lub rana kliniczna nie zawsze są same w sobie niebezpieczne.
- Ogólne etykiety. Niektóre publiczne etykiety bezpieczeństwa łączą kilka pojęć w jedną szeroką etykietę. Kategorie Ray Guardian są bardziej szczegółowe.
- Braki kontekstu. Niektóre etykiety zależą od podpisu, dźwięku, otaczającej sceny lub ludzkiego zamiaru. Te testy mierzą widoczną treść.
- Przesunięcie domeny. Zewnętrzne zbiory danych obejmują inne kadrowanie, rozdzielczości, wygenerowane obrazy, nagrania z monitoringu, zbliżenia obiektów i obrazy medyczne.
- Inna konstrukcja zadania. Testy rozpoznawania obiektów są przydatnymi testami obciążeniowymi, ale rozpoznawanie obiektów nie jest tym samym co moderowanie bezpieczeństwa wizualnego.
Dopasowany test pokazuje skuteczność w odniesieniu do taksonomii produktu Ray Guardian. Referencyjne zbiory danych pokazują, jak ta taksonomia przenosi się na mniej uporządkowane dane zewnętrzne.
Jak interpretować test
Każdy wynik należy interpretować na poziomie etykiet, na których się opiera.
- Wynik dla 13 kategorii mierzy pełną taksonomię bezpieczeństwa Ray Guardian na poziomie obrazu.
- Wiersze dotyczące wideo mierzą Ray Guardian względem publicznych etykiet wideo dostępnych w każdym zbiorze danych.
- Niezależne wiersze referencyjne mierzą przenoszenie na zewnętrzne systemy etykiet, a nie zastępują testu taksonomii produktu.
Ray Guardian jest obecnie ujednoliconą warstwą bezpieczeństwa wizualnego Ray: jednym systemem dla obrazów i klipów, stworzonym do wykrywania treści wrażliwych i utrzymywania stabilności decyzji podczas przechodzenia multimediów z klatki na klatkę.
Źródłowe zbiory danych
Zestaw testów przywołuje źródła zbiorów danych, w tym HMDB51 przez FiftyOne, XD-Violence, UCF-Crime, UCF101 przez FiftyOne, HoliSafe-Bench, UnsafeBench, Open Images V7, SurgWound oraz HOD Benchmark Dataset.

