Sedang diputar · Tolok Ukur
Memperkenalkan Ray Guardian: Keamanan Visual untuk Gambar dan Video
Ray Guardian adalah sistem keamanan visual terpadu milik Ray, yang diuji pada 13 kategori keamanan tingkat gambar dan dataset video berlabel publik.
Memperkenalkan Ray Guardian
Ray Guardian adalah sistem keamanan visual milik Ray untuk gambar dan video. Sistem ini meninjau media visual untuk mendeteksi konten sensitif dan mengembalikan sinyal kategori yang dapat digunakan Ray untuk pemutaran, pembuatan, moderasi, dan pengaturan keluarga.
Bagian pentingnya sederhana: Ray Guardian adalah satu sistem. Gambar diam dan klip video masuk melalui jalur media yang berbeda, tetapi produk menerima satu keputusan Guardian.
Untuk gambar, Ray Guardian mengevaluasi taksonomi keamanan lengkap: ketelanjangan, konten seksual, kekerasan, konten berdarah, senjata, narkoba, alkohol, merokok, konten mengganggu, berciuman / keintiman, melukai diri sendiri, kekejaman terhadap hewan, dan konten medis berdarah.
Untuk video, Ray Guardian menambahkan dimensi waktu. Satu frame dapat bersifat ambigu; sebuah klip dapat memperlihatkan tindakan, niat, dan konteks. Jalur video menggabungkan pengenalan keamanan tingkat frame dengan pemahaman temporal tingkat klip sehingga hasil akhir mencerminkan apa yang muncul di layar dan apa yang terjadi seiring waktu.
Itulah sistem yang kami uji.
Tolok ukur keamanan visual 13 kategori
Ray Guardian mencapai akurasi 100.000% pada tolok ukur gambar tersisih 13 kategori Ray Guardian: 17,435 label yang diketahui, 0 kesalahan.
Tolok ukur ini paling mendekati taksonomi produk itu sendiri: definisi kategori yang sama, contoh tersisih, dan rangkaian lengkap kategori keamanan visual Ray Guardian.
| Tolok ukur | Cakupan | Item | Akurasi | Presisi | Recall | F1 |
|---|---|---|---|---|---|---|
| Tolok ukur tingkat gambar tersisih Ray Guardian | Semua 13 kategori Ray Guardian | 17,435 labels | 100.000% | 100.000% | 100.000% | 100.000% |
Tolok ukur ini mencakup kategori yang sering tumpang tindih dalam produk nyata: konten seksual vs ketelanjangan, konten berdarah vs konten medis berdarah, senjata vs kekerasan, serta konten mengganggu vs konteks tidak menyenangkan biasa.
Rangkaian tolok ukur video berlabel publik
Tolok ukur video diukur berdasarkan label yang benar-benar disediakan oleh setiap dataset. Dataset ciuman-vs-pelukan mendukung bukti berciuman / keintiman. Dataset kekerasan mendukung bukti kekerasan dan peristiwa mengganggu. Dataset tindakan aman menguji apakah klip tindakan biasa dapat diloloskan tanpa salah.
Hal ini membuat hasil lebih mudah dibaca dan lebih sulit disalahgunakan: setiap baris melaporkan kinerja Ray Guardian berdasarkan cakupan label asli dataset tersebut.
| Dataset | Cakupan Ray Guardian | Klip | Akurasi | Presisi | Recall | F1 |
|---|---|---|---|---|---|---|
| HMDB51 Kiss vs Hug | Berciuman / Keintiman | 182 | 98.901% | 99.020% | 99.020% | 99.020% |
| XD-Violence Public Labels | Kekerasan / Mengganggu | 248 | 100.000% | 100.000% | 100.000% | 100.000% |
| UCF-Crime Mapped Labels | Kekerasan / Mengganggu | 79 | 100.000% | 100.000% | 100.000% | 100.000% |
| UCF-Crime Broad Anomaly | Anomali / Mengganggu | 109 | 100.000% | 100.000% | 100.000% | 100.000% |
| UCF101 Safe-Action Holdout | Pagar pengaman tindakan aman | 330 | 100.000% | n/a | n/a | n/a |
Baris UCF101 adalah pagar pengaman khusus-negatif: baris ini mengukur apakah tindakan aman biasa diblokir secara keliru. Dalam pengujian tersebut, Ray Guardian dengan benar mengizinkan semua 330 klip tindakan aman.
Apa yang ditunjukkan matriks kebingungan
Akurasi adalah angka utama. Matriks kebingungan menunjukkan pola keputusan yang mendasarinya.
Setiap matriks memisahkan izin yang benar, alarm palsu, klip tidak aman yang terlewat, dan klip tidak aman yang ditandai dengan benar. Hal ini penting karena sistem keamanan harus melindungi orang tanpa mengganggu media biasa lebih dari yang diperlukan.
Dataset referensi independen
Kami juga mengevaluasi Ray Guardian pada dataset referensi publik independen dan dataset referensi independen berakses terbatas. Dataset ini berguna karena labelnya dibuat oleh tim lain, untuk tujuan lain, dan tidak selalu selaras sempurna dengan kategori Ray Guardian.
Tabel di bawah melaporkan setiap hasil pada tingkat kategori yang dapat didukung oleh dataset tersebut. Ketika sebuah dataset menguji objek alkohol, kami melaporkan perilaku terkait alkohol. Ketika dataset tersebut menguji luka medis, kami melaporkan perilaku konten medis berdarah atau mengganggu.
| Dataset referensi | Cakupan Ray Guardian | Item | Akurasi | Recall | Catatan |
|---|---|---|---|---|---|
| HoliSafe-Bench test split | Kategori keamanan gambar yang dipetakan | 32,248 labels | 94.266% | 75.779% | Tolok ukur keamanan independen berakses terbatas |
| UnsafeBench train split | Kategori keamanan gambar yang dipetakan | 40,545 labels | 89.893% | 74.482% | Tolok ukur keamanan independen berakses terbatas |
| SurgWound test split | Konten medis berdarah | 137 images | 86.861% | 100.000% | Pemeriksaan sensitivitas terhadap luka medis |
| SurgWound test split | Mengganggu | 137 images | 83.942% | 99.130% | Pemeriksaan sensitivitas terhadap luka medis |
| Lower Limb and Feet Wound Dataset | Konten medis berdarah | 5,443 images | 65.185% | 98.958% | Pemeriksaan referensi domain luka |
| HOD Benchmark Dataset | Alkohol | 10,631 images | 97.667% | 87.095% | Tolok ukur objek untuk penggunaan riset |
| HOD Benchmark Dataset | Merokok | 10,631 images | 98.222% | 93.391% | Tolok ukur objek untuk penggunaan riset |
| HOD Benchmark Dataset | Senjata | 10,631 images | 85.053% | 68.659% | Tolok ukur objek untuk penggunaan riset |
| Open Images V7 selected validation subset | Senjata | 460 rows | 81.957% | 87.234% | Pemeriksaan referensi label objek |
Baris-baris ini menunjukkan perilaku Ray Guardian di luar tolok ukur yang menjadi dasar pengembangannya.
Mengapa angkanya berbeda
Skor referensi publik yang lebih rendah bukanlah suatu kontradiksi. Itu berarti dataset tersebut mengajukan pertanyaan yang berbeda.
Tolok ukur 13 kategori Ray Guardian menanyakan apakah sistem mengenali kategori keamanan yang digunakan di Ray. Dataset referensi independen menanyakan apa yang terjadi ketika label eksternal, metode pengumpulan eksternal, dan definisi kategori eksternal dipetakan ke dalam taksonomi tersebut.
Skor dapat berubah karena alasan yang mudah dipahami:
- Definisi label yang berbeda. Sebuah dataset mungkin memberi label pada objek, sementara Ray Guardian menilai makna keamanannya. Gelas anggur, botol, pisau, atau luka klinis tidak selalu tidak aman dengan sendirinya.
- Label kasar. Beberapa label keamanan publik menggabungkan beberapa konsep menjadi satu label luas. Kategori Ray Guardian lebih spesifik.
- Kesenjangan konteks. Beberapa label bergantung pada teks keterangan, audio, adegan sekitar, atau niat manusia. Pengujian ini mengukur konten yang terlihat.
- Pergeseran domain. Dataset eksternal mencakup pemotongan gambar, resolusi, gambar hasil generasi, rekaman pengawasan, tampilan dekat objek, dan citra medis yang berbeda.
- Desain tugas yang berbeda. Tolok ukur pengenalan objek merupakan uji tekanan yang berguna, tetapi pengenalan objek tidak identik dengan moderasi keamanan visual.
Tolok ukur yang selaras menunjukkan kinerja pada taksonomi produk Ray Guardian. Dataset referensi menunjukkan bagaimana taksonomi tersebut ditransfer ke data eksternal yang lebih tidak teratur.
Cara membaca tolok ukur
Baca setiap angka pada tingkat label yang mendasarinya.
- Hasil 13 kategori mengukur taksonomi keamanan tingkat gambar Ray Guardian secara lengkap.
- Baris video mengukur Ray Guardian berdasarkan label video publik yang tersedia dalam setiap dataset.
- Baris referensi independen mengukur transfer ke sistem label eksternal, bukan sebagai pengganti tolok ukur taksonomi produk.
Ray Guardian kini menjadi lapisan keamanan visual terpadu milik Ray: satu sistem untuk gambar dan klip, yang dibuat untuk mendeteksi konten sensitif dan menjaga keputusan tetap stabil saat media bergerak dari frame ke frame.
Dataset sumber
Rangkaian tolok ukur ini mengutip sumber dataset, termasuk HMDB51 via FiftyOne, XD-Violence, UCF-Crime, UCF101 via FiftyOne, HoliSafe-Bench, UnsafeBench, Open Images V7, SurgWound, dan HOD Benchmark Dataset.

