Зараз відтворюється · Бенчмарки
Представляємо Ray Guardian: візуальна безпека для зображень і відео
Ray Guardian — це уніфікована система візуальної безпеки Ray, протестована за 13 категоріями безпеки на рівні зображень і на відеонаборах даних із публічно доступними мітками.
Представляємо Ray Guardian
Ray Guardian — це система візуальної безпеки Ray для зображень і відео. Вона перевіряє візуальні медіа на наявність чутливого контенту й повертає сигнали категорій, які Ray може використовувати для відтворення, створення, модерації та сімейних налаштувань.
Головне дуже просте: Ray Guardian — це єдина система. Нерухомі зображення та відеокліпи надходять різними медіашляхами, але продукт отримує єдине рішення Ray Guardian.
Для зображень Ray Guardian оцінює повну таксономію безпеки: оголеність, сексуальний контент, насильство, кривавий контент, зброю, наркотики, алкоголь, куріння, тривожний контент, поцілунки / інтимність, самоушкодження, жорстоке поводження з тваринами та медичний кривавий контент.
Для відео Ray Guardian додає часовий вимір. Окремий кадр може бути неоднозначним; кліп може показувати дію, намір і контекст. Відеошлях поєднує розпізнавання безпеки на рівні кадрів із часовим розумінням на рівні кліпу, щоб підсумковий результат відображав те, що з’являється на екрані, і те, що відбувається з плином часу.
Саме цю систему ми протестували.
13-категорійний бенчмарк візуальної безпеки
Ray Guardian досягла 100.000% точності на відкладеному 13-категорійному бенчмарку Ray Guardian для зображень: 17,435 відомих міток, 0 помилок.
Цей бенчмарк найближчий до самої таксономії продукту: ті самі визначення категорій, відкладені приклади та повний набір категорій візуальної безпеки Ray Guardian.
| Бенчмарк | Обсяг | Елементи | Точність | Прецизійність | Повнота | F1 |
|---|---|---|---|---|---|---|
| Відкладений бенчмарк Ray Guardian на рівні зображень | Усі 13 категорій Ray Guardian | 17,435 міток | 100.000% | 100.000% | 100.000% | 100.000% |
Бенчмарк охоплює категорії, які часто перетинаються в реальних продуктах: сексуальний контент і оголеність, кривавий контент і медичний кривавий контент, зброя і насильство, а також тривожний контент і звичайний неприємний контекст.
Набір відеобенчмарків із публічно доступними мітками
Відеобенчмарки вимірюються відносно міток, які фактично надає кожен набір даних. Набір даних для розрізнення поцілунків і обіймів надає свідчення щодо поцілунків / інтимності. Набір даних про насильство надає свідчення щодо насильства та тривожних подій. Набір даних із безпечними діями перевіряє, чи звичайні кліпи з діями безперешкодно пропускаються.
Це робить результати зрозумілішими та ускладнює їх неправильне використання: кожен рядок показує ефективність Ray Guardian у межах нативних міток відповідного набору даних.
| Набір даних | Обсяг Ray Guardian | Кліпи | Точність | Прецизійність | Повнота | F1 |
|---|---|---|---|---|---|---|
| HMDB51: поцілунок і обійми | Поцілунки / інтимність | 182 | 98.901% | 99.020% | 99.020% | 99.020% |
| XD-Violence: публічні мітки | Насильство / тривожний контент | 248 | 100.000% | 100.000% | 100.000% | 100.000% |
| UCF-Crime: зіставлені мітки | Насильство / тривожний контент | 79 | 100.000% | 100.000% | 100.000% | 100.000% |
| UCF-Crime: широка аномалія | Аномалія / тривожний контент | 109 | 100.000% | 100.000% | 100.000% | 100.000% |
| UCF101: відкладена вибірка безпечних дій | Захисна перевірка безпечних дій | 330 | 100.000% | n/a | n/a | n/a |
Рядок UCF101 — це захисна перевірка лише на негативних прикладах: вона вимірює, чи помилково блокуються звичайні безпечні дії. У цьому тесті Ray Guardian правильно дозволила всі 330 кліпів із безпечними діями.
Що показують матриці помилок
Точність — це головний показник. Матриця помилок показує структуру рішень, що стоять за ним.
Кожна матриця розділяє правильні дозволи, хибні спрацювання, пропущені небезпечні кліпи та правильно позначені небезпечні кліпи. Це важливо, оскільки система безпеки має захищати людей, не перериваючи звичайні медіа частіше, ніж це необхідно.
Незалежні еталонні набори даних
Ми також оцінюємо Ray Guardian на незалежних публічних і доступних за обмеженим доступом еталонних наборах даних. Ці набори даних корисні, оскільки їхні мітки створювали інші команди для інших цілей, і вони не завжди ідеально узгоджуються з категоріями Ray Guardian.
У таблиці нижче кожен результат наведено на рівні категорій, який може підтримувати відповідний набір даних. Коли набір даних тестує об’єкти, пов’язані з алкоголем, ми повідомляємо показники для категорії алкоголю. Коли він тестує медичні рани, ми повідомляємо показники для медичного кривавого контенту або тривожного контенту.
| Еталонний набір даних | Обсяг Ray Guardian | Елементи | Точність | Повнота | Примітки |
|---|---|---|---|---|---|
| Тестова вибірка HoliSafe-Bench | Зіставлені категорії безпеки зображень | 32,248 міток | 94.266% | 75.779% | Незалежний бенчмарк безпеки з обмеженим доступом |
| Навчальна вибірка UnsafeBench | Зіставлені категорії безпеки зображень | 40,545 міток | 89.893% | 74.482% | Незалежний бенчмарк безпеки з обмеженим доступом |
| Тестова вибірка SurgWound | Медичний кривавий контент | 137 зображень | 86.861% | 100.000% | Перевірка чутливості до медичних ран |
| Тестова вибірка SurgWound | Тривожний контент | 137 зображень | 83.942% | 99.130% | Перевірка чутливості до медичних ран |
| Lower Limb and Feet Wound Dataset | Медичний кривавий контент | 5,443 зображення | 65.185% | 98.958% | Еталонна перевірка в домені ран |
| HOD Benchmark Dataset | Алкоголь | 10,631 зображення | 97.667% | 87.095% | Бенчмарк об’єктів для дослідницького використання |
| HOD Benchmark Dataset | Куріння | 10,631 зображення | 98.222% | 93.391% | Бенчмарк об’єктів для дослідницького використання |
| HOD Benchmark Dataset | Зброя | 10,631 зображення | 85.053% | 68.659% | Бенчмарк об’єктів для дослідницького використання |
| Вибрана підмножина валідаційної вибірки Open Images V7 | Зброя | 460 рядків | 81.957% | 87.234% | Еталонна перевірка міток об’єктів |
Ці рядки показують, як Ray Guardian поводиться поза межами бенчмарку, для якого її було створено.
Чому показники відрізняються
Нижчий показник на публічному еталонному наборі не є суперечністю. Це означає, що набір даних ставить інше запитання.
13-категорійний бенчмарк Ray Guardian перевіряє, чи розпізнає система категорії безпеки, які використовуються в Ray. Незалежні еталонні набори даних перевіряють, що відбувається, коли зовнішні мітки, зовнішні методи збору та зовнішні визначення категорій зіставляються з цією таксономією.
Показники можуть змінюватися з очевидних причин:
- Різні визначення міток. Набір даних може позначати об’єкт, тоді як Ray Guardian оцінює його значення з погляду безпеки. Келих вина, пляшка, ніж або клінічна рана не завжди небезпечні самі по собі.
- Грубі мітки. Деякі публічні мітки безпеки об’єднують кілька понять в одну широку мітку. Категорії Ray Guardian конкретніші.
- Прогалини в контексті. Деякі мітки залежать від підпису, аудіо, навколишньої сцени або людського наміру. Ці тести вимірюють видимий контент.
- Зсув домену. Зовнішні набори даних містять інші кадрування, роздільні здатності, згенеровані зображення, записи камер спостереження, великі плани об’єктів і медичні зображення.
- Інший дизайн завдання. Бенчмарки розпізнавання об’єктів є корисними стрес-тестами, але розпізнавання об’єктів не тотожне модерації візуального контенту за критеріями безпеки.
Узгоджений бенчмарк показує ефективність на таксономії продукту Ray Guardian. Еталонні набори даних показують, як ця таксономія переноситься на складніші зовнішні дані.
Як читати бенчмарк
Читайте кожен показник на рівні міток, що стоять за ним.
- 13-категорійний результат вимірює повну таксономію безпеки Ray Guardian на рівні зображень.
- Рядки відео вимірюють Ray Guardian на публічних відеомітках, доступних у кожному наборі даних.
- Рядки незалежних еталонних наборів вимірюють перенесення на зовнішні системи міток, а не замінюють бенчмарк таксономії продукту.
Ray Guardian тепер є уніфікованим рівнем візуальної безпеки Ray: єдиною системою для зображень і кліпів, створеною для виявлення чутливого контенту та підтримання стабільності рішень під час переходу медіа від кадру до кадру.
Джерела наборів даних
У наборі бенчмарків наведено посилання на джерела наборів даних, зокрема HMDB51 через FiftyOne, XD-Violence, UCF-Crime, UCF101 через FiftyOne, HoliSafe-Bench, UnsafeBench, Open Images V7, SurgWound і HOD Benchmark Dataset.

