Сега се възпроизвежда · Сравнителни тестове
Представяме Ray Guardian: визуална безопасност за изображения и видео
Ray Guardian е унифицираната система на Ray за визуална безопасност, оценена чрез сравнителни тестове в 13 категории за безопасност на ниво изображение и набори от видеоданни с публични етикети.
Представяме Ray Guardian
Ray Guardian е системата на Ray за визуална безопасност при изображения и видео. Тя преглежда визуални медии за чувствително съдържание и връща сигнали по категории, които Ray може да използва за възпроизвеждане, създаване, модериране и семейни настройки.
Важното е просто: Ray Guardian е една система. Статичните изображения и видеоклиповете постъпват по различни медийни пътища, но продуктът получава едно решение от Ray Guardian.
За изображения Ray Guardian оценява пълната таксономия за безопасност: голота, сексуално съдържание, насилие, кърваво съдържание, оръжия, наркотици, алкохол, тютюнопушене, смущаващо съдържание, целувки / интимност, самонараняване, жестокост към животни и медицинско кърваво съдържание.
За видео Ray Guardian добавя времево измерение. Един кадър може да е двусмислен; един клип може да показва действие, намерение и контекст. Пътят за видео съчетава разпознаване на безопасността на ниво кадър с времево разбиране на ниво клип, така че крайният резултат да отразява какво се вижда на екрана и какво се случва във времето.
Това е системата, която подложихме на сравнителни тестове.
13-категориен сравнителен тест за визуална безопасност
Ray Guardian постигна 100.000% точност в отделения за тестване 13-категориен сравнителен тест на Ray Guardian за изображения: 17,435 известни етикета, 0 грешки.
Този сравнителен тест е най-близък до самата продуктова таксономия: същите определения на категориите, отделени за тестване примери и пълният набор от категории на Ray Guardian за визуална безопасност.
| Сравнителен тест | Обхват | Елементи | Точност | Прецизност | Пълнота | F1 |
|---|---|---|---|---|---|---|
| Отделен за тестване сравнителен тест на Ray Guardian на ниво изображение | Всички 13 категории на Ray Guardian | 17,435 labels | 100.000% | 100.000% | 100.000% | 100.000% |
Сравнителният тест включва категории, които често се припокриват в реални продукти: сексуално съдържание спрямо голота, кърваво съдържание спрямо медицинско кърваво съдържание, оръжия спрямо насилие и смущаващо съдържание спрямо обичаен неприятен контекст.
Пакет от сравнителни тестове за видео с публични етикети
Сравнителните тестове за видео се измерват спрямо етикетите, които всеки набор от данни действително предоставя. Набор от данни за целувка спрямо прегръдка осигурява данни за целувки / интимност. Набор от данни за насилие осигурява данни за насилие и смущаващи събития. Набор от данни с безопасни действия проверява дали обикновените клипове с действия се пропускат безпроблемно.
Това прави резултатите по-лесни за разбиране и по-трудни за неправилно използване: всеки ред отчита ефективността на Ray Guardian в рамките на собствения обхват от етикети на съответния набор от данни.
| Набор от данни | Обхват на Ray Guardian | Клипове | Точност | Прецизност | Пълнота | F1 |
|---|---|---|---|---|---|---|
| HMDB51 Целувка спрямо прегръдка | Целувки / Интимност | 182 | 98.901% | 99.020% | 99.020% | 99.020% |
| XD-Violence Публични етикети | Насилие / Смущаващо съдържание | 248 | 100.000% | 100.000% | 100.000% | 100.000% |
| UCF-Crime Съпоставени етикети | Насилие / Смущаващо съдържание | 79 | 100.000% | 100.000% | 100.000% | 100.000% |
| UCF-Crime Широка аномалия | Аномалия / Смущаващо съдържание | 109 | 100.000% | 100.000% | 100.000% | 100.000% |
| UCF101 Отделена извадка с безопасни действия | Защитен механизъм за безопасни действия | 330 | 100.000% | n/a | n/a | n/a |
Редът за UCF101 представлява защитен механизъм само с отрицателни примери: той измерва дали обикновени безопасни действия се блокират неправилно. В този тест Ray Guardian правилно разреши всички 330 клипа с безопасни действия.
Какво показват матриците на объркване
Точността е водещият показател. Матрицата на объркване показва структурата на решенията зад него.
Всяка матрица разграничава правилните разрешавания, фалшивите сигнали, пропуснатите опасни клипове и правилно маркираните опасни клипове. Това е важно, защото една система за безопасност трябва да защитава хората, без да прекъсва обикновени медии повече от необходимото.
Независими референтни набори от данни
Оценяваме Ray Guardian и чрез независими публични и ограничени референтни набори от данни. Тези набори от данни са полезни, защото етикетите им са създадени от други екипи, за други цели, и невинаги съответстват напълно на категориите на Ray Guardian.
Таблицата по-долу отчита всеки резултат на нивото на категорията, което наборът от данни може да поддържа. Когато даден набор от данни тества обекти, свързани с алкохол, отчитаме поведението за алкохол. Когато тества медицински рани, отчитаме поведението за медицинско кърваво съдържание или смущаващо съдържание.
| Референтен набор от данни | Обхват на Ray Guardian | Елементи | Точност | Пълнота | Бележки |
|---|---|---|---|---|---|
| Тестов дял на HoliSafe-Bench | Съпоставени категории за безопасност на изображения | 32,248 labels | 94.266% | 75.779% | Независим сравнителен тест за безопасност с ограничен достъп |
| Обучителен дял на UnsafeBench | Съпоставени категории за безопасност на изображения | 40,545 labels | 89.893% | 74.482% | Независим сравнителен тест за безопасност с ограничен достъп |
| Тестов дял на SurgWound | Медицинско кърваво съдържание | 137 images | 86.861% | 100.000% | Проверка на чувствителността към медицински рани |
| Тестов дял на SurgWound | Смущаващо съдържание | 137 images | 83.942% | 99.130% | Проверка на чувствителността към медицински рани |
| Lower Limb and Feet Wound Dataset | Медицинско кърваво съдържание | 5,443 images | 65.185% | 98.958% | Референтна проверка в областта на раните |
| HOD Benchmark Dataset | Алкохол | 10,631 images | 97.667% | 87.095% | Сравнителен тест за обекти за изследователска употреба |
| HOD Benchmark Dataset | Тютюнопушене | 10,631 images | 98.222% | 93.391% | Сравнителен тест за обекти за изследователска употреба |
| HOD Benchmark Dataset | Оръжия | 10,631 images | 85.053% | 68.659% | Сравнителен тест за обекти за изследователска употреба |
| Избрана подизвадка за валидиране от Open Images V7 | Оръжия | 460 rows | 81.957% | 87.234% | Референтна проверка на етикети за обекти |
Тези редове показват как се представя Ray Guardian извън сравнителния тест, спрямо който е разработен.
Защо числата се различават
По-ниският резултат върху публичен референтен набор не е противоречие. Той означава, че наборът от данни задава различен въпрос.
13-категорийният сравнителен тест на Ray Guardian проверява дали системата разпознава категориите за безопасност, използвани в Ray. Независимите референтни набори от данни проверяват какво се случва, когато външни етикети, външни методи за събиране и външни определения на категории се съпоставят с тази таксономия.
Резултатите могат да се променят по ясни причини:
- Различни определения на етикетите. Даден набор от данни може да обозначава обект, докато Ray Guardian оценява значението му за безопасността. Чаша за вино, бутилка, нож или клинична рана невинаги са опасни сами по себе си.
- Обобщени етикети. Някои публични етикети за безопасност обединяват няколко понятия в един широк етикет. Категориите на Ray Guardian са по-конкретни.
- Липса на контекст. Някои етикети зависят от надпис, звук, заобикаляща сцена или човешко намерение. Тези тестове измерват видимото съдържание.
- Промяна на домейна. Външните набори от данни включват различни изрязвания, разделителни способности, генерирани изображения, записи от видеонаблюдение, близки планове на обекти и медицински изображения.
- Различен дизайн на задачата. Сравнителните тестове за разпознаване на обекти са полезни стрес тестове, но разпознаването на обекти не е идентично с модерирането за визуална безопасност.
Съгласуваният сравнителен тест показва ефективността спрямо продуктовата таксономия на Ray Guardian. Референтните набори от данни показват как тази таксономия се пренася към по-нееднородни външни данни.
Как да четете сравнителния тест
Тълкувайте всяко число на нивото на етикетите, които стоят зад него.
- 13-категорийният резултат измерва пълната таксономия на Ray Guardian за безопасност на ниво изображение.
- Редовете за видео измерват Ray Guardian спрямо публичните видеоетикети, налични във всеки набор от данни.
- Независимите референтни редове измерват преноса към външни системи от етикети, а не заместват сравнителния тест за продуктовата таксономия.
Ray Guardian вече е унифицираният слой на Ray за визуална безопасност: една система за изображения и клипове, създадена да открива чувствително съдържание и да поддържа решенията стабилни при преминаването на медията от кадър към кадър.
Изходни набори от данни
Пакетът от сравнителни тестове цитира източници на набори от данни, включително HMDB51 чрез FiftyOne, XD-Violence, UCF-Crime, UCF101 чрез FiftyOne, HoliSafe-Bench, UnsafeBench, Open Images V7, SurgWound и HOD Benchmark Dataset.

