Сейчас воспроизводится · Бенчмарки
Представляем Ray Guardian: визуальная безопасность изображений и видео
Ray Guardian — единая система визуальной безопасности Ray, протестированная по 13 категориям безопасности на уровне изображений и видеодатасетах с общедоступной разметкой.
Представляем Ray Guardian
Ray Guardian — система визуальной безопасности Ray для изображений и видео. Она проверяет визуальные медиа на наличие чувствительного контента и возвращает сигналы по категориям, которые Ray может использовать для воспроизведения, создания контента, модерации и семейных настроек.
Главное можно сформулировать просто: Ray Guardian — это единая система. Статические изображения и видеоклипы поступают по разным каналам обработки медиа, но продукт получает единое решение Ray Guardian.
Для изображений Ray Guardian оценивает полную таксономию безопасности: обнажённость, сексуальный контент, насилие, кровавый контент, оружие, наркотики, алкоголь, курение, тревожащий контент, поцелуи / интимная близость, самоповреждение, жестокое обращение с животными и медицинский кровавый контент.
Для видео Ray Guardian добавляет временное измерение. Отдельный кадр может быть неоднозначным; клип может показывать действие, намерение и контекст. Канал обработки видео объединяет распознавание безопасности на уровне кадров с пониманием временной последовательности на уровне клипа, чтобы итоговый результат отражал как то, что появляется на экране, так и то, что происходит с течением времени.
Именно эту систему мы протестировали.
Бенчмарк визуальной безопасности по 13 категориям
Ray Guardian достигла точности 100.000% на отложенном бенчмарке изображений Ray Guardian по 13 категориям: 17,435 известных меток, 0 ошибок.
Этот бенчмарк наиболее близок к самой таксономии продукта: те же определения категорий, отложенные примеры и полный набор категорий визуальной безопасности Ray Guardian.
| Бенчмарк | Охват | Элементы | Точность | Прецизионность | Полнота | F1 |
|---|---|---|---|---|---|---|
| Отложенный бенчмарк Ray Guardian на уровне изображений | Все 13 категорий Ray Guardian | 17,435 меток | 100.000% | 100.000% | 100.000% | 100.000% |
Бенчмарк включает категории, которые в реальных продуктах часто пересекаются: сексуальный контент и обнажённость, кровавый контент и медицинский кровавый контент, оружие и насилие, а также тревожащий контент и обычный неприятный контекст.
Набор видеобенчмарков с общедоступной разметкой
Видеобенчмарки оцениваются по тем меткам, которые фактически предоставляет каждый датасет. Датасет с поцелуями и объятиями предоставляет данные для оценки поцелуев / интимной близости. Датасет с насилием предоставляет данные для оценки насилия и тревожащих событий. Датасет с безопасными действиями проверяет, пропускаются ли обычные клипы с действиями без ошибочной блокировки.
Благодаря этому результаты легче интерпретировать и сложнее использовать некорректно: каждая строка показывает результат Ray Guardian в пределах исходной области меток соответствующего датасета.
| Датасет | Область оценки Ray Guardian | Клипы | Точность | Прецизионность | Полнота | F1 |
|---|---|---|---|---|---|---|
| HMDB51 Kiss vs Hug | Поцелуи / интимная близость | 182 | 98.901% | 99.020% | 99.020% | 99.020% |
| XD-Violence Public Labels | Насилие / тревожащий контент | 248 | 100.000% | 100.000% | 100.000% | 100.000% |
| UCF-Crime Mapped Labels | Насилие / тревожащий контент | 79 | 100.000% | 100.000% | 100.000% | 100.000% |
| UCF-Crime Broad Anomaly | Аномалия / тревожащий контент | 109 | 100.000% | 100.000% | 100.000% | 100.000% |
| UCF101 Safe-Action Holdout | Контроль безопасных действий | 330 | 100.000% | n/a | n/a | n/a |
Строка UCF101 представляет собой контроль только на отрицательных примерах: он измеряет, блокируются ли обычные безопасные действия по ошибке. В этом тесте Ray Guardian корректно разрешила все 330 клипов с безопасными действиями.
Что показывают матрицы ошибок
Точность — главный показатель. Матрица ошибок показывает структуру решений, стоящих за ним.
Каждая матрица разделяет верно разрешённые клипы, ложные срабатывания, пропущенные небезопасные клипы и верно отмеченные небезопасные клипы. Это важно, поскольку система безопасности должна защищать людей, не прерывая просмотр обычных медиа чаще, чем необходимо.
Независимые эталонные датасеты
Мы также оцениваем Ray Guardian на независимых общедоступных и имеющих ограниченный доступ эталонных датасетах. Эти датасеты полезны, поскольку их метки создавались другими командами для других целей и не всегда полностью соответствуют категориям Ray Guardian.
В таблице ниже каждый результат представлен на том уровне категорий, который поддерживает соответствующий датасет. Когда датасет проверяет объекты, связанные с алкоголем, мы сообщаем результат для категории алкоголя. Когда он проверяет медицинские раны, мы сообщаем результат для медицинского кровавого контента или тревожащего контента.
| Эталонный датасет | Область оценки Ray Guardian | Элементы | Точность | Полнота | Примечания |
|---|---|---|---|---|---|
| HoliSafe-Bench test split | Сопоставленные категории безопасности изображений | 32,248 меток | 94.266% | 75.779% | Независимый бенчмарк безопасности с ограниченным доступом |
| UnsafeBench train split | Сопоставленные категории безопасности изображений | 40,545 меток | 89.893% | 74.482% | Независимый бенчмарк безопасности с ограниченным доступом |
| SurgWound test split | Медицинский кровавый контент | 137 изображений | 86.861% | 100.000% | Проверка чувствительности к медицинским ранам |
| SurgWound test split | Тревожащий контент | 137 изображений | 83.942% | 99.130% | Проверка чувствительности к медицинским ранам |
| Lower Limb and Feet Wound Dataset | Медицинский кровавый контент | 5,443 изображений | 65.185% | 98.958% | Эталонная проверка в области ран |
| HOD Benchmark Dataset | Алкоголь | 10,631 изображений | 97.667% | 87.095% | Объектный бенчмарк для исследовательского использования |
| HOD Benchmark Dataset | Курение | 10,631 изображений | 98.222% | 93.391% | Объектный бенчмарк для исследовательского использования |
| HOD Benchmark Dataset | Оружие | 10,631 изображений | 85.053% | 68.659% | Объектный бенчмарк для исследовательского использования |
| Open Images V7 selected validation subset | Оружие | 460 строк | 81.957% | 87.234% | Эталонная проверка объектных меток |
Эти строки показывают, как Ray Guardian работает за пределами бенчмарка, под который она была создана.
Почему показатели различаются
Более низкий результат на общедоступном эталонном датасете не является противоречием. Он означает, что датасет ставит другой вопрос.
Бенчмарк Ray Guardian по 13 категориям проверяет, распознаёт ли система категории безопасности, используемые в Ray. Независимые эталонные датасеты проверяют, что происходит, когда внешние метки, внешние методы сбора и внешние определения категорий сопоставляются с этой таксономией.
Показатели могут меняться по понятным причинам:
- Разные определения меток. Датасет может размечать объект, тогда как Ray Guardian оценивает его значение с точки зрения безопасности. Бокал вина, бутылка, нож или клиническая рана сами по себе не всегда небезопасны.
- Грубые метки. Некоторые общедоступные метки безопасности объединяют несколько понятий в одну широкую категорию. Категории Ray Guardian более конкретны.
- Недостаток контекста. Некоторые метки зависят от подписи, аудио, окружающей сцены или намерения человека. Эти тесты оценивают видимый контент.
- Сдвиг домена. Внешние датасеты включают другие варианты кадрирования, разрешения, сгенерированные изображения, записи с камер наблюдения, крупные планы объектов и медицинские изображения.
- Разный дизайн задач. Бенчмарки распознавания объектов полезны для стресс-тестирования, но распознавание объектов не тождественно модерации визуальной безопасности.
Согласованный бенчмарк показывает результат на продуктовой таксономии Ray Guardian. Эталонные датасеты показывают, как эта таксономия переносится на более неоднородные внешние данные.
Как интерпретировать бенчмарк
Интерпретируйте каждый показатель на уровне лежащих в его основе меток.
- Результат по 13 категориям измеряет полную таксономию безопасности Ray Guardian на уровне изображений.
- Строки видео измеряют работу Ray Guardian на общедоступных видеометках, доступных в каждом датасете.
- Строки независимых эталонных датасетов измеряют перенос на внешние системы меток, а не заменяют бенчмарк продуктовой таксономии.
Ray Guardian теперь является единым уровнем визуальной безопасности Ray: одной системой для изображений и клипов, созданной для обнаружения чувствительного контента и сохранения стабильности решений при переходе медиа от кадра к кадру.
Исходные датасеты
Набор бенчмарков ссылается на источники датасетов, включая HMDB51 via FiftyOne, XD-Violence, UCF-Crime, UCF101 via FiftyOne, HoliSafe-Bench, UnsafeBench, Open Images V7, SurgWound и HOD Benchmark Dataset.

