현재 재생 중 · 벤치마크
Ray Guardian 발표: 이미지와 동영상을 위한 시각적 안전
Ray Guardian은 Ray의 통합 시각적 안전 시스템으로, 13개의 이미지 수준 안전 범주와 공개 라벨 동영상 데이터세트에서 벤치마크되었습니다.
Ray Guardian 소개
Ray Guardian은 이미지와 동영상을 위한 Ray의 시각적 안전 시스템입니다. 시각 미디어에서 민감한 콘텐츠를 검토하고, Ray가 재생, 제작, 조정, 가족 설정에 활용할 수 있는 범주 신호를 반환합니다.
핵심은 간단합니다. Ray Guardian은 하나의 시스템입니다. 정지 이미지와 동영상 클립은 서로 다른 미디어 경로를 통해 입력되지만, 제품에는 하나의 Guardian 판정이 전달됩니다.
이미지의 경우 Ray Guardian은 전체 안전 분류 체계인 나체 노출, 성적 콘텐츠, 폭력, 유혈, 무기, 약물, 음주, 흡연, 불쾌감을 유발하는 콘텐츠, 키스/친밀 행위, 자해, 동물 학대, 의료 유혈을 평가합니다.
동영상의 경우 Ray Guardian은 시간적 요소를 추가합니다. 단일 프레임은 모호할 수 있지만, 클립은 행동, 의도, 맥락을 보여줄 수 있습니다. 동영상 경로는 프레임 수준 안전 인식과 클립 수준의 시간적 이해를 결합하여, 최종 결과가 화면에 나타나는 내용과 시간의 흐름에 따라 벌어지는 상황을 모두 반영하도록 합니다.
이 시스템을 벤치마크했습니다.
13개 범주 시각적 안전 벤치마크
Ray Guardian은 Ray Guardian의 13개 범주 홀드아웃 이미지 벤치마크에서 100.000%의 정확도를 달성했습니다. 결과는 알려진 라벨 17,435개, 오류 0개입니다.
이 벤치마크는 제품 분류 체계 자체에 가장 가깝습니다. 동일한 범주 정의와 홀드아웃 예시, 전체 Ray Guardian 시각적 안전 범주를 사용합니다.
| 벤치마크 | 범위 | 항목 | 정확도 | 정밀도 | 재현율 | F1 |
|---|---|---|---|---|---|---|
| Ray Guardian 홀드아웃 이미지 수준 벤치마크 | Ray Guardian의 전체 13개 범주 | 라벨 17,435개 | 100.000% | 100.000% | 100.000% | 100.000% |
이 벤치마크에는 실제 제품에서 자주 중첩되는 범주가 포함됩니다. 성적 콘텐츠와 나체 노출, 유혈과 의료 유혈, 무기와 폭력, 불쾌감을 유발하는 콘텐츠와 일반적으로 불쾌한 맥락 등이 이에 해당합니다.
공개 라벨 동영상 벤치마크 모음
동영상 벤치마크는 각 데이터세트가 실제로 제공하는 라벨을 기준으로 측정됩니다. 키스와 포옹을 구분하는 데이터세트는 키스/친밀 행위의 증거를 제공합니다. 폭력 데이터세트는 폭력 및 불쾌감을 유발하는 사건의 증거를 제공합니다. 안전 행동 데이터세트는 일상적인 행동 클립이 문제없이 허용되는지 테스트합니다.
따라서 결과를 더 쉽게 해석하고 오용하기 어렵습니다. 각 행은 해당 데이터세트의 고유한 라벨 범위에서 측정한 Ray Guardian의 성능을 보고합니다.
| 데이터세트 | Ray Guardian 범위 | 클립 | 정확도 | 정밀도 | 재현율 | F1 |
|---|---|---|---|---|---|---|
| HMDB51 Kiss vs Hug | 키스/친밀 행위 | 182 | 98.901% | 99.020% | 99.020% | 99.020% |
| XD-Violence Public Labels | 폭력/불쾌감을 유발하는 콘텐츠 | 248 | 100.000% | 100.000% | 100.000% | 100.000% |
| UCF-Crime Mapped Labels | 폭력/불쾌감을 유발하는 콘텐츠 | 79 | 100.000% | 100.000% | 100.000% | 100.000% |
| UCF-Crime Broad Anomaly | 이상 상황/불쾌감을 유발하는 콘텐츠 | 109 | 100.000% | 100.000% | 100.000% | 100.000% |
| UCF101 Safe-Action Holdout | 안전 행동 가드레일 | 330 | 100.000% | 해당 없음 | 해당 없음 | 해당 없음 |
UCF101 행은 음성 사례만으로 구성된 가드레일입니다. 일상적인 안전 행동이 잘못 차단되는지를 측정합니다. 이 테스트에서 Ray Guardian은 안전 행동 클립 330개를 모두 올바르게 허용했습니다.
혼동 행렬이 보여주는 내용
정확도는 대표 지표입니다. 혼동 행렬은 그 이면에 있는 판정의 양상을 보여줍니다.
각 행렬은 올바른 허용, 오탐, 놓친 안전하지 않은 클립, 올바르게 표시된 안전하지 않은 클립을 구분합니다. 안전 시스템은 사람을 보호하는 동시에 일상적인 미디어 이용을 필요 이상으로 방해하지 않아야 하므로 이러한 구분은 중요합니다.
독립 참조 데이터세트
또한 독립적인 공개 및 접근 제한 참조 데이터세트에서 Ray Guardian을 평가합니다. 이러한 데이터세트의 라벨은 다른 팀이 다른 목표로 작성했으며 Ray Guardian 범주와 항상 완벽하게 일치하지 않으므로 유용합니다.
아래 표는 각 데이터세트가 지원할 수 있는 범주 수준에서 결과를 보고합니다. 데이터세트가 음주 관련 객체를 테스트하면 음주 행동을 보고합니다. 의료 상처를 테스트하면 의료 유혈 또는 불쾌감을 유발하는 콘텐츠에 관한 동작을 보고합니다.
| 참조 데이터세트 | Ray Guardian 범위 | 항목 | 정확도 | 재현율 | 참고 |
|---|---|---|---|---|---|
| HoliSafe-Bench test split | 매핑된 이미지 안전 범주 | 라벨 32,248개 | 94.266% | 75.779% | 독립적인 접근 제한 안전 벤치마크 |
| UnsafeBench train split | 매핑된 이미지 안전 범주 | 라벨 40,545개 | 89.893% | 74.482% | 독립적인 접근 제한 안전 벤치마크 |
| SurgWound test split | 의료 유혈 | 이미지 137개 | 86.861% | 100.000% | 의료 상처 민감도 점검 |
| SurgWound test split | 불쾌감을 유발하는 콘텐츠 | 이미지 137개 | 83.942% | 99.130% | 의료 상처 민감도 점검 |
| Lower Limb and Feet Wound Dataset | 의료 유혈 | 이미지 5,443개 | 65.185% | 98.958% | 상처 도메인 참조 점검 |
| HOD Benchmark Dataset | 음주 | 이미지 10,631개 | 97.667% | 87.095% | 연구용 객체 벤치마크 |
| HOD Benchmark Dataset | 흡연 | 이미지 10,631개 | 98.222% | 93.391% | 연구용 객체 벤치마크 |
| HOD Benchmark Dataset | 무기 | 이미지 10,631개 | 85.053% | 68.659% | 연구용 객체 벤치마크 |
| Open Images V7 selected validation subset | 무기 | 행 460개 | 81.957% | 87.234% | 객체 라벨 참조 점검 |
이 행들은 Ray Guardian이 개발 기준으로 삼은 벤치마크 외부에서 어떻게 작동하는지 보여줍니다.
수치가 다른 이유
공개 참조 점수가 더 낮다고 해서 결과가 모순되는 것은 아닙니다. 이는 데이터세트가 서로 다른 질문을 하고 있다는 뜻입니다.
13개 범주 Ray Guardian 벤치마크는 시스템이 Ray에서 사용하는 안전 범주를 인식하는지 묻습니다. 독립 참조 데이터세트는 외부 라벨, 외부 수집 방법, 외부 범주 정의를 해당 분류 체계에 매핑했을 때 어떤 결과가 나오는지 묻습니다.
점수가 달라지는 데에는 명확한 이유가 있을 수 있습니다.
- 서로 다른 라벨 정의. 데이터세트는 객체에 라벨을 지정하지만 Ray Guardian은 안전상의 의미를 판단할 수 있습니다. 와인잔, 병, 칼 또는 임상적 상처는 그 자체만으로 항상 안전하지 않은 것은 아닙니다.
- 포괄적인 라벨. 일부 공개 안전 라벨은 여러 개념을 하나의 넓은 라벨로 결합합니다. Ray Guardian의 범주는 더 구체적입니다.
- 맥락의 공백. 일부 라벨은 캡션, 오디오, 주변 장면 또는 사람의 의도에 따라 달라집니다. 이 테스트에서는 눈에 보이는 콘텐츠를 측정합니다.
- 도메인 변화. 외부 데이터세트에는 서로 다른 크롭, 해상도, 생성 이미지, 감시 영상, 객체 클로즈업, 의료 이미지가 포함됩니다.
- 서로 다른 과제 설계. 객체 인식 벤치마크는 유용한 스트레스 테스트이지만, 객체 인식은 시각적 안전 조정과 동일하지 않습니다.
정렬된 벤치마크는 Ray Guardian의 제품 분류 체계에 대한 성능을 보여줍니다. 참조 데이터세트는 해당 분류 체계가 더 복잡한 외부 데이터에 어떻게 전이되는지 보여줍니다.
벤치마크를 해석하는 방법
각 수치는 그 기반이 되는 라벨 수준에서 해석해야 합니다.
- 13개 범주 결과는 전체 Ray Guardian 이미지 수준 안전 분류 체계를 측정합니다.
- 동영상 행은 각 데이터세트에서 제공하는 공개 동영상 라벨을 기준으로 Ray Guardian을 측정합니다.
- 독립 참조 행은 외부 라벨 시스템으로의 전이를 측정하며, 제품 분류 체계 벤치마크를 대체하지 않습니다.
이제 Ray Guardian은 이미지와 클립을 위한 하나의 시스템인 Ray의 통합 시각적 안전 계층입니다. 민감한 콘텐츠를 감지하고 미디어가 프레임 사이를 이동하는 동안에도 판정을 안정적으로 유지하도록 설계되었습니다.
출처 데이터세트
벤치마크 모음은 FiftyOne을 통한 HMDB51, XD-Violence, UCF-Crime, FiftyOne을 통한 UCF101, HoliSafe-Bench, UnsafeBench, Open Images V7, SurgWound, HOD Benchmark Dataset 등의 데이터세트 출처를 인용합니다.

