正在播放 · 基准测试
发布 Ray Guardian:面向图像和视频的视觉安全系统
Ray Guardian 是 Ray 的统一视觉安全系统,已在 13 个图像级安全类别和公开标注的视频数据集上进行基准测试。
Ray Guardian 简介
Ray Guardian 是 Ray 面向图像和视频的视觉安全系统。它审查视觉媒体中的敏感内容,并返回类别信号,供 Ray 用于播放、创作、审核和家庭设置。
关键之处很简单:Ray Guardian 是一个统一系统。静态图像和视频片段通过不同的媒体路径进入,但产品接收的是一个统一的 Guardian 判定。
对于图像,Ray Guardian 会评估完整的安全分类体系:裸露、性内容、暴力、血腥内容、武器、毒品、酒精、吸烟、令人不适的内容、接吻/亲密行为、自残、虐待动物和医疗血腥内容。
对于视频,Ray Guardian 还会考虑时间维度。单帧画面可能存在歧义;视频片段则可以呈现动作、意图和上下文。视频路径将帧级安全识别与片段级时序理解相结合,使最终结果能够反映屏幕上出现的内容及其随时间发生的变化。
这就是我们进行基准测试的系统。
13 类视觉安全基准测试
Ray Guardian 在 Ray Guardian 13 类留出图像基准测试中达到 100.000% 准确率:17,435 个已知标签,0 个错误。
该基准测试最贴近产品自身的分类体系:采用相同的类别定义、留出样本以及完整的 Ray Guardian 视觉安全类别集合。
| 基准测试 | 范围 | 项目数 | 准确率 | 精确率 | 召回率 | F1 |
|---|---|---|---|---|---|---|
| Ray Guardian 留出图像级基准测试 | 全部 13 个 Ray Guardian 类别 | 17,435 个标签 | 100.000% | 100.000% | 100.000% | 100.000% |
该基准测试包含在实际产品中经常重叠的类别:性内容与裸露、血腥内容与医疗血腥内容、武器与暴力,以及令人不适的内容与一般令人不愉快的情境。
公开标注的视频基准测试套件
视频基准测试依据每个数据集实际提供的标签进行衡量。区分接吻与拥抱的数据集可为接吻/亲密行为提供证据。暴力数据集可为暴力和令人不适事件提供证据。安全动作数据集则测试普通动作片段能否顺利通过。
这使结果更易于解读,也更难被误用:每一行都报告 Ray Guardian 在相应数据集原生标签范围内的表现。
| 数据集 | Ray Guardian 范围 | 片段数 | 准确率 | 精确率 | 召回率 | F1 |
|---|---|---|---|---|---|---|
| HMDB51 接吻与拥抱 | 接吻/亲密行为 | 182 | 98.901% | 99.020% | 99.020% | 99.020% |
| XD-Violence 公开标签 | 暴力/令人不适的内容 | 248 | 100.000% | 100.000% | 100.000% | 100.000% |
| UCF-Crime 映射标签 | 暴力/令人不适的内容 | 79 | 100.000% | 100.000% | 100.000% | 100.000% |
| UCF-Crime 广义异常 | 异常/令人不适的内容 | 109 | 100.000% | 100.000% | 100.000% | 100.000% |
| UCF101 安全动作留出集 | 安全动作防护检查 | 330 | 100.000% | 不适用 | 不适用 | 不适用 |
UCF101 这一行是仅含负样本的防护检查:它衡量普通安全动作是否会被错误拦截。在该测试中,Ray Guardian 正确放行了全部 330 个安全动作片段。
混淆矩阵揭示了什么
准确率是最主要的指标。混淆矩阵则展示了这些判定背后的分布形态。
每个矩阵分别呈现正确放行、误报、漏检的不安全片段,以及正确标记的不安全片段。这一点很重要,因为安全系统既要保护用户,也要避免对普通媒体造成不必要的干扰。
独立参考数据集
我们还使用独立的公开和受限访问参考数据集评估 Ray Guardian。这些数据集很有价值,因为其标签由其他团队针对其他目标编写,并不总能与 Ray Guardian 的类别完全对应。
下表在每个数据集所能支持的类别层级上报告结果。当数据集测试酒精相关物体时,我们报告酒精内容表现。当它测试医疗伤口时,我们报告医疗血腥内容或令人不适内容的表现。
| 参考数据集 | Ray Guardian 范围 | 项目数 | 准确率 | 召回率 | 备注 |
|---|---|---|---|---|---|
| HoliSafe-Bench 测试集划分 | 映射后的图像安全类别 | 32,248 个标签 | 94.266% | 75.779% | 独立的受限访问安全基准测试 |
| UnsafeBench 训练集划分 | 映射后的图像安全类别 | 40,545 个标签 | 89.893% | 74.482% | 独立的受限访问安全基准测试 |
| SurgWound 测试集划分 | 医疗血腥内容 | 137 张图像 | 86.861% | 100.000% | 医疗伤口敏感度检查 |
| SurgWound 测试集划分 | 令人不适的内容 | 137 张图像 | 83.942% | 99.130% | 医疗伤口敏感度检查 |
| Lower Limb and Feet Wound Dataset | 医疗血腥内容 | 5,443 张图像 | 65.185% | 98.958% | 伤口领域参考检查 |
| HOD Benchmark Dataset | 酒精 | 10,631 张图像 | 97.667% | 87.095% | 研究用途的物体基准测试 |
| HOD Benchmark Dataset | 吸烟 | 10,631 张图像 | 98.222% | 93.391% | 研究用途的物体基准测试 |
| HOD Benchmark Dataset | 武器 | 10,631 张图像 | 85.053% | 68.659% | 研究用途的物体基准测试 |
| Open Images V7 选定验证子集 | 武器 | 460 行 | 81.957% | 87.234% | 物体标签参考检查 |
这些行展示了 Ray Guardian 在其开发所依据的基准测试之外的表现。
为什么数字会有所不同
公开参考测试中的较低分数并不构成矛盾。这意味着数据集提出的是另一个问题。
13 类 Ray Guardian 基准测试评估系统能否识别 Ray 中使用的安全类别。独立参考数据集则评估将外部标签、外部收集方法和外部类别定义映射到该分类体系后会发生什么。
分数可能因以下直接原因而变化:
- 标签定义不同。 数据集可能标注的是物体,而 Ray Guardian 判断的是安全含义。酒杯、酒瓶、刀具或临床伤口本身并不一定不安全。
- 标签粒度较粗。 一些公开安全标签会将多个概念合并为一个宽泛标签。Ray Guardian 的类别则更具体。
- 上下文缺失。 某些标签依赖字幕、音频、周围场景或人的意图。这些测试衡量的是可见内容。
- 领域偏移。 外部数据集包含不同的裁剪方式、分辨率、生成图像、监控录像、物体特写和医疗影像。
- 任务设计不同。 物体识别基准测试是有用的压力测试,但物体识别并不等同于视觉安全审核。
对齐的基准测试展示了 Ray Guardian 在其产品分类体系上的表现。参考数据集则展示了该分类体系迁移到更复杂的外部数据时的表现。
如何解读基准测试
应根据每个数字背后的标签层级来解读它。
- 13 类结果衡量完整的 Ray Guardian 图像级安全分类体系。
- 视频各行衡量 Ray Guardian 在每个数据集可用的公开视频标签上的表现。
- 独立参考数据集各行衡量向外部标签体系的迁移效果,不能替代产品分类体系基准测试。
Ray Guardian 现已成为 Ray 的统一视觉安全层:这是一个同时面向图像和视频片段的系统,旨在识别敏感内容,并在媒体逐帧变化时保持判定稳定。
来源数据集
该基准测试套件引用的数据集来源包括 通过 FiftyOne 获取的 HMDB51、XD-Violence、UCF-Crime、通过 FiftyOne 获取的 UCF101、HoliSafe-Bench、UnsafeBench、Open Images V7、SurgWound 和 HOD Benchmark Dataset。

