Skip to main content
媒体库

正在播放 · 基准测试

发布 Ray Guardian:面向图像和视频的视觉安全系统

Ray Guardian 是 Ray 的统一视觉安全系统,已在 13 个图像级安全类别和公开标注的视频数据集上进行基准测试。

Ray Team2026年8月4日3 min read

Ray Guardian 简介

Ray Guardian 是 Ray 面向图像和视频的视觉安全系统。它审查视觉媒体中的敏感内容,并返回类别信号,供 Ray 用于播放、创作、审核和家庭设置。

关键之处很简单:Ray Guardian 是一个统一系统。静态图像和视频片段通过不同的媒体路径进入,但产品接收的是一个统一的 Guardian 判定。

对于图像,Ray Guardian 会评估完整的安全分类体系:裸露、性内容、暴力、血腥内容、武器、毒品、酒精、吸烟、令人不适的内容、接吻/亲密行为、自残、虐待动物和医疗血腥内容。

对于视频,Ray Guardian 还会考虑时间维度。单帧画面可能存在歧义;视频片段则可以呈现动作、意图和上下文。视频路径将帧级安全识别与片段级时序理解相结合,使最终结果能够反映屏幕上出现的内容及其随时间发生的变化。

这就是我们进行基准测试的系统。

13 类视觉安全基准测试

Ray Guardian 在 Ray Guardian 13 类留出图像基准测试中达到 100.000% 准确率17,435 个已知标签,0 个错误

该基准测试最贴近产品自身的分类体系:采用相同的类别定义、留出样本以及完整的 Ray Guardian 视觉安全类别集合。

基准测试范围项目数准确率精确率召回率F1
Ray Guardian 留出图像级基准测试全部 13 个 Ray Guardian 类别17,435 个标签100.000%100.000%100.000%100.000%

该基准测试包含在实际产品中经常重叠的类别:性内容与裸露、血腥内容与医疗血腥内容、武器与暴力,以及令人不适的内容与一般令人不愉快的情境。

公开标注的视频基准测试套件

视频基准测试依据每个数据集实际提供的标签进行衡量。区分接吻与拥抱的数据集可为接吻/亲密行为提供证据。暴力数据集可为暴力和令人不适事件提供证据。安全动作数据集则测试普通动作片段能否顺利通过。

这使结果更易于解读,也更难被误用:每一行都报告 Ray Guardian 在相应数据集原生标签范围内的表现。

数据集Ray Guardian 范围片段数准确率精确率召回率F1
HMDB51 接吻与拥抱接吻/亲密行为18298.901%99.020%99.020%99.020%
XD-Violence 公开标签暴力/令人不适的内容248100.000%100.000%100.000%100.000%
UCF-Crime 映射标签暴力/令人不适的内容79100.000%100.000%100.000%100.000%
UCF-Crime 广义异常异常/令人不适的内容109100.000%100.000%100.000%100.000%
UCF101 安全动作留出集安全动作防护检查330100.000%不适用不适用不适用

UCF101 这一行是仅含负样本的防护检查:它衡量普通安全动作是否会被错误拦截。在该测试中,Ray Guardian 正确放行了全部 330 个安全动作片段。

混淆矩阵揭示了什么

准确率是最主要的指标。混淆矩阵则展示了这些判定背后的分布形态。

每个矩阵分别呈现正确放行、误报、漏检的不安全片段,以及正确标记的不安全片段。这一点很重要,因为安全系统既要保护用户,也要避免对普通媒体造成不必要的干扰。

独立参考数据集

我们还使用独立的公开和受限访问参考数据集评估 Ray Guardian。这些数据集很有价值,因为其标签由其他团队针对其他目标编写,并不总能与 Ray Guardian 的类别完全对应。

下表在每个数据集所能支持的类别层级上报告结果。当数据集测试酒精相关物体时,我们报告酒精内容表现。当它测试医疗伤口时,我们报告医疗血腥内容或令人不适内容的表现。

参考数据集Ray Guardian 范围项目数准确率召回率备注
HoliSafe-Bench 测试集划分映射后的图像安全类别32,248 个标签94.266%75.779%独立的受限访问安全基准测试
UnsafeBench 训练集划分映射后的图像安全类别40,545 个标签89.893%74.482%独立的受限访问安全基准测试
SurgWound 测试集划分医疗血腥内容137 张图像86.861%100.000%医疗伤口敏感度检查
SurgWound 测试集划分令人不适的内容137 张图像83.942%99.130%医疗伤口敏感度检查
Lower Limb and Feet Wound Dataset医疗血腥内容5,443 张图像65.185%98.958%伤口领域参考检查
HOD Benchmark Dataset酒精10,631 张图像97.667%87.095%研究用途的物体基准测试
HOD Benchmark Dataset吸烟10,631 张图像98.222%93.391%研究用途的物体基准测试
HOD Benchmark Dataset武器10,631 张图像85.053%68.659%研究用途的物体基准测试
Open Images V7 选定验证子集武器460 行81.957%87.234%物体标签参考检查

这些行展示了 Ray Guardian 在其开发所依据的基准测试之外的表现。

为什么数字会有所不同

公开参考测试中的较低分数并不构成矛盾。这意味着数据集提出的是另一个问题。

13 类 Ray Guardian 基准测试评估系统能否识别 Ray 中使用的安全类别。独立参考数据集则评估将外部标签、外部收集方法和外部类别定义映射到该分类体系后会发生什么。

分数可能因以下直接原因而变化:

  • 标签定义不同。 数据集可能标注的是物体,而 Ray Guardian 判断的是安全含义。酒杯、酒瓶、刀具或临床伤口本身并不一定不安全。
  • 标签粒度较粗。 一些公开安全标签会将多个概念合并为一个宽泛标签。Ray Guardian 的类别则更具体。
  • 上下文缺失。 某些标签依赖字幕、音频、周围场景或人的意图。这些测试衡量的是可见内容。
  • 领域偏移。 外部数据集包含不同的裁剪方式、分辨率、生成图像、监控录像、物体特写和医疗影像。
  • 任务设计不同。 物体识别基准测试是有用的压力测试,但物体识别并不等同于视觉安全审核。

对齐的基准测试展示了 Ray Guardian 在其产品分类体系上的表现。参考数据集则展示了该分类体系迁移到更复杂的外部数据时的表现。

如何解读基准测试

应根据每个数字背后的标签层级来解读它。

  • 13 类结果衡量完整的 Ray Guardian 图像级安全分类体系。
  • 视频各行衡量 Ray Guardian 在每个数据集可用的公开视频标签上的表现。
  • 独立参考数据集各行衡量向外部标签体系的迁移效果,不能替代产品分类体系基准测试。

Ray Guardian 现已成为 Ray 的统一视觉安全层:这是一个同时面向图像和视频片段的系统,旨在识别敏感内容,并在媒体逐帧变化时保持判定稳定。

来源数据集

该基准测试套件引用的数据集来源包括 通过 FiftyOne 获取的 HMDB51XD-ViolenceUCF-Crime通过 FiftyOne 获取的 UCF101HoliSafe-BenchUnsafeBenchOpen Images V7SurgWoundHOD Benchmark Dataset

Subscribe to the Ray newsletter. Product updates, release notes, and customer news.

No spam. Just the Ray newsletter and important product updates.

接下来播放

查看媒体库
Ray Journal基准测试2026-08-04

发布 Ray Guardian:面向图像和视频的视觉安全系统

Ray Guardian 是 Ray 的统一视觉安全系统,已在 13 个图像级安全类别和公开标注的视频数据集上进行基准测试。

Ray Team2026-08-043 min read

Ray Guardian 简介

Ray Guardian 是 Ray 面向图像和视频的视觉安全系统。它审查视觉媒体中的敏感内容,并返回类别信号,供 Ray 用于播放、创作、审核和家庭设置。

关键之处很简单:Ray Guardian 是一个统一系统。静态图像和视频片段通过不同的媒体路径进入,但产品接收的是一个统一的 Guardian 判定。

对于图像,Ray Guardian 会评估完整的安全分类体系:裸露、性内容、暴力、血腥内容、武器、毒品、酒精、吸烟、令人不适的内容、接吻/亲密行为、自残、虐待动物和医疗血腥内容。

对于视频,Ray Guardian 还会考虑时间维度。单帧画面可能存在歧义;视频片段则可以呈现动作、意图和上下文。视频路径将帧级安全识别与片段级时序理解相结合,使最终结果能够反映屏幕上出现的内容及其随时间发生的变化。

这就是我们进行基准测试的系统。

13 类视觉安全基准测试

Ray Guardian 在 Ray Guardian 13 类留出图像基准测试中达到 100.000% 准确率17,435 个已知标签,0 个错误

该基准测试最贴近产品自身的分类体系:采用相同的类别定义、留出样本以及完整的 Ray Guardian 视觉安全类别集合。

基准测试范围项目数准确率精确率召回率F1
Ray Guardian 留出图像级基准测试全部 13 个 Ray Guardian 类别17,435 个标签100.000%100.000%100.000%100.000%

该基准测试包含在实际产品中经常重叠的类别:性内容与裸露、血腥内容与医疗血腥内容、武器与暴力,以及令人不适的内容与一般令人不愉快的情境。

公开标注的视频基准测试套件

视频基准测试依据每个数据集实际提供的标签进行衡量。区分接吻与拥抱的数据集可为接吻/亲密行为提供证据。暴力数据集可为暴力和令人不适事件提供证据。安全动作数据集则测试普通动作片段能否顺利通过。

这使结果更易于解读,也更难被误用:每一行都报告 Ray Guardian 在相应数据集原生标签范围内的表现。

数据集Ray Guardian 范围片段数准确率精确率召回率F1
HMDB51 接吻与拥抱接吻/亲密行为18298.901%99.020%99.020%99.020%
XD-Violence 公开标签暴力/令人不适的内容248100.000%100.000%100.000%100.000%
UCF-Crime 映射标签暴力/令人不适的内容79100.000%100.000%100.000%100.000%
UCF-Crime 广义异常异常/令人不适的内容109100.000%100.000%100.000%100.000%
UCF101 安全动作留出集安全动作防护检查330100.000%不适用不适用不适用

UCF101 这一行是仅含负样本的防护检查:它衡量普通安全动作是否会被错误拦截。在该测试中,Ray Guardian 正确放行了全部 330 个安全动作片段。

混淆矩阵揭示了什么

准确率是最主要的指标。混淆矩阵则展示了这些判定背后的分布形态。

每个矩阵分别呈现正确放行、误报、漏检的不安全片段,以及正确标记的不安全片段。这一点很重要,因为安全系统既要保护用户,也要避免对普通媒体造成不必要的干扰。

独立参考数据集

我们还使用独立的公开和受限访问参考数据集评估 Ray Guardian。这些数据集很有价值,因为其标签由其他团队针对其他目标编写,并不总能与 Ray Guardian 的类别完全对应。

下表在每个数据集所能支持的类别层级上报告结果。当数据集测试酒精相关物体时,我们报告酒精内容表现。当它测试医疗伤口时,我们报告医疗血腥内容或令人不适内容的表现。

参考数据集Ray Guardian 范围项目数准确率召回率备注
HoliSafe-Bench 测试集划分映射后的图像安全类别32,248 个标签94.266%75.779%独立的受限访问安全基准测试
UnsafeBench 训练集划分映射后的图像安全类别40,545 个标签89.893%74.482%独立的受限访问安全基准测试
SurgWound 测试集划分医疗血腥内容137 张图像86.861%100.000%医疗伤口敏感度检查
SurgWound 测试集划分令人不适的内容137 张图像83.942%99.130%医疗伤口敏感度检查
Lower Limb and Feet Wound Dataset医疗血腥内容5,443 张图像65.185%98.958%伤口领域参考检查
HOD Benchmark Dataset酒精10,631 张图像97.667%87.095%研究用途的物体基准测试
HOD Benchmark Dataset吸烟10,631 张图像98.222%93.391%研究用途的物体基准测试
HOD Benchmark Dataset武器10,631 张图像85.053%68.659%研究用途的物体基准测试
Open Images V7 选定验证子集武器460 行81.957%87.234%物体标签参考检查

这些行展示了 Ray Guardian 在其开发所依据的基准测试之外的表现。

为什么数字会有所不同

公开参考测试中的较低分数并不构成矛盾。这意味着数据集提出的是另一个问题。

13 类 Ray Guardian 基准测试评估系统能否识别 Ray 中使用的安全类别。独立参考数据集则评估将外部标签、外部收集方法和外部类别定义映射到该分类体系后会发生什么。

分数可能因以下直接原因而变化:

  • 标签定义不同。 数据集可能标注的是物体,而 Ray Guardian 判断的是安全含义。酒杯、酒瓶、刀具或临床伤口本身并不一定不安全。
  • 标签粒度较粗。 一些公开安全标签会将多个概念合并为一个宽泛标签。Ray Guardian 的类别则更具体。
  • 上下文缺失。 某些标签依赖字幕、音频、周围场景或人的意图。这些测试衡量的是可见内容。
  • 领域偏移。 外部数据集包含不同的裁剪方式、分辨率、生成图像、监控录像、物体特写和医疗影像。
  • 任务设计不同。 物体识别基准测试是有用的压力测试,但物体识别并不等同于视觉安全审核。

对齐的基准测试展示了 Ray Guardian 在其产品分类体系上的表现。参考数据集则展示了该分类体系迁移到更复杂的外部数据时的表现。

如何解读基准测试

应根据每个数字背后的标签层级来解读它。

  • 13 类结果衡量完整的 Ray Guardian 图像级安全分类体系。
  • 视频各行衡量 Ray Guardian 在每个数据集可用的公开视频标签上的表现。
  • 独立参考数据集各行衡量向外部标签体系的迁移效果,不能替代产品分类体系基准测试。

Ray Guardian 现已成为 Ray 的统一视觉安全层:这是一个同时面向图像和视频片段的系统,旨在识别敏感内容,并在媒体逐帧变化时保持判定稳定。

来源数据集

该基准测试套件引用的数据集来源包括 通过 FiftyOne 获取的 HMDB51XD-ViolenceUCF-Crime通过 FiftyOne 获取的 UCF101HoliSafe-BenchUnsafeBenchOpen Images V7SurgWoundHOD Benchmark Dataset

Subscribe to the Ray newsletter. Product updates, release notes, and customer news.

No spam. Just the Ray newsletter and important product updates.

继续阅读

Ray ASR 基准测试:98 种语言的完整结果1 min read为什么每次下载字幕都像一场赌博——以及 Ray 如何解决这个问题1 min readRay 常见问题:你需要了解的一切1 min read