En reproducción · Evaluaciones comparativas
Presentamos Ray Guardian: seguridad visual para imágenes y vídeo
Ray Guardian es el sistema unificado de seguridad visual de Ray, evaluado en 13 categorías de seguridad a nivel de imagen y conjuntos de datos de vídeo con etiquetas públicas.
Presentamos Ray Guardian
Ray Guardian es el sistema de seguridad visual de Ray para imágenes y vídeo. Revisa medios visuales en busca de contenido sensible y devuelve señales por categoría que Ray puede utilizar para la reproducción, la creación, la moderación y la configuración familiar.
Lo importante es sencillo: Ray Guardian es un único sistema. Las imágenes estáticas y los clips de vídeo entran por rutas multimedia diferentes, pero el producto recibe una única decisión de Guardian.
Para las imágenes, Ray Guardian evalúa la taxonomía de seguridad completa: desnudez, contenido sexual, violencia, contenido gráfico, armas, drogas, alcohol, tabaquismo, contenido perturbador, besos / intimidad, autolesiones, crueldad animal y contenido médico gráfico.
Para el vídeo, Ray Guardian añade la dimensión temporal. Un solo fotograma puede ser ambiguo; un clip puede mostrar acción, intención y contexto. La ruta de vídeo combina el reconocimiento de seguridad a nivel de fotograma con la comprensión temporal a nivel de clip, de modo que el resultado final refleje lo que aparece en pantalla y lo que sucede a lo largo del tiempo.
Ese es el sistema que evaluamos.
Evaluación comparativa de seguridad visual de 13 categorías
Ray Guardian alcanzó una exactitud del 100.000% en la evaluación comparativa de imágenes reservadas de 13 categorías de Ray Guardian: 17,435 etiquetas conocidas, 0 errores.
Esta evaluación comparativa es la más próxima a la propia taxonomía del producto: las mismas definiciones de categorías, ejemplos reservados y el conjunto completo de categorías de seguridad visual de Ray Guardian.
| Evaluación comparativa | Alcance | Elementos | Exactitud | Precisión | Exhaustividad | F1 |
|---|---|---|---|---|---|---|
| Evaluación comparativa de Ray Guardian a nivel de imagen reservada | Las 13 categorías de Ray Guardian | 17,435 etiquetas | 100.000% | 100.000% | 100.000% | 100.000% |
La evaluación comparativa incluye categorías que suelen solaparse en productos reales: contenido sexual frente a desnudez, contenido gráfico frente a contenido médico gráfico, armas frente a violencia y contenido perturbador frente a un contexto desagradable ordinario.
Conjunto de evaluaciones comparativas de vídeo con etiquetas públicas
Las evaluaciones comparativas de vídeo se miden con respecto a las etiquetas que proporciona realmente cada conjunto de datos. Un conjunto de datos de besos frente a abrazos aporta evidencia sobre besos / intimidad. Un conjunto de datos de violencia aporta evidencia sobre violencia y sucesos perturbadores. Un conjunto de datos de acciones seguras comprueba si se permite correctamente el contenido de clips de acciones ordinarias.
Esto hace que los resultados sean más fáciles de interpretar y más difíciles de utilizar de forma incorrecta: cada fila presenta el rendimiento de Ray Guardian en el alcance de etiquetas nativo de ese conjunto de datos.
| Conjunto de datos | Alcance de Ray Guardian | Clips | Exactitud | Precisión | Exhaustividad | F1 |
|---|---|---|---|---|---|---|
| HMDB51 Beso frente a abrazo | Besos / Intimidad | 182 | 98.901% | 99.020% | 99.020% | 99.020% |
| XD-Violence Etiquetas públicas | Violencia / Contenido perturbador | 248 | 100.000% | 100.000% | 100.000% | 100.000% |
| UCF-Crime Etiquetas mapeadas | Violencia / Contenido perturbador | 79 | 100.000% | 100.000% | 100.000% | 100.000% |
| UCF-Crime Anomalía amplia | Anomalía / Contenido perturbador | 109 | 100.000% | 100.000% | 100.000% | 100.000% |
| UCF101 Conjunto reservado de acciones seguras | Mecanismo de protección para acciones seguras | 330 | 100.000% | n/a | n/a | n/a |
La fila de UCF101 es un mecanismo de protección compuesto únicamente por ejemplos negativos: mide si se bloquean incorrectamente acciones seguras ordinarias. En esa prueba, Ray Guardian permitió correctamente los 330 clips de acciones seguras.
Qué muestran las matrices de confusión
La exactitud es la cifra principal. Una matriz de confusión muestra la distribución de las decisiones que hay detrás.
Cada matriz distingue entre permisos correctos, falsas alarmas, clips no seguros omitidos y clips no seguros señalados correctamente. Esto importa porque un sistema de seguridad debe proteger a las personas sin interrumpir los medios ordinarios más de lo necesario.
Conjuntos de datos de referencia independientes
También evaluamos Ray Guardian en conjuntos de datos de referencia independientes, públicos y de acceso restringido. Estos conjuntos de datos son útiles porque sus etiquetas fueron elaboradas por otros equipos, con otros objetivos, y no siempre se corresponden perfectamente con las categorías de Ray Guardian.
La tabla siguiente presenta cada resultado en el nivel de categoría que el conjunto de datos puede sustentar. Cuando un conjunto de datos evalúa objetos relacionados con el alcohol, informamos del comportamiento de la categoría de alcohol. Cuando evalúa heridas médicas, informamos del comportamiento de las categorías de contenido médico gráfico o contenido perturbador.
| Conjunto de datos de referencia | Alcance de Ray Guardian | Elementos | Exactitud | Exhaustividad | Notas |
|---|---|---|---|---|---|
| Partición de prueba de HoliSafe-Bench | Categorías mapeadas de seguridad de imágenes | 32,248 etiquetas | 94.266% | 75.779% | Evaluación comparativa de seguridad independiente y de acceso restringido |
| Partición de entrenamiento de UnsafeBench | Categorías mapeadas de seguridad de imágenes | 40,545 etiquetas | 89.893% | 74.482% | Evaluación comparativa de seguridad independiente y de acceso restringido |
| Partición de prueba de SurgWound | Contenido médico gráfico | 137 imágenes | 86.861% | 100.000% | Comprobación de sensibilidad a heridas médicas |
| Partición de prueba de SurgWound | Contenido perturbador | 137 imágenes | 83.942% | 99.130% | Comprobación de sensibilidad a heridas médicas |
| Lower Limb and Feet Wound Dataset | Contenido médico gráfico | 5,443 imágenes | 65.185% | 98.958% | Comprobación de referencia en el dominio de las heridas |
| HOD Benchmark Dataset | Alcohol | 10,631 imágenes | 97.667% | 87.095% | Evaluación comparativa de objetos para uso en investigación |
| HOD Benchmark Dataset | Tabaquismo | 10,631 imágenes | 98.222% | 93.391% | Evaluación comparativa de objetos para uso en investigación |
| HOD Benchmark Dataset | Armas | 10,631 imágenes | 85.053% | 68.659% | Evaluación comparativa de objetos para uso en investigación |
| Subconjunto de validación seleccionado de Open Images V7 | Armas | 460 filas | 81.957% | 87.234% | Comprobación de referencia de etiquetas de objetos |
Estas filas muestran cómo se comporta Ray Guardian más allá de la evaluación comparativa para la que fue desarrollado.
Por qué difieren las cifras
Una puntuación inferior en una referencia pública no es una contradicción. Significa que el conjunto de datos plantea una pregunta diferente.
La evaluación comparativa de 13 categorías de Ray Guardian pregunta si el sistema reconoce las categorías de seguridad utilizadas en Ray. Los conjuntos de datos de referencia independientes preguntan qué sucede cuando se mapean etiquetas externas, métodos de recopilación externos y definiciones de categorías externas a esa taxonomía.
Las puntuaciones pueden variar por motivos sencillos:
- Definiciones de etiquetas diferentes. Un conjunto de datos puede etiquetar un objeto mientras Ray Guardian evalúa su significado para la seguridad. Una copa de vino, una botella, un cuchillo o una herida clínica no siempre son inseguros por sí mismos.
- Etiquetas generales. Algunas etiquetas públicas de seguridad combinan varios conceptos en una única etiqueta amplia. Las categorías de Ray Guardian son más específicas.
- Falta de contexto. Algunas etiquetas dependen del texto descriptivo, el audio, la escena circundante o la intención humana. Estas pruebas miden el contenido visible.
- Cambio de dominio. Los conjuntos de datos externos incluyen diferentes recortes, resoluciones, imágenes generadas, grabaciones de vigilancia, primeros planos de objetos e imágenes médicas.
- Diseño de tareas diferente. Las evaluaciones comparativas de reconocimiento de objetos son pruebas de resistencia útiles, pero el reconocimiento de objetos no es idéntico a la moderación de seguridad visual.
La evaluación comparativa alineada muestra el rendimiento en la taxonomía de producto de Ray Guardian. Los conjuntos de datos de referencia muestran cómo se transfiere esa taxonomía a datos externos más heterogéneos.
Cómo interpretar la evaluación comparativa
Interprete cada cifra en el nivel de las etiquetas que la sustentan.
- El resultado de 13 categorías mide la taxonomía completa de seguridad a nivel de imagen de Ray Guardian.
- Las filas de vídeo miden Ray Guardian con las etiquetas públicas de vídeo disponibles en cada conjunto de datos.
- Las filas de referencia independientes miden la transferencia a sistemas de etiquetas externos, no sustituyen la evaluación comparativa de la taxonomía del producto.
Ray Guardian es ahora la capa unificada de seguridad visual de Ray: un único sistema para imágenes y clips, diseñado para detectar contenido sensible y mantener decisiones estables a medida que los medios avanzan fotograma a fotograma.
Conjuntos de datos de origen
El conjunto de evaluaciones comparativas cita fuentes de conjuntos de datos, entre ellas HMDB51 mediante FiftyOne, XD-Violence, UCF-Crime, UCF101 mediante FiftyOne, HoliSafe-Bench, UnsafeBench, Open Images V7, SurgWound y HOD Benchmark Dataset.

