En reproducción · Benchmarks
Benchmark de ASR de Ray: 98 idiomas, resultados completos
Una visión concisa de cómo se evalúan Sunray y MoonRay mediante un amplio benchmark de reconocimiento de voz multilingüe.
Dos motores, una tarea
Ray utiliza dos motores de reconocimiento de voz porque no todos los flujos de trabajo de subtitulado requieren el mismo equilibrio.
Sunray (antes Ray Max) está optimizado para ofrecer precisión. Es el motor indicado para idiomas con pocos recursos, material de archivo, trabajos profesionales de subtitulado y cualquier situación en la que el texto deba ser lo más fiel posible al audio hablado.
MoonRay (antes Ray Turbo) está optimizado para ofrecer velocidad. Es el motor indicado para la visualización en directo, las previsualizaciones rápidas y los lotes grandes en los que es importante obtener rápidamente subtítulos utilizables.
El benchmark en el que se basa esta publicación compara ambos motores en 98 idiomas mediante el mismo proceso de evaluación para cada modelo. El objetivo no es afirmar vagamente que Ray es multilingüe. El objetivo es ofrecer una forma reproducible de observar cómo se comportan los motores con numerosos sistemas de escritura, acentos y familias lingüísticas.
Nota: los gráficos que aparecen a continuación son anteriores al cambio de nombre de los motores, por lo que sus leyendas todavía muestran los nombres anteriores: Ray Max ahora es Sunray y Ray Turbo ahora es MoonRay.
Cómo interpretar las cifras
La métrica principal es la tasa de error de palabras, normalmente abreviada como WER. Cuanto más baja, mejor. Un WER del 5 por ciento significa que la transcripción es muy similar al texto de referencia. Un WER alto significa que el motor realizó más sustituciones, inserciones o eliminaciones.
Para facilitar la comparación, el mismo resultado también puede mostrarse como precisión:
accuracy = max(0, 100 - WER)Esta segunda vista es más fácil de consultar, pero el WER sigue siendo la métrica de ingeniería más útil porque muestra exactamente dónde tiene dificultades un modelo.
Rendimiento general
Resultados completos: los 98 idiomas
Idiomas con mejor rendimiento
Idiomas más difíciles
Qué medimos
- La calidad del reconocimiento en 98 idiomas
- La diferencia entre Sunray y MoonRay
- Los idiomas cuya precisión ya es lo bastante alta para los subtítulos cotidianos
- Los idiomas que necesitan más datos de entrenamiento, normalización o un tratamiento específico
- Los casos de fallo en los que un modelo inserta más texto del que contiene el audio original
Por qué esto es importante para los subtítulos
Un motor de subtítulos no se evalúa únicamente por lo bien que maneja el inglés. El visionado real es más complejo: películas multilingües, alternancia entre idiomas, nombres regionales, grabaciones con ruido y contenido que cambia de idioma en mitad de una escena.
Ray está diseñado para esa realidad. Los benchmarks nos ayudan a elegir los valores predeterminados, establecer expectativas y decidir hacia dónde orientar el próximo trabajo de entrenamiento y evaluación.
El resultado importante para el producto es sencillo: Ray puede elegir entre velocidad y precisión en función de la tarea, y ambos motores siguen mejorando a medida que más idiomas pasan por el proceso de benchmarking.

