正在播放 · 基准测试
Ray ASR 基准测试:98 种语言的完整结果
简明展示 Sunray 和 MoonRay 如何在广泛的多语言语音识别基准测试中接受评估。
两个引擎,一项任务
Ray 使用两个语音识别引擎,因为不同的字幕工作流对取舍有不同的要求。
Sunray(原名 Ray Max)针对准确性进行了优化。它适用于低资源语言、档案资料、专业字幕制作,以及任何需要文本尽可能贴近语音内容的场景。
MoonRay(原名 Ray Turbo)针对速度进行了优化。它适用于实时观看、快速预览和大批量处理等需要迅速获得可用字幕的场景。
本文所依据的基准测试使用相同的评估流程,对两个引擎在 98 种语言上的表现进行比较。其目的不是笼统地声称 Ray 支持多语言,而是提供一种可重复的方法,以了解这些引擎在多种文字系统、口音和语系中的表现。
注意:下方图表制作于引擎更名之前,因此图例中仍显示原名称——Ray Max 现已更名为 Sunray,Ray Turbo 现已更名为 MoonRay。
如何解读数据
主要指标是字错误率(Word Error Rate),通常缩写为 WER。数值越低越好。WER 为 5% 意味着转录文本与参考文本非常接近。WER 较高则意味着引擎产生了更多替换、插入或删除错误。
为了便于比较,同一结果也可以用准确率表示:
accuracy = max(0, 100 - WER)第二种视图更便于快速浏览,但 WER 仍是更实用的工程指标,因为它能准确显示模型在哪些方面遇到了困难。
整体表现
完整结果:全部 98 种语言
表现优异的语言
最具挑战性的语言
我们衡量什么
- 98 种语言的识别质量
- Sunray 与 MoonRay 之间的差异
- 准确率已足以满足日常字幕需求的语言
- 需要更多训练数据、规范化处理或特定语言处理的语言
- 模型插入的文本多于源音频内容的失败案例
这对字幕为何重要
评价字幕引擎不能只看它处理英语的能力。真实的观看场景更加复杂:多语言电影、语码转换、地区性名称、有噪声的录音,以及在场景中途切换语言的内容。
Ray 正是为这种现实而构建。基准测试帮助我们选择默认设置、设定预期,并决定下一步训练和评估工作的方向。
重要的产品结论很简单:Ray 可以根据任务在速度和准确性之间做出选择,并且随着更多语言进入基准测试流程,两个引擎都在不断改进。

