Em reprodução · Testes de desempenho
Benchmark de ASR da Ray: 98 línguas, resultados completos
Uma visão concisa de como Sunray e MoonRay são avaliados num amplo benchmark multilingue de reconhecimento de voz.
Dois motores, uma tarefa
A Ray utiliza dois motores de reconhecimento de voz porque nem todos os fluxos de trabalho de legendagem exigem o mesmo equilíbrio.
Sunray (anteriormente Ray Max) está otimizado para a precisão. É o motor indicado para línguas com poucos recursos, material de arquivo, trabalho profissional de legendagem e qualquer situação em que o texto tenha de ser o mais fiel possível ao áudio falado.
MoonRay (anteriormente Ray Turbo) está otimizado para a velocidade. É o motor indicado para visualização em direto, pré-visualizações rápidas e grandes lotes em que é importante obter rapidamente legendas utilizáveis.
O benchmark subjacente a este artigo compara ambos os motores em 98 línguas, utilizando o mesmo processo de avaliação para todos os modelos. O objetivo não é fazer uma afirmação vaga de que a Ray é multilingue. O objetivo é oferecer uma forma repetível de ver como os motores se comportam em diversos sistemas de escrita, sotaques e famílias linguísticas.
Nota: os gráficos abaixo são anteriores à mudança de nomes dos motores, pelo que as respetivas legendas ainda apresentam os nomes anteriores — Ray Max é agora Sunray e Ray Turbo é agora MoonRay.
Como interpretar os números
A principal métrica é a Taxa de Erro de Palavras, geralmente abreviada como WER. Quanto mais baixa, melhor. Uma WER de 5 por cento significa que a transcrição está muito próxima do texto de referência. Uma WER elevada significa que o motor efetuou mais substituições, inserções ou eliminações.
Para facilitar a comparação, o mesmo resultado também pode ser apresentado como precisão:
accuracy = max(0, 100 - WER)Esta segunda perspetiva é mais fácil de consultar rapidamente, mas a WER continua a ser a métrica de engenharia mais útil, pois mostra exatamente onde um modelo está a ter dificuldades.
Desempenho geral
Resultados completos: todas as 98 línguas
Línguas com melhor desempenho
Línguas mais desafiantes
O que medimos
- Qualidade do reconhecimento em 98 línguas
- A diferença entre Sunray e MoonRay
- Línguas em que a precisão já é suficientemente elevada para legendas do dia a dia
- Línguas que necessitam de mais dados de treino, normalização ou tratamento específico
- Casos de falha em que um modelo insere mais texto do que aquele que o áudio de origem contém
Por que motivo isto é importante para as legendas
Um motor de legendagem não é avaliado apenas pela forma como processa o inglês. A visualização real é mais complexa: filmes multilingues, alternância entre línguas, nomes regionais, gravações com ruído e conteúdos que mudam de língua a meio de uma cena.
A Ray foi criada para essa realidade. Os benchmarks ajudam-nos a escolher predefinições, a definir expectativas e a decidir onde concentrar o próximo trabalho de treino e avaliação.
O resultado importante para o produto é simples: a Ray pode escolher entre velocidade e precisão consoante a tarefa, e ambos os motores continuam a melhorar à medida que mais línguas passam pelo processo de benchmarking.

