Reproduzindo agora · Benchmarks
Benchmark de ASR do Ray: 98 idiomas, resultados completos
Uma visão concisa de como Sunray e MoonRay são avaliados em um amplo benchmark multilíngue de reconhecimento de fala.
Dois mecanismos, uma tarefa
Ray usa dois mecanismos de reconhecimento de fala porque nem todos os fluxos de trabalho com legendas exigem o mesmo equilíbrio.
Sunray (anteriormente Ray Max) é otimizado para precisão. É o mecanismo para idiomas com poucos recursos, material de arquivo, trabalho profissional com legendas e qualquer situação em que o texto precise ser o mais fiel possível ao áudio falado.
MoonRay (anteriormente Ray Turbo) é otimizado para velocidade. É o mecanismo para visualização ao vivo, prévias rápidas e grandes lotes em que é importante obter rapidamente legendas utilizáveis.
O benchmark por trás desta publicação compara os dois mecanismos em 98 idiomas, usando o mesmo processo de avaliação para cada modelo. O objetivo não é fazer uma afirmação vaga de que Ray é multilíngue. O objetivo é oferecer uma forma reproduzível de ver como os mecanismos se comportam em diversas escritas, sotaques e famílias linguísticas.
Observação: os gráficos abaixo são anteriores à mudança de marca dos mecanismos, portanto suas legendas ainda mostram os nomes anteriores — Ray Max agora é Sunray, e Ray Turbo agora é MoonRay.
Como interpretar os números
A principal métrica é a Taxa de Erro de Palavras, geralmente abreviada como WER. Quanto menor, melhor. Uma WER de 5% significa que a transcrição está muito próxima do texto de referência. Uma WER alta significa que o mecanismo fez mais substituições, inserções ou exclusões.
Para facilitar a comparação, o mesmo resultado também pode ser apresentado como precisão:
accuracy = max(0, 100 - WER)Essa segunda visualização é mais fácil de analisar rapidamente, mas a WER continua sendo a métrica de engenharia mais útil porque mostra exatamente onde um modelo está enfrentando dificuldades.
Desempenho geral
Resultados completos: todos os 98 idiomas
Idiomas com alto desempenho
Idiomas mais desafiadores
O que medimos
- Qualidade do reconhecimento em 98 idiomas
- A diferença entre Sunray e MoonRay
- Idiomas nos quais a precisão já é boa o suficiente para legendas do dia a dia
- Idiomas que precisam de mais dados de treinamento, normalização ou tratamento específico
- Casos de falha em que um modelo insere mais texto do que o áudio original contém
Por que isso é importante para legendas
Um mecanismo de legendas não é avaliado apenas pela capacidade de lidar com o inglês. A experiência real é mais complexa: filmes multilíngues, alternância entre idiomas, nomes regionais, gravações com ruído e conteúdos que mudam de idioma no meio de uma cena.
Ray foi desenvolvido para essa realidade. Os benchmarks nos ajudam a escolher configurações padrão, definir expectativas e decidir para onde direcionar os próximos trabalhos de treinamento e avaliação.
O resultado importante para o produto é simples: Ray pode escolher entre velocidade e precisão de acordo com a tarefa, e ambos os mecanismos continuam melhorando à medida que mais idiomas passam pelo pipeline de benchmark.

