Ara sona · Proves de rendiment
Comparativa ASR de Ray: 98 llengües, resultats complets
Una visió concisa de com s'avaluen Sunray i MoonRay en una àmplia comparativa multilingüe de reconeixement de la parla.
Dos motors, una sola tasca
Ray utilitza dos motors de reconeixement de la parla perquè no tots els fluxos de treball de subtitulació requereixen el mateix equilibri.
Sunray (abans Ray Max) està optimitzat per a la precisió. És el motor per a llengües amb pocs recursos, material d'arxiu, treball professional de subtitulació i qualsevol situació en què el text hagi de ser tan fidel com sigui possible a l'àudio parlat.
MoonRay (abans Ray Turbo) està optimitzat per a la velocitat. És el motor per a la visualització en directe, les previsualitzacions ràpides i els lots grans en què és important obtenir subtítols utilitzables ràpidament.
La comparativa en què es basa aquesta publicació compara tots dos motors en 98 llengües mitjançant el mateix procés d'avaluació per a cada model. L'objectiu no és fer una afirmació vaga que Ray és multilingüe. L'objectiu és oferir una manera reproduïble de veure com es comporten els motors amb nombrosos sistemes d'escriptura, accents i famílies lingüístiques.
Nota: els gràfics següents són anteriors al canvi de marca dels motors, de manera que les seves llegendes encara mostren els noms anteriors: Ray Max ara és Sunray i Ray Turbo ara és MoonRay.
Com interpretar les xifres
La mètrica principal és la taxa d'error de paraules (Word Error Rate), normalment abreujada com a WER. Com més baixa, millor. Un WER del 5 per cent significa que la transcripció és molt fidel al text de referència. Un WER alt significa que el motor ha fet més substitucions, insercions o supressions.
Per facilitar la comparació, el mateix resultat també es pot mostrar com a precisió:
accuracy = max(0, 100 - WER)Aquesta segona visualització és més fàcil de consultar ràpidament, però el WER continua sent la mètrica d'enginyeria més útil perquè mostra exactament en quins punts té dificultats un model.
Rendiment general
Resultats complets: les 98 llengües
Llengües amb un rendiment elevat
Llengües més difícils
Què mesurem
- La qualitat del reconeixement en 98 llengües
- La diferència entre Sunray i MoonRay
- Les llengües en què la precisió ja és prou alta per als subtítols d'ús quotidià
- Les llengües que necessiten més dades d'entrenament, normalització o tractament específic
- Els casos d'error en què un model insereix més text del que conté l'àudio original
Per què això és important per als subtítols
Un motor de subtítols no s'avalua únicament per la seva capacitat de processar l'anglès. El visionament real és més complex: pel·lícules multilingües, alternança de llengües, noms regionals, enregistraments amb soroll i contingut que canvia de llengua a mitja escena.
Ray està dissenyat per a aquesta realitat. Les comparatives ens ajuden a triar els valors predeterminats, establir expectatives i decidir en què s'han de centrar els propers esforços d'entrenament i avaluació.
El resultat important per al producte és senzill: Ray pot triar entre velocitat i precisió segons la tasca, i tots dos motors continuen millorant a mesura que més llengües passen pel procés de comparativa.

