Spilles nå · Benchmarktester
Ray ASR-benchmark: 98 språk, fullstendige resultater
En kortfattet oversikt over hvordan Sunray og MoonRay evalueres i en omfattende flerspråklig benchmark for talegjenkjenning.
To motorer, én oppgave
Ray bruker to talegjenkjenningsmotorer fordi ikke alle arbeidsflyter for undertekster trenger den samme avveiningen.
Sunray (tidligere Ray Max) er optimalisert for nøyaktighet. Det er motoren for språk med få ressurser, arkivmateriale, profesjonelt undertekstarbeid og alle situasjoner der teksten må ligge så nær den talte lyden som mulig.
MoonRay (tidligere Ray Turbo) er optimalisert for hastighet. Det er motoren for direktetitting, raske forhåndsvisninger og store grupper med filer der det er viktig å få brukbare undertekster raskt.
Benchmarktesten bak dette innlegget sammenligner begge motorene på tvers av 98 språk ved hjelp av den samme evalueringsprosessen for hver modell. Målet er ikke en vag påstand om at Ray er flerspråklig. Målet er å gi en repeterbar metode for å se hvordan motorene fungerer på tvers av mange skriftsystemer, aksenter og språkfamilier.
Merk: Diagrammene nedenfor er fra før motorene fikk nye navn, så forklaringene viser fortsatt de tidligere navnene — Ray Max heter nå Sunray, og Ray Turbo heter nå MoonRay.
Slik leser du tallene
Hovedmålingen er ordfeilrate (Word Error Rate), vanligvis forkortet til WER. Lavere er bedre. En WER på 5 prosent betyr at transkripsjonen ligger svært nær referanseteksten. En høy WER betyr at motoren har gjort flere erstatninger, innsettinger eller slettinger.
For å gjøre sammenligningen enklere kan det samme resultatet også vises som nøyaktighet:
accuracy = max(0, 100 - WER)Denne andre visningen er enklere å lese raskt, men WER er fortsatt den mest nyttige tekniske målingen fordi den viser nøyaktig hvor en modell har problemer.
Samlet ytelse
Fullstendige resultater: alle de 98 språkene
Språk med høy ytelse
De mest utfordrende språkene
Dette måler vi
- Gjenkjenningskvalitet på tvers av 98 språk
- Forskjellen mellom Sunray og MoonRay
- Språk der nøyaktigheten allerede er god nok for undertekster til daglig bruk
- Språk som trenger mer treningsdata, normalisering eller språkspesifikk behandling
- Feiltilfeller der en modell setter inn mer tekst enn kildelyden inneholder
Derfor er dette viktig for undertekster
En undertekstmotor vurderes ikke bare etter hvor godt den håndterer engelsk. Virkelig seing er mer sammensatt: flerspråklige filmer, kodeveksling, regionale navn, støyende opptak og innhold som bytter mellom språk midt i en scene.
Ray er utviklet for denne virkeligheten. Benchmarktester hjelper oss med å velge standardinnstillinger, avklare forventninger og avgjøre hvor den neste innsatsen innen trening og evaluering bør settes inn.
Det viktige produktresultatet er enkelt: Ray kan velge mellom hastighet og nøyaktighet ut fra oppgaven, og begge motorene fortsetter å bli bedre etter hvert som flere språk går gjennom benchmarkprosessen.

