Trenutno se reproducira · Benchmarkovi
Ray ASR benchmark: 98 jezika, potpuni rezultati
Sažet pregled načina na koji se Sunray i MoonRay ocjenjuju u okviru opsežnog višejezičnog benchmarka za prepoznavanje govora.
Dva pogona, jedan zadatak
Ray koristi dva pogona za prepoznavanje govora jer nemaju svi radni procesi izrade titlova iste zahtjeve i kompromise.
Sunray (ranije Ray Max) podešen je za preciznost. To je pogon za jezike s malo dostupnih resursa, arhivski materijal, profesionalnu izradu titlova i svaki trenutak kada tekst mora biti što bliži izgovorenom zvuku.
MoonRay (ranije Ray Turbo) podešen je za brzinu. To je pogon za gledanje uživo, brze preglede i velike serije kod kojih je važno brzo dobiti upotrebljive titlove.
Benchmark na kojem se zasniva ova objava poredi oba pogona na 98 jezika, koristeći isti postupak evaluacije za svaki model. Cilj nije neodređena tvrdnja da je Ray višejezičan. Cilj je ponuditi ponovljiv način da se vidi kako se pogoni ponašaju u različitim pismima, akcentima i jezičkim porodicama.
Napomena: grafikoni u nastavku nastali su prije promjene naziva pogona, pa njihove legende još uvijek prikazuju ranije nazive — Ray Max je sada Sunray, a Ray Turbo je sada MoonRay.
Kako čitati brojke
Glavna metrika je stopa grešaka u riječima (Word Error Rate), obično skraćeno WER. Niža vrijednost je bolja. WER od 5 posto znači da je transkript veoma blizak referentnom tekstu. Visok WER znači da je pogon napravio više zamjena, umetanja ili brisanja.
Radi lakšeg poređenja, isti rezultat može se prikazati i kao tačnost:
accuracy = max(0, 100 - WER)Taj drugi prikaz lakše je brzo pregledati, ali WER ostaje korisnija inženjerska metrika jer precizno pokazuje gdje model ima poteškoća.
Ukupne performanse
Potpuni rezultati: svih 98 jezika
Jezici s visokim performansama
Najzahtjevniji jezici
Šta mjerimo
- Kvalitet prepoznavanja na 98 jezika
- Razliku između modela Sunray i MoonRay
- Jezike na kojima je tačnost već dovoljno visoka za svakodnevne titlove
- Jezike kojima je potrebno više podataka za obuku, normalizacije ili obrade specifične za jezik
- Slučajeve neuspjeha u kojima model umeće više teksta nego što ga izvorni zvuk sadrži
Zašto je ovo važno za titlove
Pogon za titlove ne ocjenjuje se samo prema tome koliko dobro obrađuje engleski jezik. Stvarno gledanje je složenije: višejezični filmovi, prebacivanje između jezika, regionalna imena, snimci sa šumom i sadržaj koji usred scene prelazi s jednog jezika na drugi.
Ray je napravljen za takvu stvarnost. Benchmarkovi nam pomažu da odaberemo zadane postavke, postavimo očekivanja i odlučimo na šta treba usmjeriti sljedeći ciklus obuke i evaluacije.
Važan rezultat za proizvod je jednostavan: Ray može birati između brzine i tačnosti u zavisnosti od zadatka, a oba pogona nastavljaju se poboljšavati kako sve više jezika prolazi kroz proces benchmark evaluacije.

