Prehráva sa · Benchmarky
Benchmark ASR v Ray: 98 jazykov, kompletné výsledky
Stručný pohľad na to, ako sa Sunray a MoonRay hodnotia v rámci rozsiahleho viacjazyčného benchmarku rozpoznávania reči.
Dva enginy, jedna úloha
Ray používa dva enginy na rozpoznávanie reči, pretože nie všetky pracovné postupy pri tvorbe titulkov vyžadujú rovnaký kompromis.
Sunray (predtým Ray Max) je vyladený na presnosť. Je to engine pre jazyky s nedostatkom zdrojov, archívne materiály, profesionálnu tvorbu titulkov a všetky situácie, v ktorých musí byť text čo najbližšie k hovorenému zvuku.
MoonRay (predtým Ray Turbo) je vyladený na rýchlosť. Je to engine na sledovanie naživo, rýchle náhľady a veľké dávky, pri ktorých záleží na rýchlom získaní použiteľných titulkov.
Benchmark, na ktorom je založený tento príspevok, porovnáva oba enginy v 98 jazykoch pomocou rovnakého procesu hodnotenia pre každý model. Cieľom nie je vágne tvrdenie, že Ray je viacjazyčný. Cieľom je opakovateľný spôsob, ako zistiť, ako sa enginy správajú pri rôznych písmach, prízvukoch a jazykových rodinách.
Poznámka: grafy nižšie vznikli pred premenovaním enginov, preto ich legendy stále uvádzajú pôvodné názvy — Ray Max je teraz Sunray a Ray Turbo je teraz MoonRay.
Ako čítať čísla
Hlavnou metrikou je miera chybovosti slov (Word Error Rate), zvyčajne skracovaná ako WER. Nižšia hodnota je lepšia. WER na úrovni 5 percent znamená, že prepis je veľmi blízky referenčnému textu. Vysoká hodnota WER znamená, že engine vykonal viac zámen, vložení alebo vynechaní.
Na jednoduchšie porovnanie možno ten istý výsledok zobraziť aj ako presnosť:
accuracy = max(0, 100 - WER)Tento druhý pohľad sa ľahšie rýchlo vyhodnocuje, no WER zostáva užitočnejšou technickou metrikou, pretože presne ukazuje, kde má model problémy.
Celkový výkon
Kompletné výsledky: všetkých 98 jazykov
Jazyky s vysokým výkonom
Najnáročnejšie jazyky
Čo meriame
- Kvalitu rozpoznávania v 98 jazykoch
- Rozdiel medzi Sunray a MoonRay
- Jazyky, v ktorých je presnosť už dostatočne vysoká na každodenné titulky
- Jazyky, ktoré potrebujú viac tréningových dát, normalizáciu alebo spracovanie špecifické pre daný jazyk
- Prípady zlyhania, pri ktorých model vloží viac textu, než obsahuje zdrojový zvuk
Prečo je to dôležité pre titulky
Engine na tvorbu titulkov sa neposudzuje iba podľa toho, ako dobre zvláda angličtinu. Skutočné sledovanie je komplikovanejšie: viacjazyčné filmy, prepínanie medzi jazykmi, regionálne názvy, nahrávky so šumom a obsah, ktorý uprostred scény prechádza z jedného jazyka do druhého.
Ray je vytvorený pre túto realitu. Benchmarky nám pomáhajú vyberať predvolené nastavenia, určovať očakávania a rozhodovať, kam by malo smerovať ďalšie úsilie v oblasti trénovania a hodnotenia.
Dôležitý výsledok pre produkt je jednoduchý: Ray si môže podľa konkrétnej úlohy vybrať medzi rýchlosťou a presnosťou a oba enginy sa naďalej zlepšujú, keďže procesom benchmarku prechádza čoraz viac jazykov.

