Právě se přehrává · Benchmarky
Benchmark ASR v Ray: 98 jazyků, kompletní výsledky
Stručný přehled toho, jak jsou Sunray a MoonRay hodnoceny v rozsáhlém vícejazyčném benchmarku rozpoznávání řeči.
Dva enginy, jeden úkol
Ray používá dva enginy pro rozpoznávání řeči, protože ne všechny pracovní postupy s titulky vyžadují stejný kompromis.
Sunray (dříve Ray Max) je optimalizován pro přesnost. Je určen pro jazyky s omezeným množstvím dostupných dat, archivní materiály, profesionální práci s titulky a všechny situace, kdy musí být text co nejvěrnější mluvenému zvuku.
MoonRay (dříve Ray Turbo) je optimalizován pro rychlost. Je určen pro živé sledování, rychlé náhledy a velké dávky, u nichž záleží na rychlém získání použitelných titulků.
Benchmark, z něhož tento příspěvek vychází, porovnává oba enginy v 98 jazycích a pro každý model používá stejný proces hodnocení. Cílem není vágní tvrzení, že je Ray vícejazyčný. Cílem je opakovatelný způsob, jak sledovat chování enginů napříč mnoha písmy, přízvuky a jazykovými rodinami.
Poznámka: níže uvedené grafy vznikly před přejmenováním enginů, takže jejich legendy stále uvádějí původní názvy — Ray Max se nyní jmenuje Sunray a Ray Turbo se nyní jmenuje MoonRay.
Jak číst výsledky
Hlavní metrikou je míra chybovosti slov (Word Error Rate), obvykle zkracovaná jako WER. Čím nižší, tím lepší. WER ve výši 5 procent znamená, že přepis je velmi blízký referenčnímu textu. Vysoká hodnota WER znamená, že engine provedl více záměn, vložení nebo vynechání.
Pro snazší porovnání lze stejný výsledek zobrazit také jako přesnost:
accuracy = max(0, 100 - WER)Tento druhý pohled lze snáze rychle vyhodnotit, ale WER zůstává užitečnější technickou metrikou, protože přesně ukazuje, kde má model potíže.
Celkový výkon
Kompletní výsledky: všech 98 jazyků
Jazyky s vysokým výkonem
Nejnáročnější jazyky
Co měříme
- Kvalitu rozpoznávání v 98 jazycích
- Rozdíl mezi Sunray a MoonRay
- Jazyky, ve kterých je přesnost již dostatečně vysoká pro běžné titulky
- Jazyky, které potřebují více trénovacích dat, normalizaci nebo zpracování specifické pro daný jazyk
- Případy selhání, kdy model vloží více textu, než kolik ho obsahuje zdrojová zvuková stopa
Proč je to důležité pro titulky
Engine pro tvorbu titulků se neposuzuje jen podle toho, jak dobře zvládá angličtinu. Skutečné podmínky sledování jsou komplikovanější: vícejazyčné filmy, přepínání mezi jazyky, regionální jména, zašuměné nahrávky a obsah, který uprostřed scény přechází z jednoho jazyka do druhého.
Ray je vytvořen právě pro tuto realitu. Benchmarky nám pomáhají vybírat výchozí nastavení, nastavovat očekávání a rozhodovat, kam zaměřit další trénink a vyhodnocování.
Důležitý výsledek pro produkt je jednoduchý: Ray si může podle daného úkolu zvolit mezi rychlostí a přesností a oba enginy se průběžně zlepšují s tím, jak procesem benchmarkového hodnocení prochází stále více jazyků.

