Teraz odtwarzane · Benchmarki
Benchmark ASR Ray: 98 języków, pełne wyniki
Zwięzłe omówienie sposobu oceny Sunray i MoonRay w szeroko zakrojonym, wielojęzycznym benchmarku rozpoznawania mowy.
Dwa silniki, jedno zadanie
Ray korzysta z dwóch silników rozpoznawania mowy, ponieważ nie każdy proces tworzenia napisów wymaga takiego samego kompromisu.
Sunray (wcześniej Ray Max) jest zoptymalizowany pod kątem dokładności. To silnik przeznaczony do języków o niewielkich zasobach, materiałów archiwalnych, profesjonalnego tworzenia napisów oraz wszystkich sytuacji, w których tekst musi być jak najbardziej zgodny z nagraniem mowy.
MoonRay (wcześniej Ray Turbo) jest zoptymalizowany pod kątem szybkości. To silnik przeznaczony do oglądania na żywo, szybkich podglądów i dużych partii materiałów, gdy liczy się błyskawiczne uzyskanie użytecznych napisów.
Benchmark opisany w tym wpisie porównuje oba silniki w 98 językach, stosując ten sam proces oceny dla każdego modelu. Celem nie jest ogólnikowe stwierdzenie, że Ray obsługuje wiele języków. Chodzi o powtarzalną metodę sprawdzania, jak silniki radzą sobie z wieloma systemami pisma, akcentami i rodzinami językowymi.
Uwaga: poniższe wykresy powstały przed zmianą nazw silników, dlatego w ich legendach nadal widnieją wcześniejsze nazwy — Ray Max to obecnie Sunray, a Ray Turbo to obecnie MoonRay.
Jak interpretować wyniki
Główną metryką jest współczynnik błędu słów (Word Error Rate), zwykle określany skrótem WER. Im niższy, tym lepiej. WER na poziomie 5 procent oznacza, że transkrypcja jest bardzo zbliżona do tekstu referencyjnego. Wysoki WER oznacza, że silnik dokonał większej liczby zamian, wstawień lub pominięć.
Dla ułatwienia porównania ten sam wynik można również przedstawić jako dokładność:
accuracy = max(0, 100 - WER)Ten drugi sposób prezentacji jest łatwiejszy do szybkiego przejrzenia, ale WER pozostaje bardziej użyteczną metryką inżynieryjną, ponieważ dokładnie pokazuje, gdzie model napotyka trudności.
Ogólna wydajność
Pełne wyniki: wszystkie 98 języków
Języki z najlepszymi wynikami
Najtrudniejsze języki
Co mierzymy
- Jakość rozpoznawania w 98 językach
- Różnicę między Sunray a MoonRay
- Języki, w których dokładność jest już wystarczająco wysoka do tworzenia codziennych napisów
- Języki wymagające większej ilości danych treningowych, normalizacji lub obsługi dostosowanej do konkretnego języka
- Przypadki niepowodzeń, w których model wstawia więcej tekstu, niż zawiera nagranie źródłowe
Dlaczego ma to znaczenie dla napisów
Silnika napisów nie ocenia się wyłącznie na podstawie tego, jak dobrze radzi sobie z językiem angielskim. Rzeczywiste materiały są bardziej złożone: wielojęzyczne filmy, przełączanie się między językami, regionalne nazwy, zaszumione nagrania oraz treści, w których język zmienia się w trakcie sceny.
Ray został stworzony z myślą o takich realiach. Benchmarki pomagają nam wybierać ustawienia domyślne, określać oczekiwania i decydować, na czym powinny koncentrować się kolejne prace nad trenowaniem i oceną.
Najważniejszy wniosek dotyczący produktu jest prosty: Ray może wybrać między szybkością a dokładnością zależnie od zadania, a oba silniki stale się rozwijają wraz z dodawaniem kolejnych języków do procesu benchmarkowego.

