Skip to main content
Biblioteka

Teraz odtwarzane · Benchmarki

Benchmark ASR Ray: 98 języków, pełne wyniki

Zwięzłe omówienie sposobu oceny Sunray i MoonRay w szeroko zakrojonym, wielojęzycznym benchmarku rozpoznawania mowy.

Ray Team20 MAR 20263 min read

Dwa silniki, jedno zadanie

Ray korzysta z dwóch silników rozpoznawania mowy, ponieważ nie każdy proces tworzenia napisów wymaga takiego samego kompromisu.

Sunray (wcześniej Ray Max) jest zoptymalizowany pod kątem dokładności. To silnik przeznaczony do języków o niewielkich zasobach, materiałów archiwalnych, profesjonalnego tworzenia napisów oraz wszystkich sytuacji, w których tekst musi być jak najbardziej zgodny z nagraniem mowy.

MoonRay (wcześniej Ray Turbo) jest zoptymalizowany pod kątem szybkości. To silnik przeznaczony do oglądania na żywo, szybkich podglądów i dużych partii materiałów, gdy liczy się błyskawiczne uzyskanie użytecznych napisów.

Benchmark opisany w tym wpisie porównuje oba silniki w 98 językach, stosując ten sam proces oceny dla każdego modelu. Celem nie jest ogólnikowe stwierdzenie, że Ray obsługuje wiele języków. Chodzi o powtarzalną metodę sprawdzania, jak silniki radzą sobie z wieloma systemami pisma, akcentami i rodzinami językowymi.

Uwaga: poniższe wykresy powstały przed zmianą nazw silników, dlatego w ich legendach nadal widnieją wcześniejsze nazwy — Ray Max to obecnie Sunray, a Ray Turbo to obecnie MoonRay.

Jak interpretować wyniki

Główną metryką jest współczynnik błędu słów (Word Error Rate), zwykle określany skrótem WER. Im niższy, tym lepiej. WER na poziomie 5 procent oznacza, że transkrypcja jest bardzo zbliżona do tekstu referencyjnego. Wysoki WER oznacza, że silnik dokonał większej liczby zamian, wstawień lub pominięć.

Dla ułatwienia porównania ten sam wynik można również przedstawić jako dokładność:

accuracy = max(0, 100 - WER)

Ten drugi sposób prezentacji jest łatwiejszy do szybkiego przejrzenia, ale WER pozostaje bardziej użyteczną metryką inżynieryjną, ponieważ dokładnie pokazuje, gdzie model napotyka trudności.

Ogólna wydajność

Pełne wyniki: wszystkie 98 języków

Języki z najlepszymi wynikami

Najtrudniejsze języki

Co mierzymy

  • Jakość rozpoznawania w 98 językach
  • Różnicę między Sunray a MoonRay
  • Języki, w których dokładność jest już wystarczająco wysoka do tworzenia codziennych napisów
  • Języki wymagające większej ilości danych treningowych, normalizacji lub obsługi dostosowanej do konkretnego języka
  • Przypadki niepowodzeń, w których model wstawia więcej tekstu, niż zawiera nagranie źródłowe

Dlaczego ma to znaczenie dla napisów

Silnika napisów nie ocenia się wyłącznie na podstawie tego, jak dobrze radzi sobie z językiem angielskim. Rzeczywiste materiały są bardziej złożone: wielojęzyczne filmy, przełączanie się między językami, regionalne nazwy, zaszumione nagrania oraz treści, w których język zmienia się w trakcie sceny.

Ray został stworzony z myślą o takich realiach. Benchmarki pomagają nam wybierać ustawienia domyślne, określać oczekiwania i decydować, na czym powinny koncentrować się kolejne prace nad trenowaniem i oceną.

Najważniejszy wniosek dotyczący produktu jest prosty: Ray może wybrać między szybkością a dokładnością zależnie od zadania, a oba silniki stale się rozwijają wraz z dodawaniem kolejnych języków do procesu benchmarkowego.

Subscribe to the Ray newsletter. Product updates, release notes, and customer news.

No spam. Just the Ray newsletter and important product updates.

Ray JournalBenchmarki2026-03-20

Benchmark ASR Ray: 98 języków, pełne wyniki

Zwięzłe omówienie sposobu oceny Sunray i MoonRay w szeroko zakrojonym, wielojęzycznym benchmarku rozpoznawania mowy.

Ray Team2026-03-203 min read

Dwa silniki, jedno zadanie

Ray korzysta z dwóch silników rozpoznawania mowy, ponieważ nie każdy proces tworzenia napisów wymaga takiego samego kompromisu.

Sunray (wcześniej Ray Max) jest zoptymalizowany pod kątem dokładności. To silnik przeznaczony do języków o niewielkich zasobach, materiałów archiwalnych, profesjonalnego tworzenia napisów oraz wszystkich sytuacji, w których tekst musi być jak najbardziej zgodny z nagraniem mowy.

MoonRay (wcześniej Ray Turbo) jest zoptymalizowany pod kątem szybkości. To silnik przeznaczony do oglądania na żywo, szybkich podglądów i dużych partii materiałów, gdy liczy się błyskawiczne uzyskanie użytecznych napisów.

Benchmark opisany w tym wpisie porównuje oba silniki w 98 językach, stosując ten sam proces oceny dla każdego modelu. Celem nie jest ogólnikowe stwierdzenie, że Ray obsługuje wiele języków. Chodzi o powtarzalną metodę sprawdzania, jak silniki radzą sobie z wieloma systemami pisma, akcentami i rodzinami językowymi.

Uwaga: poniższe wykresy powstały przed zmianą nazw silników, dlatego w ich legendach nadal widnieją wcześniejsze nazwy — Ray Max to obecnie Sunray, a Ray Turbo to obecnie MoonRay.

Jak interpretować wyniki

Główną metryką jest współczynnik błędu słów (Word Error Rate), zwykle określany skrótem WER. Im niższy, tym lepiej. WER na poziomie 5 procent oznacza, że transkrypcja jest bardzo zbliżona do tekstu referencyjnego. Wysoki WER oznacza, że silnik dokonał większej liczby zamian, wstawień lub pominięć.

Dla ułatwienia porównania ten sam wynik można również przedstawić jako dokładność:

accuracy = max(0, 100 - WER)

Ten drugi sposób prezentacji jest łatwiejszy do szybkiego przejrzenia, ale WER pozostaje bardziej użyteczną metryką inżynieryjną, ponieważ dokładnie pokazuje, gdzie model napotyka trudności.

Ogólna wydajność

Pełne wyniki: wszystkie 98 języków

Języki z najlepszymi wynikami

Najtrudniejsze języki

Co mierzymy

  • Jakość rozpoznawania w 98 językach
  • Różnicę między Sunray a MoonRay
  • Języki, w których dokładność jest już wystarczająco wysoka do tworzenia codziennych napisów
  • Języki wymagające większej ilości danych treningowych, normalizacji lub obsługi dostosowanej do konkretnego języka
  • Przypadki niepowodzeń, w których model wstawia więcej tekstu, niż zawiera nagranie źródłowe

Dlaczego ma to znaczenie dla napisów

Silnika napisów nie ocenia się wyłącznie na podstawie tego, jak dobrze radzi sobie z językiem angielskim. Rzeczywiste materiały są bardziej złożone: wielojęzyczne filmy, przełączanie się między językami, regionalne nazwy, zaszumione nagrania oraz treści, w których język zmienia się w trakcie sceny.

Ray został stworzony z myślą o takich realiach. Benchmarki pomagają nam wybierać ustawienia domyślne, określać oczekiwania i decydować, na czym powinny koncentrować się kolejne prace nad trenowaniem i oceną.

Najważniejszy wniosek dotyczący produktu jest prosty: Ray może wybrać między szybkością a dokładnością zależnie od zadania, a oba silniki stale się rozwijają wraz z dodawaniem kolejnych języków do procesu benchmarkowego.

Subscribe to the Ray newsletter. Product updates, release notes, and customer news.

No spam. Just the Ray newsletter and important product updates.

Czytaj dalej

Przedstawiamy Ray Guardian: bezpieczeństwo wizualne obrazów i wideo6 min readDlaczego każde pobieranie napisów to loteria — i jak Ray rozwiązuje ten problem2 min readRay FAQ: wszystko, co musisz wiedzieć2 min read