Зараз відтворюється · Бенчмарки
Бенчмарк ASR Ray: 98 мов, повні результати
Стислий огляд того, як Sunray і MoonRay оцінюються в межах широкого багатомовного бенчмарку розпізнавання мовлення.
Два рушії, одне завдання
Ray використовує два рушії розпізнавання мовлення, оскільки не всі робочі процеси створення субтитрів потребують однакового балансу характеристик.
Sunray (раніше Ray Max) оптимізовано для точності. Це рушій для мов із малим обсягом ресурсів, архівних матеріалів, професійної роботи із субтитрами та будь-яких ситуацій, коли текст має якомога точніше відповідати мовленню в аудіо.
MoonRay (раніше Ray Turbo) оптимізовано для швидкості. Це рушій для перегляду наживо, швидкого попереднього перегляду та обробки великих пакетів, коли важливо швидко отримати придатні до використання субтитри.
Бенчмарк, на якому ґрунтується ця публікація, порівнює обидва рушії для 98 мов, використовуючи однаковий процес оцінювання для кожної моделі. Мета полягає не в розпливчастому твердженні, що Ray є багатомовним. Мета — створити відтворюваний спосіб побачити, як рушії працюють із численними системами письма, акцентами та мовними сім’ями.
Примітка: наведені нижче діаграми створено до перейменування рушіїв, тому в їхніх легендах досі зазначено попередні назви — Ray Max тепер називається Sunray, а Ray Turbo — MoonRay.
Як читати показники
Основна метрика — частота помилок у словах (Word Error Rate), яку зазвичай скорочують до WER. Що нижчий показник, то краще. WER на рівні 5 відсотків означає, що транскрипція дуже близька до еталонного тексту. Високий WER означає, що рушій зробив більше замін, вставок або видалень.
Для зручнішого порівняння той самий результат також можна подати як точність:
accuracy = max(0, 100 - WER)Другий варіант легше переглядати, але WER залишається кориснішою інженерною метрикою, оскільки точно показує, де модель має труднощі.
Загальна продуктивність
Повні результати: усі 98 мов
Мови з найкращими результатами
Найскладніші мови
Що ми вимірюємо
- Якість розпізнавання для 98 мов
- Різницю між Sunray і MoonRay
- Мови, для яких точність уже достатньо висока для повсякденного використання субтитрів
- Мови, яким потрібно більше навчальних даних, нормалізації або спеціалізованої обробки
- Випадки помилок, коли модель вставляє більше тексту, ніж містить вихідне аудіо
Чому це важливо для субтитрів
Рушій субтитрів оцінюють не лише за тим, наскільки добре він працює з англійською мовою. Реальний перегляд складніший: багатомовні фільми, перемикання між мовами, регіональні імена, записи із шумом і контент, у якому мова змінюється посеред сцени.
Ray створено для цієї реальності. Бенчмарки допомагають нам вибирати налаштування за замовчуванням, формувати очікування та вирішувати, на чому зосередити наступні етапи навчання й оцінювання.
Головний результат для продукту простий: Ray може вибирати між швидкістю й точністю залежно від завдання, а обидва рушії продовжують удосконалюватися в міру того, як більше мов проходять через процес бенчмаркінгу.

