In riproduzione · Benchmark
Benchmark ASR di Ray: 98 lingue, risultati completi
Una panoramica concisa di come Sunray e MoonRay vengono valutati in un ampio benchmark multilingue di riconoscimento vocale.
Due motori, un solo compito
Ray utilizza due motori di riconoscimento vocale perché non tutti i flussi di lavoro per i sottotitoli richiedono lo stesso compromesso.
Sunray (in precedenza Ray Max) è ottimizzato per la precisione. È il motore per le lingue con poche risorse, i materiali d'archivio, il lavoro professionale sui sottotitoli e qualsiasi situazione in cui il testo debba essere il più fedele possibile all'audio parlato.
MoonRay (in precedenza Ray Turbo) è ottimizzato per la velocità. È il motore per la visione in tempo reale, le anteprime rapide e i grandi volumi di contenuti per i quali è importante ottenere rapidamente sottotitoli utilizzabili.
Il benchmark alla base di questo articolo confronta entrambi i motori in 98 lingue, utilizzando lo stesso processo di valutazione per ogni modello. L'obiettivo non è affermare genericamente che Ray è multilingue. L'obiettivo è offrire un metodo ripetibile per osservare il comportamento dei motori con numerosi sistemi di scrittura, accenti e famiglie linguistiche.
Nota: i grafici seguenti risalgono a prima del cambio di nome dei motori, quindi nelle relative legende compaiono ancora i nomi precedenti: Ray Max ora è Sunray e Ray Turbo ora è MoonRay.
Come leggere i valori
La metrica principale è il tasso di errore sulle parole, solitamente abbreviato in WER. Più è basso, meglio è. Un WER del 5 percento indica che la trascrizione è molto vicina al testo di riferimento. Un WER elevato indica che il motore ha effettuato più sostituzioni, inserimenti o eliminazioni.
Per facilitare il confronto, lo stesso risultato può essere mostrato anche come accuratezza:
accuracy = max(0, 100 - WER)Questa seconda rappresentazione è più facile da consultare, ma il WER rimane la metrica ingegneristica più utile perché mostra con precisione dove un modello incontra difficoltà.
Prestazioni complessive
Risultati completi: tutte le 98 lingue
Lingue con prestazioni elevate
Lingue più impegnative
Cosa misuriamo
- Qualità del riconoscimento in 98 lingue
- La differenza tra Sunray e MoonRay
- Le lingue in cui l'accuratezza è già sufficiente per i sottotitoli di uso quotidiano
- Le lingue che richiedono più dati di addestramento, normalizzazione o una gestione specifica
- I casi di errore in cui un modello inserisce più testo di quanto ne contenga l'audio originale
Perché è importante per i sottotitoli
Un motore per sottotitoli non viene valutato solo in base a quanto bene gestisce l'inglese. La visione reale è più complessa: film multilingue, alternanza tra lingue, nomi regionali, registrazioni rumorose e contenuti che passano da una lingua all'altra nel corso di una scena.
Ray è progettato per questa realtà. I benchmark ci aiutano a scegliere le impostazioni predefinite, definire le aspettative e decidere su quali aspetti concentrare le prossime attività di addestramento e valutazione.
Il risultato importante per il prodotto è semplice: Ray può scegliere tra velocità e accuratezza in base al compito, ed entrambi i motori continuano a migliorare man mano che nuove lingue vengono elaborate attraverso la pipeline di benchmark.

