Skip to main content
Libreria

In riproduzione · Benchmark

Benchmark ASR di Ray: 98 lingue, risultati completi

Una panoramica concisa di come Sunray e MoonRay vengono valutati in un ampio benchmark multilingue di riconoscimento vocale.

Ray Team20 MAR 20263 min read

Due motori, un solo compito

Ray utilizza due motori di riconoscimento vocale perché non tutti i flussi di lavoro per i sottotitoli richiedono lo stesso compromesso.

Sunray (in precedenza Ray Max) è ottimizzato per la precisione. È il motore per le lingue con poche risorse, i materiali d'archivio, il lavoro professionale sui sottotitoli e qualsiasi situazione in cui il testo debba essere il più fedele possibile all'audio parlato.

MoonRay (in precedenza Ray Turbo) è ottimizzato per la velocità. È il motore per la visione in tempo reale, le anteprime rapide e i grandi volumi di contenuti per i quali è importante ottenere rapidamente sottotitoli utilizzabili.

Il benchmark alla base di questo articolo confronta entrambi i motori in 98 lingue, utilizzando lo stesso processo di valutazione per ogni modello. L'obiettivo non è affermare genericamente che Ray è multilingue. L'obiettivo è offrire un metodo ripetibile per osservare il comportamento dei motori con numerosi sistemi di scrittura, accenti e famiglie linguistiche.

Nota: i grafici seguenti risalgono a prima del cambio di nome dei motori, quindi nelle relative legende compaiono ancora i nomi precedenti: Ray Max ora è Sunray e Ray Turbo ora è MoonRay.

Come leggere i valori

La metrica principale è il tasso di errore sulle parole, solitamente abbreviato in WER. Più è basso, meglio è. Un WER del 5 percento indica che la trascrizione è molto vicina al testo di riferimento. Un WER elevato indica che il motore ha effettuato più sostituzioni, inserimenti o eliminazioni.

Per facilitare il confronto, lo stesso risultato può essere mostrato anche come accuratezza:

accuracy = max(0, 100 - WER)

Questa seconda rappresentazione è più facile da consultare, ma il WER rimane la metrica ingegneristica più utile perché mostra con precisione dove un modello incontra difficoltà.

Prestazioni complessive

Risultati completi: tutte le 98 lingue

Lingue con prestazioni elevate

Lingue più impegnative

Cosa misuriamo

  • Qualità del riconoscimento in 98 lingue
  • La differenza tra Sunray e MoonRay
  • Le lingue in cui l'accuratezza è già sufficiente per i sottotitoli di uso quotidiano
  • Le lingue che richiedono più dati di addestramento, normalizzazione o una gestione specifica
  • I casi di errore in cui un modello inserisce più testo di quanto ne contenga l'audio originale

Perché è importante per i sottotitoli

Un motore per sottotitoli non viene valutato solo in base a quanto bene gestisce l'inglese. La visione reale è più complessa: film multilingue, alternanza tra lingue, nomi regionali, registrazioni rumorose e contenuti che passano da una lingua all'altra nel corso di una scena.

Ray è progettato per questa realtà. I benchmark ci aiutano a scegliere le impostazioni predefinite, definire le aspettative e decidere su quali aspetti concentrare le prossime attività di addestramento e valutazione.

Il risultato importante per il prodotto è semplice: Ray può scegliere tra velocità e accuratezza in base al compito, ed entrambi i motori continuano a migliorare man mano che nuove lingue vengono elaborate attraverso la pipeline di benchmark.

Subscribe to the Ray newsletter. Product updates, release notes, and customer news.

No spam. Just the Ray newsletter and important product updates.

Ray JournalBenchmark2026-03-20

Benchmark ASR di Ray: 98 lingue, risultati completi

Una panoramica concisa di come Sunray e MoonRay vengono valutati in un ampio benchmark multilingue di riconoscimento vocale.

Ray Team2026-03-203 min read

Due motori, un solo compito

Ray utilizza due motori di riconoscimento vocale perché non tutti i flussi di lavoro per i sottotitoli richiedono lo stesso compromesso.

Sunray (in precedenza Ray Max) è ottimizzato per la precisione. È il motore per le lingue con poche risorse, i materiali d'archivio, il lavoro professionale sui sottotitoli e qualsiasi situazione in cui il testo debba essere il più fedele possibile all'audio parlato.

MoonRay (in precedenza Ray Turbo) è ottimizzato per la velocità. È il motore per la visione in tempo reale, le anteprime rapide e i grandi volumi di contenuti per i quali è importante ottenere rapidamente sottotitoli utilizzabili.

Il benchmark alla base di questo articolo confronta entrambi i motori in 98 lingue, utilizzando lo stesso processo di valutazione per ogni modello. L'obiettivo non è affermare genericamente che Ray è multilingue. L'obiettivo è offrire un metodo ripetibile per osservare il comportamento dei motori con numerosi sistemi di scrittura, accenti e famiglie linguistiche.

Nota: i grafici seguenti risalgono a prima del cambio di nome dei motori, quindi nelle relative legende compaiono ancora i nomi precedenti: Ray Max ora è Sunray e Ray Turbo ora è MoonRay.

Come leggere i valori

La metrica principale è il tasso di errore sulle parole, solitamente abbreviato in WER. Più è basso, meglio è. Un WER del 5 percento indica che la trascrizione è molto vicina al testo di riferimento. Un WER elevato indica che il motore ha effettuato più sostituzioni, inserimenti o eliminazioni.

Per facilitare il confronto, lo stesso risultato può essere mostrato anche come accuratezza:

accuracy = max(0, 100 - WER)

Questa seconda rappresentazione è più facile da consultare, ma il WER rimane la metrica ingegneristica più utile perché mostra con precisione dove un modello incontra difficoltà.

Prestazioni complessive

Risultati completi: tutte le 98 lingue

Lingue con prestazioni elevate

Lingue più impegnative

Cosa misuriamo

  • Qualità del riconoscimento in 98 lingue
  • La differenza tra Sunray e MoonRay
  • Le lingue in cui l'accuratezza è già sufficiente per i sottotitoli di uso quotidiano
  • Le lingue che richiedono più dati di addestramento, normalizzazione o una gestione specifica
  • I casi di errore in cui un modello inserisce più testo di quanto ne contenga l'audio originale

Perché è importante per i sottotitoli

Un motore per sottotitoli non viene valutato solo in base a quanto bene gestisce l'inglese. La visione reale è più complessa: film multilingue, alternanza tra lingue, nomi regionali, registrazioni rumorose e contenuti che passano da una lingua all'altra nel corso di una scena.

Ray è progettato per questa realtà. I benchmark ci aiutano a scegliere le impostazioni predefinite, definire le aspettative e decidere su quali aspetti concentrare le prossime attività di addestramento e valutazione.

Il risultato importante per il prodotto è semplice: Ray può scegliere tra velocità e accuratezza in base al compito, ed entrambi i motori continuano a migliorare man mano che nuove lingue vengono elaborate attraverso la pipeline di benchmark.

Subscribe to the Ray newsletter. Product updates, release notes, and customer news.

No spam. Just the Ray newsletter and important product updates.

Continua a leggere

Presentazione di Ray Guardian: sicurezza visiva per immagini e video7 min readPerché ogni sottotitolo che scarichi è una scommessa e come Ray risolve il problema2 min readFAQ su Ray: tutto ciò che devi sapere2 min read