Αναπαράγεται τώρα · Benchmarks
Benchmark ASR του Ray: 98 γλώσσες, πλήρη αποτελέσματα
Μια συνοπτική παρουσίαση του τρόπου αξιολόγησης των Sunray και MoonRay σε ένα ευρύ, πολύγλωσσο benchmark αναγνώρισης ομιλίας.
Δύο μηχανές, μία δουλειά
Το Ray χρησιμοποιεί δύο μηχανές αναγνώρισης ομιλίας, επειδή δεν απαιτούν όλες οι ροές εργασίας υποτιτλισμού τον ίδιο συμβιβασμό.
Το Sunray (πρώην Ray Max) είναι βελτιστοποιημένο για ακρίβεια. Είναι η μηχανή για γλώσσες με περιορισμένους διαθέσιμους πόρους, αρχειακό υλικό, επαγγελματικές εργασίες υποτιτλισμού και κάθε περίπτωση όπου το κείμενο πρέπει να προσεγγίζει όσο το δυνατόν περισσότερο τον προφορικό λόγο.
Το MoonRay (πρώην Ray Turbo) είναι βελτιστοποιημένο για ταχύτητα. Είναι η μηχανή για ζωντανή παρακολούθηση, γρήγορες προεπισκοπήσεις και μεγάλες παρτίδες, όπου έχει σημασία η γρήγορη δημιουργία αξιοποιήσιμων υποτίτλων.
Το benchmark στο οποίο βασίζεται αυτή η ανάρτηση συγκρίνει και τις δύο μηχανές σε 98 γλώσσες, χρησιμοποιώντας την ίδια διαδικασία αξιολόγησης για κάθε μοντέλο. Στόχος δεν είναι ένας αόριστος ισχυρισμός ότι το Ray είναι πολύγλωσσο. Στόχος είναι ένας επαναλήψιμος τρόπος για να βλέπουμε πώς συμπεριφέρονται οι μηχανές σε πολλά συστήματα γραφής, προφορές και γλωσσικές οικογένειες.
Σημείωση: τα παρακάτω διαγράμματα δημιουργήθηκαν πριν από τη μετονομασία των μηχανών, επομένως στα υπομνήματά τους εξακολουθούν να εμφανίζονται οι παλιές ονομασίες — το Ray Max είναι πλέον Sunray και το Ray Turbo είναι πλέον MoonRay.
Πώς να διαβάσετε τους αριθμούς
Η κύρια μέτρηση είναι το Ποσοστό Σφάλματος Λέξεων (Word Error Rate), που συνήθως συντομεύεται ως WER. Όσο χαμηλότερο, τόσο το καλύτερο. Ένα WER 5 τοις εκατό σημαίνει ότι η μεταγραφή βρίσκεται πολύ κοντά στο κείμενο αναφοράς. Ένα υψηλό WER σημαίνει ότι η μηχανή έκανε περισσότερες αντικαταστάσεις, εισαγωγές ή διαγραφές.
Για ευκολότερη σύγκριση, το ίδιο αποτέλεσμα μπορεί επίσης να εμφανιστεί ως ακρίβεια:
accuracy = max(0, 100 - WER)Αυτή η δεύτερη απεικόνιση είναι πιο εύκολη στη γρήγορη ανάγνωση, όμως το WER παραμένει η χρησιμότερη τεχνική μέτρηση, επειδή δείχνει ακριβώς πού δυσκολεύεται ένα μοντέλο.
Συνολική απόδοση
Πλήρη αποτελέσματα: και οι 98 γλώσσες
Γλώσσες με υψηλή απόδοση
Οι πιο απαιτητικές γλώσσες
Τι μετράμε
- Ποιότητα αναγνώρισης σε 98 γλώσσες
- Τη διαφορά μεταξύ Sunray και MoonRay
- Γλώσσες στις οποίες η ακρίβεια είναι ήδη αρκετά υψηλή για καθημερινούς υπότιτλους
- Γλώσσες που χρειάζονται περισσότερα δεδομένα εκπαίδευσης, κανονικοποίηση ή εξειδικευμένη διαχείριση ανά γλώσσα
- Περιπτώσεις αστοχίας στις οποίες ένα μοντέλο εισάγει περισσότερο κείμενο από όσο περιέχει ο πηγαίος ήχος
Γιατί αυτό έχει σημασία για τους υπότιτλους
Μια μηχανή υποτιτλισμού δεν αξιολογείται μόνο από το πόσο καλά χειρίζεται τα αγγλικά. Η πραγματική εμπειρία θέασης είναι πιο σύνθετη: πολύγλωσσες ταινίες, εναλλαγή γλωσσικού κώδικα, τοπικά ονόματα, ηχογραφήσεις με θόρυβο και περιεχόμενο που αλλάζει γλώσσα στη μέση μιας σκηνής.
Το Ray έχει σχεδιαστεί για αυτήν την πραγματικότητα. Τα benchmarks μάς βοηθούν να επιλέγουμε προεπιλογές, να διαμορφώνουμε προσδοκίες και να αποφασίζουμε πού πρέπει να επικεντρωθούν οι επόμενες εργασίες εκπαίδευσης και αξιολόγησης.
Το σημαντικό αποτέλεσμα για το προϊόν είναι απλό: το Ray μπορεί να επιλέγει μεταξύ ταχύτητας και ακρίβειας ανάλογα με την εργασία, ενώ και οι δύο μηχανές συνεχίζουν να βελτιώνονται καθώς περισσότερες γλώσσες περνούν από τη διαδικασία του benchmark.

