अभी चल रहा है · बेंचमार्क
Ray ASR बेंचमार्क: 98 भाषाएँ, संपूर्ण परिणाम
व्यापक बहुभाषी वाक् पहचान बेंचमार्क में Sunray और MoonRay के मूल्यांकन का संक्षिप्त अवलोकन।
दो इंजन, एक काम
Ray दो वाक् पहचान इंजनों का उपयोग करता है, क्योंकि सभी सबटाइटल वर्कफ़्लो में गति और सटीकता के बीच एक जैसे संतुलन की आवश्यकता नहीं होती।
Sunray (पूर्व नाम Ray Max) को सटीकता के लिए अनुकूलित किया गया है। यह कम संसाधनों वाली भाषाओं, अभिलेखीय सामग्री, पेशेवर सबटाइटल कार्य और ऐसे किसी भी अवसर के लिए बनाया गया इंजन है, जहाँ टेक्स्ट को बोले गए ऑडियो के यथासंभव करीब होना चाहिए।
MoonRay (पूर्व नाम Ray Turbo) को गति के लिए अनुकूलित किया गया है। यह लाइव देखने, तेज़ पूर्वावलोकन और बड़े बैचों के लिए बनाया गया इंजन है, जहाँ जल्दी उपयोग योग्य सबटाइटल प्राप्त करना महत्वपूर्ण होता है।
इस पोस्ट के आधारभूत बेंचमार्क में हर मॉडल के लिए समान मूल्यांकन प्रक्रिया का उपयोग करते हुए दोनों इंजनों की 98 भाषाओं में तुलना की गई है। इसका उद्देश्य केवल यह अस्पष्ट दावा करना नहीं है कि Ray बहुभाषी है। इसका उद्देश्य यह देखने का एक दोहराने योग्य तरीका प्रदान करना है कि ये इंजन विभिन्न लिपियों, उच्चारणों और भाषा परिवारों में कैसा प्रदर्शन करते हैं।
नोट: नीचे दिए गए चार्ट इंजन की रीब्रांडिंग से पहले के हैं, इसलिए उनके संकेतकों में अब भी पुराने नाम दिखाई देते हैं — Ray Max अब Sunray है और Ray Turbo अब MoonRay है।
आँकड़ों को कैसे समझें
मुख्य मेट्रिक शब्द त्रुटि दर है, जिसे आम तौर पर WER कहा जाता है। कम मान बेहतर होता है। 5 प्रतिशत WER का अर्थ है कि ट्रांसक्रिप्ट संदर्भ टेक्स्ट के बहुत करीब है। अधिक WER का अर्थ है कि इंजन ने ज़्यादा प्रतिस्थापन, प्रविष्टियाँ या विलोपन किए हैं।
आसान तुलना के लिए उसी परिणाम को सटीकता के रूप में भी दिखाया जा सकता है:
accuracy = max(0, 100 - WER)दूसरे रूप को एक नज़र में समझना आसान है, लेकिन WER अब भी अधिक उपयोगी इंजीनियरिंग मेट्रिक है, क्योंकि यह ठीक-ठीक दिखाता है कि किसी मॉडल को कहाँ कठिनाई हो रही है।
समग्र प्रदर्शन
संपूर्ण परिणाम: सभी 98 भाषाएँ
उच्च प्रदर्शन वाली भाषाएँ
सबसे चुनौतीपूर्ण भाषाएँ
हम क्या मापते हैं
- 98 भाषाओं में पहचान की गुणवत्ता
- Sunray और MoonRay के बीच अंतर
- वे भाषाएँ जिनमें सटीकता रोज़मर्रा के सबटाइटल के लिए पहले से पर्याप्त है
- वे भाषाएँ जिन्हें अधिक प्रशिक्षण डेटा, सामान्यीकरण या भाषा-विशिष्ट प्रबंधन की आवश्यकता है
- विफलता के वे मामले जहाँ मॉडल स्रोत ऑडियो में मौजूद टेक्स्ट से अधिक टेक्स्ट जोड़ देता है
सबटाइटल के लिए यह क्यों महत्वपूर्ण है
किसी सबटाइटल इंजन का आकलन केवल इस आधार पर नहीं किया जाता कि वह अंग्रेज़ी को कितनी अच्छी तरह संभालता है। वास्तविक परिस्थितियाँ अधिक जटिल होती हैं: बहुभाषी फ़िल्में, कोड-स्विचिंग, क्षेत्रीय नाम, शोर वाली रिकॉर्डिंग और ऐसा कॉन्टेंट जो दृश्य के बीच में एक भाषा से दूसरी भाषा में चला जाता है।
Ray इसी वास्तविकता के लिए बनाया गया है। बेंचमार्क हमें डिफ़ॉल्ट विकल्प चुनने, अपेक्षाएँ निर्धारित करने और यह तय करने में मदद करते हैं कि अगला प्रशिक्षण और मूल्यांकन कार्य कहाँ केंद्रित होना चाहिए।
उत्पाद से जुड़ा महत्वपूर्ण परिणाम सरल है: Ray काम के आधार पर गति और सटीकता में से चुन सकता है, और जैसे-जैसे अधिक भाषाएँ बेंचमार्क पाइपलाइन से गुज़रती हैं, दोनों इंजनों में सुधार जारी रहता है।

