กำลังเล่น · การทดสอบประสิทธิภาพ
เกณฑ์มาตรฐาน ASR ของ Ray: ผลลัพธ์ฉบับเต็มสำหรับ 98 ภาษา
ภาพรวมแบบกระชับเกี่ยวกับการประเมิน Sunray และ MoonRay ด้วยเกณฑ์มาตรฐานการรู้จำเสียงพูดหลายภาษาที่ครอบคลุม
สองเอนจิน หนึ่งภารกิจ
Ray ใช้เอนจินรู้จำเสียงพูดสองแบบ เพราะเวิร์กโฟลว์การสร้างคำบรรยายไม่ได้ต้องการจุดสมดุลแบบเดียวกันทั้งหมด
Sunray (เดิมชื่อ Ray Max) ได้รับการปรับแต่งเพื่อความแม่นยำ โดยเป็นเอนจินสำหรับภาษาที่มีทรัพยากรจำกัด สื่อจดหมายเหตุ งานคำบรรยายระดับมืออาชีพ และทุกสถานการณ์ที่ข้อความต้องใกล้เคียงกับเสียงพูดมากที่สุด
MoonRay (เดิมชื่อ Ray Turbo) ได้รับการปรับแต่งเพื่อความเร็ว โดยเป็นเอนจินสำหรับการรับชมสด การแสดงตัวอย่างอย่างรวดเร็ว และการประมวลผลชุดใหญ่ที่จำเป็นต้องได้คำบรรยายพร้อมใช้งานโดยเร็ว
เกณฑ์มาตรฐานที่อยู่เบื้องหลังโพสต์นี้เปรียบเทียบเอนจินทั้งสองใน 98 ภาษา โดยใช้กระบวนการประเมินแบบเดียวกันกับทุกโมเดล เป้าหมายไม่ใช่การกล่าวอ้างอย่างคลุมเครือว่า Ray รองรับหลายภาษา แต่คือการสร้างวิธีที่ทำซ้ำได้เพื่อดูว่าเอนจินทำงานอย่างไรกับระบบการเขียน สำเนียง และตระกูลภาษาที่หลากหลาย
หมายเหตุ: แผนภูมิด้านล่างจัดทำขึ้นก่อนการเปลี่ยนชื่อเอนจิน ดังนั้นคำอธิบายแผนภูมิจึงยังแสดงชื่อเดิมอยู่ — ปัจจุบัน Ray Max คือ Sunray และ Ray Turbo คือ MoonRay
วิธีอ่านตัวเลข
เมตริกหลักคืออัตราความผิดพลาดของคำ หรือเรียกโดยย่อว่า WER ยิ่งต่ำยิ่งดี WER ที่ 5 เปอร์เซ็นต์หมายความว่าข้อความถอดเสียงใกล้เคียงกับข้อความอ้างอิงมาก ส่วน WER ที่สูงหมายความว่าเอนจินมีการแทนที่ แทรก หรือลบคำมากกว่า
เพื่อให้เปรียบเทียบได้ง่ายขึ้น ผลลัพธ์เดียวกันยังสามารถแสดงเป็นค่าความแม่นยำได้ด้วย:
accuracy = max(0, 100 - WER)มุมมองแบบที่สองนี้อ่านได้ง่ายกว่า แต่ WER ยังคงเป็นเมตริกทางวิศวกรรมที่มีประโยชน์มากกว่า เพราะแสดงให้เห็นอย่างชัดเจนว่าโมเดลกำลังมีปัญหาตรงจุดใด
ประสิทธิภาพโดยรวม
ผลลัพธ์ฉบับเต็ม: ทั้ง 98 ภาษา
ภาษาที่มีประสิทธิภาพสูง
ภาษาที่ท้าทายที่สุด
สิ่งที่เราวัด
- คุณภาพการรู้จำใน 98 ภาษา
- ความแตกต่างระหว่าง Sunray และ MoonRay
- ภาษาที่มีความแม่นยำสูงเพียงพอสำหรับคำบรรยายที่ใช้ในชีวิตประจำวันแล้ว
- ภาษาที่ต้องการข้อมูลฝึกเพิ่มเติม การปรับให้อยู่ในรูปแบบมาตรฐาน หรือการจัดการเฉพาะภาษา
- กรณีที่ล้มเหลวซึ่งโมเดลแทรกข้อความมากกว่าที่มีอยู่ในเสียงต้นฉบับ
เหตุใดสิ่งนี้จึงสำคัญต่อคำบรรยาย
เอนจินคำบรรยายไม่ได้รับการตัดสินจากความสามารถในการจัดการภาษาอังกฤษเพียงอย่างเดียว การรับชมจริงมีความซับซ้อนกว่านั้น ทั้งภาพยนตร์หลายภาษา การสลับภาษา ชื่อเฉพาะตามภูมิภาค เสียงบันทึกที่มีสัญญาณรบกวน และเนื้อหาที่เปลี่ยนภาษาในระหว่างฉาก
Ray สร้างขึ้นเพื่อรองรับความเป็นจริงนี้ เกณฑ์มาตรฐานช่วยให้เราเลือกค่าเริ่มต้น กำหนดความคาดหวัง และตัดสินใจว่างานฝึกและประเมินผลลำดับถัดไปควรมุ่งไปที่จุดใด
ผลลัพธ์สำคัญในแง่ผลิตภัณฑ์นั้นเรียบง่าย: Ray สามารถเลือกระหว่างความเร็วกับความแม่นยำตามลักษณะงาน และเอนจินทั้งสองจะพัฒนาต่อไปเมื่อมีภาษาจำนวนมากขึ้นผ่านกระบวนการทดสอบตามเกณฑ์มาตรฐาน

