Skip to main content
Thư viện

Đang phát · Benchmark

Benchmark ASR của Ray: 98 ngôn ngữ, kết quả đầy đủ

Tổng quan ngắn gọn về cách Sunray và MoonRay được đánh giá trên một benchmark nhận dạng giọng nói đa ngôn ngữ quy mô lớn.

Ray Team20 THG 3, 20264 min read

Hai engine, một nhiệm vụ

Ray sử dụng hai engine nhận dạng giọng nói vì không phải mọi quy trình làm phụ đề đều cần sự đánh đổi giống nhau.

Sunray (trước đây là Ray Max) được tinh chỉnh để ưu tiên độ chính xác. Đây là engine dành cho các ngôn ngữ ít tài nguyên, tư liệu lưu trữ, công việc làm phụ đề chuyên nghiệp và mọi trường hợp mà văn bản cần sát với âm thanh lời nói nhất có thể.

MoonRay (trước đây là Ray Turbo) được tinh chỉnh để ưu tiên tốc độ. Đây là engine dành cho việc xem trực tiếp, xem trước nhanh và xử lý hàng loạt quy mô lớn, khi việc nhanh chóng có được phụ đề dùng được là điều quan trọng.

Benchmark trong bài viết này so sánh cả hai engine trên 98 ngôn ngữ bằng cùng một quy trình đánh giá cho mọi model. Mục tiêu không phải là đưa ra một tuyên bố mơ hồ rằng Ray hỗ trợ đa ngôn ngữ. Mục tiêu là cung cấp một phương pháp có thể lặp lại để quan sát cách các engine hoạt động trên nhiều hệ chữ viết, giọng địa phương và ngữ hệ.

Lưu ý: các biểu đồ bên dưới được tạo trước khi các engine đổi thương hiệu, vì vậy phần chú giải vẫn hiển thị tên cũ — Ray Max hiện là Sunray và Ray Turbo hiện là MoonRay.

Cách đọc các con số

Chỉ số chính là Tỷ lệ lỗi từ, thường được viết tắt là WER. Càng thấp càng tốt. WER ở mức 5 phần trăm có nghĩa là bản chép lời rất sát với văn bản tham chiếu. WER cao có nghĩa là engine đã tạo ra nhiều lỗi thay thế, chèn thêm hoặc xóa hơn.

Để dễ so sánh hơn, cùng một kết quả cũng có thể được hiển thị dưới dạng độ chính xác:

accuracy = max(0, 100 - WER)

Cách biểu diễn thứ hai dễ xem nhanh hơn, nhưng WER vẫn là chỉ số kỹ thuật hữu ích hơn vì nó cho biết chính xác model đang gặp khó khăn ở đâu.

Hiệu năng tổng thể

Kết quả đầy đủ: toàn bộ 98 ngôn ngữ

Các ngôn ngữ có hiệu năng cao

Các ngôn ngữ khó xử lý nhất

Những gì chúng tôi đo lường

  • Chất lượng nhận dạng trên 98 ngôn ngữ
  • Sự khác biệt giữa Sunray và MoonRay
  • Những ngôn ngữ đã có độ chính xác đủ cao cho phụ đề hằng ngày
  • Những ngôn ngữ cần thêm dữ liệu huấn luyện, chuẩn hóa hoặc cách xử lý riêng theo ngôn ngữ
  • Các trường hợp thất bại khi model chèn nhiều văn bản hơn lượng nội dung có trong âm thanh nguồn

Vì sao điều này quan trọng đối với phụ đề

Một engine phụ đề không chỉ được đánh giá qua khả năng xử lý tiếng Anh. Trải nghiệm xem thực tế phức tạp hơn: phim đa ngôn ngữ, chuyển đổi ngôn ngữ, tên gọi theo vùng miền, bản ghi nhiều tạp âm và nội dung chuyển từ ngôn ngữ này sang ngôn ngữ khác giữa một cảnh.

Ray được xây dựng cho thực tế đó. Các benchmark giúp chúng tôi lựa chọn thiết lập mặc định, định hình kỳ vọng và quyết định công việc huấn luyện cũng như đánh giá tiếp theo nên tập trung vào đâu.

Kết quả quan trọng đối với sản phẩm rất đơn giản: Ray có thể lựa chọn giữa tốc độ và độ chính xác tùy theo nhiệm vụ, đồng thời cả hai engine đều tiếp tục được cải thiện khi ngày càng có nhiều ngôn ngữ đi qua quy trình benchmark.

Subscribe to the Ray newsletter. Product updates, release notes, and customer news.

No spam. Just the Ray newsletter and important product updates.

Phát tiếp theo

Xem thư viện
Ray JournalBenchmark2026-03-20

Benchmark ASR của Ray: 98 ngôn ngữ, kết quả đầy đủ

Tổng quan ngắn gọn về cách Sunray và MoonRay được đánh giá trên một benchmark nhận dạng giọng nói đa ngôn ngữ quy mô lớn.

Ray Team2026-03-204 min read

Hai engine, một nhiệm vụ

Ray sử dụng hai engine nhận dạng giọng nói vì không phải mọi quy trình làm phụ đề đều cần sự đánh đổi giống nhau.

Sunray (trước đây là Ray Max) được tinh chỉnh để ưu tiên độ chính xác. Đây là engine dành cho các ngôn ngữ ít tài nguyên, tư liệu lưu trữ, công việc làm phụ đề chuyên nghiệp và mọi trường hợp mà văn bản cần sát với âm thanh lời nói nhất có thể.

MoonRay (trước đây là Ray Turbo) được tinh chỉnh để ưu tiên tốc độ. Đây là engine dành cho việc xem trực tiếp, xem trước nhanh và xử lý hàng loạt quy mô lớn, khi việc nhanh chóng có được phụ đề dùng được là điều quan trọng.

Benchmark trong bài viết này so sánh cả hai engine trên 98 ngôn ngữ bằng cùng một quy trình đánh giá cho mọi model. Mục tiêu không phải là đưa ra một tuyên bố mơ hồ rằng Ray hỗ trợ đa ngôn ngữ. Mục tiêu là cung cấp một phương pháp có thể lặp lại để quan sát cách các engine hoạt động trên nhiều hệ chữ viết, giọng địa phương và ngữ hệ.

Lưu ý: các biểu đồ bên dưới được tạo trước khi các engine đổi thương hiệu, vì vậy phần chú giải vẫn hiển thị tên cũ — Ray Max hiện là Sunray và Ray Turbo hiện là MoonRay.

Cách đọc các con số

Chỉ số chính là Tỷ lệ lỗi từ, thường được viết tắt là WER. Càng thấp càng tốt. WER ở mức 5 phần trăm có nghĩa là bản chép lời rất sát với văn bản tham chiếu. WER cao có nghĩa là engine đã tạo ra nhiều lỗi thay thế, chèn thêm hoặc xóa hơn.

Để dễ so sánh hơn, cùng một kết quả cũng có thể được hiển thị dưới dạng độ chính xác:

accuracy = max(0, 100 - WER)

Cách biểu diễn thứ hai dễ xem nhanh hơn, nhưng WER vẫn là chỉ số kỹ thuật hữu ích hơn vì nó cho biết chính xác model đang gặp khó khăn ở đâu.

Hiệu năng tổng thể

Kết quả đầy đủ: toàn bộ 98 ngôn ngữ

Các ngôn ngữ có hiệu năng cao

Các ngôn ngữ khó xử lý nhất

Những gì chúng tôi đo lường

  • Chất lượng nhận dạng trên 98 ngôn ngữ
  • Sự khác biệt giữa Sunray và MoonRay
  • Những ngôn ngữ đã có độ chính xác đủ cao cho phụ đề hằng ngày
  • Những ngôn ngữ cần thêm dữ liệu huấn luyện, chuẩn hóa hoặc cách xử lý riêng theo ngôn ngữ
  • Các trường hợp thất bại khi model chèn nhiều văn bản hơn lượng nội dung có trong âm thanh nguồn

Vì sao điều này quan trọng đối với phụ đề

Một engine phụ đề không chỉ được đánh giá qua khả năng xử lý tiếng Anh. Trải nghiệm xem thực tế phức tạp hơn: phim đa ngôn ngữ, chuyển đổi ngôn ngữ, tên gọi theo vùng miền, bản ghi nhiều tạp âm và nội dung chuyển từ ngôn ngữ này sang ngôn ngữ khác giữa một cảnh.

Ray được xây dựng cho thực tế đó. Các benchmark giúp chúng tôi lựa chọn thiết lập mặc định, định hình kỳ vọng và quyết định công việc huấn luyện cũng như đánh giá tiếp theo nên tập trung vào đâu.

Kết quả quan trọng đối với sản phẩm rất đơn giản: Ray có thể lựa chọn giữa tốc độ và độ chính xác tùy theo nhiệm vụ, đồng thời cả hai engine đều tiếp tục được cải thiện khi ngày càng có nhiều ngôn ngữ đi qua quy trình benchmark.

Subscribe to the Ray newsletter. Product updates, release notes, and customer news.

No spam. Just the Ray newsletter and important product updates.

Đọc tiếp

Ra mắt Ray Guardian: An toàn thị giác cho hình ảnh và video10 min readVì sao mọi phụ đề bạn tải xuống đều là một canh bạc – và Ray khắc phục điều đó như thế nào3 min readCâu hỏi thường gặp về Ray: Mọi điều bạn cần biết3 min read