Skip to main content
Mediathek

Aktuelle Wiedergabe · Benchmarks

Ray ASR-Benchmark: 98 Sprachen, vollständige Ergebnisse

Ein kompakter Überblick darüber, wie Sunray und MoonRay in einem breit angelegten, mehrsprachigen Benchmark zur Spracherkennung bewertet werden.

Ray Team20. MÄRZ 20263 min read

Zwei Engines, eine Aufgabe

Ray verwendet zwei Spracherkennungs-Engines, weil nicht alle Untertitel-Workflows denselben Kompromiss erfordern.

Sunray (ehemals Ray Max) ist auf Genauigkeit optimiert. Diese Engine eignet sich für ressourcenarme Sprachen, Archivmaterial, professionelle Untertitelarbeit und alle Situationen, in denen der Text dem gesprochenen Audio so genau wie möglich entsprechen muss.

MoonRay (ehemals Ray Turbo) ist auf Geschwindigkeit optimiert. Diese Engine eignet sich für Live-Wiedergabe, schnelle Vorschauen und große Stapel, bei denen es darauf ankommt, schnell brauchbare Untertitel zu erhalten.

Der diesem Beitrag zugrunde liegende Benchmark vergleicht beide Engines in 98 Sprachen und verwendet dabei für jedes Modell denselben Bewertungsprozess. Das Ziel ist nicht die vage Behauptung, Ray sei mehrsprachig. Ziel ist vielmehr eine reproduzierbare Methode, um zu erkennen, wie sich die Engines bei vielen Schriftsystemen, Akzenten und Sprachfamilien verhalten.

Hinweis: Die folgenden Diagramme stammen aus der Zeit vor der Umbenennung der Engines. Daher zeigen ihre Legenden noch die früheren Namen — Ray Max heißt jetzt Sunray und Ray Turbo heißt jetzt MoonRay.

So sind die Zahlen zu lesen

Die wichtigste Kennzahl ist die Wortfehlerrate, üblicherweise als WER abgekürzt. Je niedriger, desto besser. Eine WER von 5 Prozent bedeutet, dass das Transkript dem Referenztext sehr nahekommt. Eine hohe WER bedeutet, dass die Engine mehr Ersetzungen, Einfügungen oder Auslassungen vorgenommen hat.

Zum einfacheren Vergleich kann dasselbe Ergebnis auch als Genauigkeit dargestellt werden:

accuracy = max(0, 100 - WER)

Diese zweite Darstellung lässt sich leichter überblicken, doch WER bleibt die nützlichere technische Kennzahl, da sie genau zeigt, wo ein Modell Schwierigkeiten hat.

Gesamtleistung

Vollständige Ergebnisse: alle 98 Sprachen

Leistungsstarke Sprachen

Anspruchsvollste Sprachen

Was wir messen

  • Erkennungsqualität in 98 Sprachen
  • Den Unterschied zwischen Sunray und MoonRay
  • Sprachen, deren Genauigkeit bereits für alltägliche Untertitel ausreicht
  • Sprachen, die mehr Trainingsdaten, Normalisierung oder sprachspezifische Verarbeitung benötigen
  • Fehlerfälle, in denen ein Modell mehr Text einfügt, als im Quellaudio enthalten ist

Warum das für Untertitel wichtig ist

Eine Untertitel-Engine wird nicht nur danach beurteilt, wie gut sie Englisch verarbeitet. Die reale Mediennutzung ist komplexer: mehrsprachige Filme, Sprachwechsel, regionale Namen, verrauschte Aufnahmen und Inhalte, die mitten in einer Szene zwischen Sprachen wechseln.

Ray wurde für diese Realität entwickelt. Benchmarks helfen uns dabei, Standardeinstellungen auszuwählen, Erwartungen festzulegen und zu entscheiden, worauf sich die nächsten Trainings- und Evaluierungsmaßnahmen konzentrieren sollten.

Das entscheidende Produktergebnis ist einfach: Ray kann je nach Aufgabe zwischen Geschwindigkeit und Genauigkeit wählen, und beide Engines werden kontinuierlich besser, während weitere Sprachen die Benchmark-Pipeline durchlaufen.

Subscribe to the Ray newsletter. Product updates, release notes, and customer news.

No spam. Just the Ray newsletter and important product updates.

Ray JournalBenchmarks2026-03-20

Ray ASR-Benchmark: 98 Sprachen, vollständige Ergebnisse

Ein kompakter Überblick darüber, wie Sunray und MoonRay in einem breit angelegten, mehrsprachigen Benchmark zur Spracherkennung bewertet werden.

Ray Team2026-03-203 min read

Zwei Engines, eine Aufgabe

Ray verwendet zwei Spracherkennungs-Engines, weil nicht alle Untertitel-Workflows denselben Kompromiss erfordern.

Sunray (ehemals Ray Max) ist auf Genauigkeit optimiert. Diese Engine eignet sich für ressourcenarme Sprachen, Archivmaterial, professionelle Untertitelarbeit und alle Situationen, in denen der Text dem gesprochenen Audio so genau wie möglich entsprechen muss.

MoonRay (ehemals Ray Turbo) ist auf Geschwindigkeit optimiert. Diese Engine eignet sich für Live-Wiedergabe, schnelle Vorschauen und große Stapel, bei denen es darauf ankommt, schnell brauchbare Untertitel zu erhalten.

Der diesem Beitrag zugrunde liegende Benchmark vergleicht beide Engines in 98 Sprachen und verwendet dabei für jedes Modell denselben Bewertungsprozess. Das Ziel ist nicht die vage Behauptung, Ray sei mehrsprachig. Ziel ist vielmehr eine reproduzierbare Methode, um zu erkennen, wie sich die Engines bei vielen Schriftsystemen, Akzenten und Sprachfamilien verhalten.

Hinweis: Die folgenden Diagramme stammen aus der Zeit vor der Umbenennung der Engines. Daher zeigen ihre Legenden noch die früheren Namen — Ray Max heißt jetzt Sunray und Ray Turbo heißt jetzt MoonRay.

So sind die Zahlen zu lesen

Die wichtigste Kennzahl ist die Wortfehlerrate, üblicherweise als WER abgekürzt. Je niedriger, desto besser. Eine WER von 5 Prozent bedeutet, dass das Transkript dem Referenztext sehr nahekommt. Eine hohe WER bedeutet, dass die Engine mehr Ersetzungen, Einfügungen oder Auslassungen vorgenommen hat.

Zum einfacheren Vergleich kann dasselbe Ergebnis auch als Genauigkeit dargestellt werden:

accuracy = max(0, 100 - WER)

Diese zweite Darstellung lässt sich leichter überblicken, doch WER bleibt die nützlichere technische Kennzahl, da sie genau zeigt, wo ein Modell Schwierigkeiten hat.

Gesamtleistung

Vollständige Ergebnisse: alle 98 Sprachen

Leistungsstarke Sprachen

Anspruchsvollste Sprachen

Was wir messen

  • Erkennungsqualität in 98 Sprachen
  • Den Unterschied zwischen Sunray und MoonRay
  • Sprachen, deren Genauigkeit bereits für alltägliche Untertitel ausreicht
  • Sprachen, die mehr Trainingsdaten, Normalisierung oder sprachspezifische Verarbeitung benötigen
  • Fehlerfälle, in denen ein Modell mehr Text einfügt, als im Quellaudio enthalten ist

Warum das für Untertitel wichtig ist

Eine Untertitel-Engine wird nicht nur danach beurteilt, wie gut sie Englisch verarbeitet. Die reale Mediennutzung ist komplexer: mehrsprachige Filme, Sprachwechsel, regionale Namen, verrauschte Aufnahmen und Inhalte, die mitten in einer Szene zwischen Sprachen wechseln.

Ray wurde für diese Realität entwickelt. Benchmarks helfen uns dabei, Standardeinstellungen auszuwählen, Erwartungen festzulegen und zu entscheiden, worauf sich die nächsten Trainings- und Evaluierungsmaßnahmen konzentrieren sollten.

Das entscheidende Produktergebnis ist einfach: Ray kann je nach Aufgabe zwischen Geschwindigkeit und Genauigkeit wählen, und beide Engines werden kontinuierlich besser, während weitere Sprachen die Benchmark-Pipeline durchlaufen.

Subscribe to the Ray newsletter. Product updates, release notes, and customer news.

No spam. Just the Ray newsletter and important product updates.

Weiterlesen

Ankündigung von Ray Guardian: Visuelle Sicherheit für Bilder und Videos6 min readWarum jeder Untertitel-Download ein Glücksspiel ist – und wie Ray das Problem löst2 min readRay FAQ: Alles, was Sie wissen müssen2 min read