Raven versteht Deutsch. Gemessen, nicht behauptet.
5,9%
Wortfehlerrate auf deutschem Audio
Die Spracherkennung läuft auf eigener Infrastruktur, ohne US-Dienste im Datenpfad. Gemessen wird mit einem offenen Werkzeug, jede Zahl lässt sich nachrechnen.
Die Wertungen
Zwei eigene Zahlen. Jede mit ihrer Rangliste.
Spracherkennung Deutsch
Wie genau ein Modell deutsches Audio verschriftet, pro Datensatz, mit Kosten und Tempo daneben.
Zur WertungDiarisierungsfehlerrate8,07 %Ravens Wert · auf echten deutschen MeetingsSprechertrennung
Wer hat wann gesprochen. Raven nimmt jeden Teilnehmer auf einer eigenen Spur auf, deshalb ist die Referenz gemessen und nicht geschätzt.
Zur WertungHärtetest50 Modellegemessen im Korpus Schweizer ParlamentMundart
Schweizerdeutsch und Bairisch: dasselbe Maß, nur das Audio ist anders.
Zur WertungUntersuchung2 von 24Quellen sind eine unabhängige MessungWas die KI-Assistenten antworten
Sechs KI-Assistenten, eine Frage nach deutscher Spracherkennung, jede genannte Quelle nachgelesen.
Zur Wertung23 Häuser, 51 Modelle, dasselbe Audio und dieselbe Metrik.
- AssemblyAI
- AWS
- Microsoft Azure
- Cohere
- IBM
- Microsoft
- Moonshine
- NVIDIA
- OpenAI
- OpenMOSS
- primeline
- Qwen
- Mistral
- DashScope
- Deepgram
- ElevenLabs
- Gladia
- Groq
- nyra health
- Reson8
- Speechmatics
- xAI
Wo ein Kürzel statt eines Zeichens steht, gibt der Hersteller seine Marke für Vergleichsseiten nicht frei.
Warum wir selbst messen
Hersteller messen sich selbst. Wir messen nach.
Herstellerzahlen fallen erwartbar gut aus. Deshalb spielen wir jedem Modell dieselben deutschen Aufnahmen vor, rechnen mit demselben offenen Werkzeug und veröffentlichen jede Zahl pro Datensatz. So wissen wir, was in Raven läuft, und du kannst es nachprüfen.
Die Datensätze
Jede Zahl pro Datensatz.
Ein Durchschnitt über alles verwischt, wofür ein Modell taugt. Was in einem Korpus steckt, steht auf der Wertung, die darauf misst.
Wie wir messen
Vier Prinzipien. Alle nachprüfbar.
Jedes Modell hört dieselben Aufnahmen, das Ergebnis wird Wort für Wort mit der geprüften Verschriftung verglichen. Der Durchschnitt über einen Datensatz ist nach Länge gewichtet.
- 01
Eigene Messungen
Keine Herstellerzahlen. Jedes Modell selbst getestet, auf identischem Audio.
- 02
Echtes deutsches Audio
Parlamentsreden, Hörbücher, vorgelesene Sätze und echte Meetings.
- 03
Ein Verfahren für alle
Selbst betrieben und per Schnittstelle, gleiche Daten, gleiche Metrik. Leere Zellen bleiben leer.
- 04
Offene Methodik
Werkzeug, Datensätze und Scorer sind öffentlich. Jede Zahl führt auf ihren Lauf zurück.
- WER
- Anteil falsch verstandener, ausgelassener und erfundener Wörter. Niedriger ist besser.
- DER
- Anteil der Sprechzeit, die dem falschen Sprecher zugeordnet ist. Niedriger ist besser.
- RTFx
- Minuten Audio pro Minute Rechenzeit. Höher ist schneller.
Und jetzt dein Audio
Hör selbst, wie Raven deine Meetings versteht.
Raven nimmt jeden Sprecher auf einer eigenen Spur auf, die Hauptverarbeitung läuft in Deutschland. Dieselbe Messdisziplin, angewendet auf dein Audio.
Raven kostenlos testenJede Zahl auf diesen Seiten stammt aus einem eigenen Lauf. Das Werkzeug dafür ist öffentlich: Wer eine Zahl anzweifelt, kann sie selbst nachmessen.
STT-Benchmark · 18.09.2026 · jede Zahl unabhängig nachprüfbar














