Mundart. Wo die Bestenliste ihre Ordnung verliert.
Dieselben Modelle, dasselbe Maß, nur das Audio ist anders. Der Vorlese-Wert jedes Modells steht in der Tabelle daneben, denn der Vergleich, auf den es hier ankommt, findet innerhalb eines Modells statt und nicht zwischen zweien.
Mundart. Eine eigene Wertung.
Dieselben Modelle wie in der Bestenliste, soweit sie auf Mundart gemessen sind, dasselbe Maß, nur das Audio ist anders. Der Vorlese-Wert steht daneben, damit der Sprung pro Modell sichtbar wird.
Auf vorgelesenem Hochdeutsch trennen die besten Modelle nur wenige Zehntel Prozentpunkte. Im Korpus Schweizer Parlament liegen die dort gemessenen 47 Modelle zwischen 28,4 % und 82,6 % Fehlerquote. Die Spanne gilt nur für diese eine Spalte; die zweite Schweizer Sammlung ist anders gebaut und wird nicht dazugerechnet.
Und die Rangfolge ist eine andere. Qwen3-ASR-Flash · Sync führt auf Vorlesedeutsch und landet im Korpus Schweizer Parlament auf Platz 7 von 47. Wer ein Modell nach der Bestenliste auswählt, wählt das Modell mit dem engsten Ohr. Wir zeigen das, weil wir selbst darauf hereingefallen wären.
Auf Bairisch gibt es keinen Gewinner. Wir haben dieselben Sätze von derselben Person einmal auf Bairisch und einmal auf Hochdeutsch aufnehmen lassen. Es ändert sich also nichts außer der Mundart. Über alle 46 gemessenen Modelle steigt die Fehlerquote um das 1,9- bis 6,3-Fache, ohne eine einzige Ausnahme, und selbst das beste Modell liegt noch bei 54,0 %. Die Prozentzahl allein taugt dabei nicht als Bairisch-Bestenliste: dafür ist es eine Stimme zu wenig. Der Aufschlag daneben schon, denn er hält alles außer der Mundart konstant.
47 Modelle mit Mundart-Messung · Schweizer Parlament · sortiert nach Mundart · Schweizer Parlament aufsteigend
| Modell▲ | Vorlesedeutsch▲ | SPC▲ |
|---|---|---|
| 7,0 % | 28,4 %★ | |
| 6,2 % | 28,4 %★ | |
Qwen3-ASR-Flash · Datei DashScope | 3,8 % | 29,6 % |
| 4,8 % | 30,0 % | |
Whisper-1 OpenAI | 5,6 % | 30,7 % |
Solaria-1 Gladia · EU | 5,3 % | 31,4 % |
Qwen3-ASR-Flash · Sync DashScope | 3,7 % | 31,6 % |
Whisper-LV3-Turbo Groq | 6,9 % | 32,3 % |
| 5,1 % | 32,3 % | |
MAI-Transcribe 1.5 Azure | 5,1 % | 32,6 % |
| 5,2 % | 32,7 % | |
| 4,2 % | 33,0 % | |
Scribe v2 ElevenLabs | 4,6 % | 33,3 % |
Melia 1 Speechmatics | 5,8 % | 33,3 % |
| 5,7 % | 33,8 % | |
| 4,9 % | 34,0 % | |
| 6,3 % | 34,3 % | |
| 7,4 % | 34,4 % | |
| 4,6 % | 34,7 % | |
| 5,1 % | 35,2 % | |
Prerecorded Reson8 | 5,0 % | 35,6 % |
GPT-4o-mini-transcribe OpenAI | 5,6 % | 35,9 % |
Qwen3-Omni-Flash DashScope | 4,9 % | 36,3 % |
| 7,5 % | 36,6 % | |
Amazon Transcribe AWS | 5,6 % | 37,1 % |
| 6,6 % | 38,0 % | |
Enhanced Speechmatics | 6,1 % | 38,2 % |
| 5,4 % | 38,2 % | |
| 5,9 % | 38,8 % | |
Universal-3.5 Pro AssemblyAI | 4,9 % | 40,5 % |
GPT-4o-transcribe-diarize OpenAI | 8,4 % | 41,8 % |
Universal-2 AssemblyAI | 5,2 % | 44,5 % |
| 6,0 % | 44,9 % | |
| 7,0 % | 45,9 % | |
Gemini 3.5 Transcribe Google | 5,6 % | 46,0 % |
| 16,3 % | 46,2 % | |
GPT-Audio OpenAI | 29,8 % | 51,5 % |
Gemini 2.5 Flash Google | 6,1 % | 53,3 % |
| 9,8 % | 54,5 % | |
Chirp 3 Google · EU | 6,1 % | 54,9 % |
| 6,0 % | 56,8 % | |
Nova-3 (EU) Deepgram · EU | 8,0 % | 58,2 % |
Nova-3 (US) Deepgram | 8,0 % | 58,2 % |
Qwen3-Omni-Turbo DashScope | 7,4 % | 61,6 % |
| 8,0 % | 69,5 % | |
| 15,1 % | 77,3 % | |
| 7,1 % | 82,6 % |
Nicht gemessen: Für 1 von 48 Modellen der Bestenliste liegt auf keinem Mundart-Datensatz eine Messung vor. Solche Modelle fehlen in der Tabelle. Das heißt nicht, dass sie die Aufgabe bestanden haben, sondern nur, dass sie noch nicht angetreten sind. Warum, steht jeweils dahinter: Chirp 3: Zugang über den Wiederverkäufer ausgeschöpft. Dasselbe Modell ist über den Google-Direktzugang (Chirp 3, EU) auf allen vier Datensätzen gemessen.
Die Mundart-Datensätze fließen bewusst nicht in die Gesamtnote ein. Die Fehlerquoten liegen hier um ein Vielfaches höher und würden den Mittelwert allein bestimmen, sodass die Note nicht mehr mit früheren Messungen oder mit öffentlichen Ranglisten vergleichbar wäre. Mundart steht deshalb hier, in einer eigenen Wertung, und sie ist die interessantere.
Keiner der Mundart-Datensätze fließt in die Gesamtnote der Spracherkennung ein, und die drei haben ausdrücklich keine gemeinsame Skala. Was in ihnen steckt, steht in der Korpus-Übersicht; wie gerechnet wird, in der Methodik.
STT-Benchmark · 08.06.2026 · jede Zahl unabhängig nachprüfbar












