Wortfehlerrate · Schweizerdeutsch und Bairisch · Stand 08.06.2026

Mundart. Wo die Bestenliste ihre Ordnung verliert.

Dieselben Modelle, dasselbe Maß, nur das Audio ist anders. Der Vorlese-Wert jedes Modells steht in der Tabelle daneben, denn der Vergleich, auf den es hier ankommt, findet innerhalb eines Modells statt und nicht zwischen zweien.

01Der Härtetest · Schweizerdeutsch und Bairisch

Mundart. Eine eigene Wertung.

Dieselben Modelle wie in der Bestenliste, soweit sie auf Mundart gemessen sind, dasselbe Maß, nur das Audio ist anders. Der Vorlese-Wert steht daneben, damit der Sprung pro Modell sichtbar wird.

Auf vorgelesenem Hochdeutsch trennen die besten Modelle nur wenige Zehntel Prozentpunkte. Im Korpus Schweizer Parlament liegen die dort gemessenen 47 Modelle zwischen 28,4 % und 82,6 % Fehlerquote. Die Spanne gilt nur für diese eine Spalte; die zweite Schweizer Sammlung ist anders gebaut und wird nicht dazugerechnet.

Und die Rangfolge ist eine andere. Qwen3-ASR-Flash · Sync führt auf Vorlesedeutsch und landet im Korpus Schweizer Parlament auf Platz 7 von 47. Wer ein Modell nach der Bestenliste auswählt, wählt das Modell mit dem engsten Ohr. Wir zeigen das, weil wir selbst darauf hereingefallen wären.

Auf Bairisch gibt es keinen Gewinner. Wir haben dieselben Sätze von derselben Person einmal auf Bairisch und einmal auf Hochdeutsch aufnehmen lassen. Es ändert sich also nichts außer der Mundart. Über alle 46 gemessenen Modelle steigt die Fehlerquote um das 1,9- bis 6,3-Fache, ohne eine einzige Ausnahme, und selbst das beste Modell liegt noch bei 54,0 %. Die Prozentzahl allein taugt dabei nicht als Bairisch-Bestenliste: dafür ist es eine Stimme zu wenig. Der Aufschlag daneben schon, denn er hält alles außer der Mundart konstant.

47 Modelle mit Mundart-Messung · Schweizer Parlament · sortiert nach Mundart · Schweizer Parlament aufsteigend

ModellVorlesedeutschSPC
Whisper-LV3
OpenAI · 3090
7,0 %28,4 %
Whisper-LV3
OpenAI · Modal
6,2 %28,4 %
Qwen3-ASR-Flash · Datei
DashScope
3,8 %29,6 %
CrisperWhisper
nyrahealth · Modal
4,8 %30,0 %
Whisper-1
OpenAI
5,6 %30,7 %
Solaria-1
Gladia · EU
5,3 %31,4 %
Qwen3-ASR-Flash · Sync
DashScope
3,7 %31,6 %
Whisper-LV3-Turbo
Groq
6,9 %32,3 %
Voxtral-Mini 2602
Mistral · EU
5,1 %32,3 %
MAI-Transcribe 1.5
Azure
5,1 %32,6 %
Voxtral-Mini 2507
Mistral · EU
5,2 %32,7 %
Cohere Transcribe 03-2026
Cohere · 3090
4,2 %33,0 %
Scribe v2
ElevenLabs
4,6 %33,3 %
Melia 1
Speechmatics
5,8 %33,3 %
Whisper-LV3-Turbo German
primeline · 3090
5,7 %33,8 %
Whisper-LV3-Turbo German
primeline · Modal
4,9 %34,0 %
Voxtral-Mini-3B
Mistral · Modal
6,3 %34,3 %
Voxtral-Mini-3B
Mistral · 3090
7,4 %34,4 %
Whisper-LV3 German
primeline · Modal
4,6 %34,7 %
Whisper-LV3 German
primeline · 3090
5,1 %35,2 %
Prerecorded
Reson8
5,0 %35,6 %
GPT-4o-mini-transcribe
OpenAI
5,6 %35,9 %
Qwen3-Omni-Flash
DashScope
4,9 %36,3 %
Moonshine Streaming Small DE
Moonshine · 3090
7,5 %36,6 %
Amazon Transcribe
AWS
5,6 %37,1 %
Parakeet-TDT 0.6B v3
NVIDIA · 3090
6,6 %38,0 %
Enhanced
Speechmatics
6,1 %38,2 %
Parakeet German
primeline · Modal
5,4 %38,2 %
Parakeet German
primeline · 3090
5,9 %38,8 %
Universal-3.5 Pro
AssemblyAI
4,9 %40,5 %
GPT-4o-transcribe-diarize
OpenAI
8,4 %41,8 %
Universal-2
AssemblyAI
5,2 %44,5 %
Qwen3-ASR-1.7B
Qwen · Modal
6,0 %44,9 %
Qwen3-ASR-1.7B
Qwen · 3090
7,0 %45,9 %
Gemini 3.5 Transcribe
Google
5,6 %46,0 %
Voxtral-Small 2507
Mistral · EU
16,3 %46,2 %
GPT-Audio
OpenAI
29,8 %51,5 %
Gemini 2.5 Flash
Google
6,1 %53,3 %
MOSS Transcribe-Diarize
OpenMOSS · 3090
9,8 %54,5 %
Chirp 3
Google · EU
6,1 %54,9 %
Canary 1B v2
NVIDIA · 3090
6,0 %56,8 %
Nova-3 (EU)
Deepgram · EU
8,0 %58,2 %
Nova-3 (US)
Deepgram
8,0 %58,2 %
Qwen3-Omni-Turbo
DashScope
7,4 %61,6 %
Phi-4-Multimodal
Microsoft · 3090
8,0 %69,5 %
Nemotron 3.5 ASR Streaming 0.6B
NVIDIA · 3090
15,1 %77,3 %
Granite Speech 4.1 2B+
IBM · 3090
7,1 %82,6 %

Nicht gemessen: Für 1 von 48 Modellen der Bestenliste liegt auf keinem Mundart-Datensatz eine Messung vor. Solche Modelle fehlen in der Tabelle. Das heißt nicht, dass sie die Aufgabe bestanden haben, sondern nur, dass sie noch nicht angetreten sind. Warum, steht jeweils dahinter: Chirp 3: Zugang über den Wiederverkäufer ausgeschöpft. Dasselbe Modell ist über den Google-Direktzugang (Chirp 3, EU) auf allen vier Datensätzen gemessen.

Die Mundart-Datensätze fließen bewusst nicht in die Gesamtnote ein. Die Fehlerquoten liegen hier um ein Vielfaches höher und würden den Mittelwert allein bestimmen, sodass die Note nicht mehr mit früheren Messungen oder mit öffentlichen Ranglisten vergleichbar wäre. Mundart steht deshalb hier, in einer eigenen Wertung, und sie ist die interessantere.

Keiner der Mundart-Datensätze fließt in die Gesamtnote der Spracherkennung ein, und die drei haben ausdrücklich keine gemeinsame Skala. Was in ihnen steckt, steht in der Korpus-Übersicht; wie gerechnet wird, in der Methodik.

STT-Benchmark · 08.06.2026 · jede Zahl unabhängig nachprüfbar