Wortfehlerrate · Deutsches Audio · Stand 08.06.2026

Welches Modell versteht Deutsch am genauesten?

Wir spielen jedem Modell dieselben deutschen Aufnahmen vor und vergleichen das Ergebnis Wort für Wort mit der geprüften Verschriftung. Ein gemeinsamer Durchschnitt verfälscht dabei, also steht die Wortfehlerrate pro Datensatz, mit Kosten und Tempo daneben.

01Der Trade-off

Genauigkeit kostet. Finde deinen Punkt.

Eine Tabelle zeigt Rangplätze. Diese Karte zeigt, was sie dich kostet. Wähle die Achse, die für dich zählt.

0%5%10%15%20%0,1 €0,5 €1 €5 €10 €eigene GPU · kostenlos↑ GENAUER · WER %← GÜNSTIGER · € / 1000 Min

★ GPT-Audio ausgelassen (Ausreißer)

DE-SpezialistMultilingualself-hosted · eigene GPUbestes Modell
02Bestes Modell wofür

Die Messkonsole.

Ein gemeinsamer WER verfälscht. Wähl Audiotyp und Hosting, die Rangfolge richtet sich danach.

48 Modelle · Gesamt · sortiert nach WERBestes für dieses Dataset DE-Spezialistself-hostedAufnahmen nicht gewertet · Wert antippen
ModellGesamtKostenTempoSprachenHosting
WERCER
Qwen3-ASR-Flash · Sync
DashScope
1,93 €5,4×MULTIAPI
Qwen3-ASR-Flash · Datei
DashScope
1,77 €1,5×MULTIAPI
Cohere Transcribe 03-2026
Cohere · 3090
eigene GPU50×MULTISELF
Scribe v2
ElevenLabs
3,37 €8,8×MULTIAPI
Whisper-LV3 German
primeline · Modal
eigene GPU9,6×DESELF
CrisperWhisper
nyrahealth · Modal
eigene GPU3,3×MULTISELF
Universal-3.5 Pro
AssemblyAI
3,22 €2×MULTIAPI
Qwen3-Omni-Flash
DashScope
4,69 €4,5×MULTIAPI
Whisper-LV3-Turbo German
primeline · Modal
eigene GPU16,1×DESELF
Prerecorded
Reson8
3,33 €24,9×MULTIAPI
Voxtral-Mini 2602
Mistral · EU
2,76 €12,2×MULTIEU
MAI-Transcribe 1.5
Azure
5,52 €9,2×MULTIAPI
Whisper-LV3 German
primeline · 3090
eigene GPU33,9×DESELF
Voxtral-Mini 2507
Mistral · EU
1,84 €8,3×MULTIEU
Universal-2
AssemblyAI
4,14 €2,2×MULTIAPI
Solaria-1
Gladia · EU
9,35 €2,7×MULTIEU
Parakeet German
primeline · Modal
eigene GPU35,9×DESELF
Chirp 3
Google · OpenRouter
14,72 €5,5×MULTIAPI
Amazon Transcribe
AWS
22,08 €1×MULTIAPI
Whisper-1
OpenAI
5,52 €10,1×MULTIAPI
Gemini 3.5 Transcribe
Google
4,60 €3,7×MULTIAPI
GPT-4o-mini-transcribe
OpenAI
1,60 €11,7×MULTIAPI
Whisper-LV3-Turbo German
primeline · 3090
eigene GPU46,1×DESELF
Melia 1
Speechmatics
15,95 €7,5×MULTIAPI
Parakeet German
primeline · 3090
eigene GPU65,8×DESELF
Canary 1B v2
NVIDIA · 3090
eigene GPU23,9×MULTISELF
Qwen3-ASR-1.7B
Qwen · Modal
eigene GPU7,1×MULTISELF
Gemini 2.5 Flash
Google
0,67 €7,2×MULTIAPI
Enhanced
Speechmatics
15,95 €5,9×MULTIAPI
Chirp 3
Google · EU
14,72 €8,7×MULTIAPI
Whisper-LV3
OpenAI · Modal
eigene GPU9,4×MULTISELF
Voxtral-Mini-3B
Mistral · Modal
eigene GPU8,2×MULTISELF
Parakeet-TDT 0.6B v3
NVIDIA · 3090
eigene GPU65,4×MULTISELF
Whisper-LV3-Turbo
Groq
0,61 €29×MULTIAPI
Qwen3-ASR-1.7B
Qwen · 3090
eigene GPU29,9×MULTISELF
Whisper-LV3
OpenAI · 3090
eigene GPU31,9×MULTISELF
Granite Speech 4.1 2B+
IBM · 3090
eigene GPU28,5×MULTISELF
Voxtral-Mini-3B
Mistral · 3090
eigene GPU19×MULTISELF
Qwen3-Omni-Turbo
DashScope
7,85 €4,4×MULTIAPI
Moonshine Streaming Small DE
Moonshine · 3090
eigene GPU26×DESELF
Nova-3 (EU)
Deepgram · EU
3,96 €26,6×MULTIEU
Phi-4-Multimodal
Microsoft · 3090
eigene GPU13,3×MULTISELF
Nova-3 (US)
Deepgram
3,96 €8,2×MULTIAPI
GPT-4o-transcribe-diarize
OpenAI
2,4×MULTIAPI
MOSS Transcribe-Diarize
OpenMOSS · 3090
eigene GPU29,4×MULTISELF
Nemotron 3.5 ASR Streaming 0.6B
NVIDIA · 3090
eigene GPU17,7×MULTISELF
Voxtral-Small 2507
Mistral · EU
0,08 €16,8×MULTIEU
GPT-Audio
OpenAI
49,09 €8,1×MULTIAPI
WER strict · CER · normalisiert · pro Dataset gemessenGPU = auf derselben Grafikkarte gemessen, untereinander vergleichbar. NET = Antwortzeit eines fremden Rechenzentrums samt Netzweg, dieselbe Einheit, andere Messung.

48 Modelle sind in dieser Runde durchgelaufen, alle auf identischem Audio und mit identischer Metrik. Was in den Korpora steckt, auf denen hier gemessen wird, steht in der Korpus-Übersicht; wie gerechnet wird, in der Methodik. Die Mundart-Wertung und die Sprechertrennung stellen dieselben Modelle vor zwei andere Aufgaben.

STT-Benchmark · 08.06.2026 · jede Zahl unabhängig nachprüfbar