Welche Spracherkennung empfiehlt die KI? Und woher weiß sie das?
Wir haben sechs KI-Assistenten gefragt, welche Spracherkennung Deutsch am besten kann, und jede Quelle nachgelesen, auf die sie sich berufen. Vier verschiedene Empfehlungen kamen zurück, und keine einzige belegte Fehlerrate für Deutsch.
Ein Satz, sechsmal gestellt.
Am 5. und 6. August 2026, in deutscher Sprache, ohne Vorlauf und ohne Nachfrage. Der Wortlaut war jedes Mal derselbe und ist in fünf der sechs Aufnahmen im Bild zu lesen.
„Was ist die beste KI für Deutsche Spracherkennung?“
| System | An erster Stelle | Nennt es eine Fehlerrate für Deutsch? |
|---|---|---|
| ChatGPTOpenAI | Deepgram Nova-3 | Keine Fehlerrate. Statt Zahlen eine Skala aus fünf Sternen, in der vier Modelle die volle Punktzahl für Deutsch bekommen. |
| ClaudeAnthropic | ElevenLabs Scribe v2 | Durchgehend Zahlen, mehr als bei allen anderen. Sie stammen weit überwiegend von den Anbietern der genannten Produkte. |
| Gemini 3.6 FlashGoogle | OpenAI Whisper | Kein einziger Zahlenwert in der ganzen Antwort. |
| Google-KI-ModusGoogle | OpenAI Whisper | Eine einzige Zahl, und die beschreibt die Trainingsdatenmenge: über 680.000 Stunden Audio. |
| KimiMoonshot AI | Gladia Solaria-3 | Viele Preise und Latenzen, aber genau eine Fehlerrate, und die ist auf einem englischen Telefonkorpus gemessen. |
| PerplexityPerplexity AI | OpenAI Whisper, lokal betrieben | Keine Fehlerrate. Genannt wird eine Genauigkeit von bis zu 99 Prozent, und das ist die Werbeangabe eines Anbieters. |
Vier verschiedene Namen an erster Stelle: Deepgram Nova-3, ElevenLabs Scribe v2, OpenAI Whisper, Gladia Solaria-3. Drei der sechs Systeme nennen für Deutsch keine einzige Fehlerrate. Und die Systeme beantworten nicht einmal dieselbe Frage: Die eine Hälfte nennt Modelle, die andere fertige Programme, sodass Whisper und ein Programm, das Whisper benutzt, als konkurrierende Antworten nebeneinanderstehen.
Vierundzwanzig Belege, zwei echte Messungen.
Jede Quelle, die in einer der sechs Antworten sichtbar war, wurde aufgerufen und gelesen. Die Frage dabei war immer dieselbe: Hat diese Quelle selbst etwas gemessen, und wenn ja, auf Deutsch?
Genau zwei der vierundzwanzig Quellen sind eine unabhängige, nachvollziehbare Messung. Die eine, ein laufender Vergleich über 3.500 Stichproben mit offen einsehbarem Messwerkzeug, misst ausdrücklich auf Englisch und wird trotzdem als Beleg für eine deutsche Rangfolge angeführt. Die andere, ein wissenschaftlicher Vergleich über 86 Systeme und 12 Datensätze, steht in Kimis Trefferliste an neunter Stelle und schafft es in keinen Satz der Antwort. Alles andere ist Herstellerseite, Anbieterblog, Werkzeugverzeichnis oder ein Video.
Das Muster ist zirkulär. In drei von sechs Antworten ist die Quelle, die den Sieger belegt, die Seite des Siegers. Der Google-KI-Modus empfiehlt Voicy und belegt es mit Voicys eigenem Blog, in dem Voicy auf Platz eins steht. Kimi empfiehlt Gladia Solaria-3 und belegt es viermal mit Gladias Blog. Gemini und der KI-Modus stützen ihre Whisper-Aussage auf den Blogbeitrag eines Transkriptionsanbieters, der sich in demselben Beitrag selbst auf Platz eins setzt. Wer die Antwort ernst nimmt, liest eine Verkaufsaussage, die einmal durch ein Sprachmodell gelaufen ist und dabei ihre Herkunft verloren hat.
Bei den Zahlen wird es enger. Claude ist das einzige System, das durchgehend Fehlerraten nennt, und nennt für einen unabhängigen Test vom Juli 2026 die Werte 6,4 Prozent und 7,0 Prozent. Beide im Bild genannten Quellen wurden gelesen. Belegbar ist genau dies und nicht mehr: Keine der beiden enthält diese Zahlen. Die eine führt an derselben Stelle 3,3 Prozent und listet das erstgenannte Modell überhaupt nicht, die andere kommt auf 2,2 und 2,6 Prozent.
Was unter einem Beleg steht, wenn man ihn aufklappt
Gemini stützt seine gesamte Antwort auf zwei Quellen. Die eine ist der Blog eines Anbieters, die andere ein Agenturartikel über KI-Sprechstimmen, der das Thema Spracherkennung nicht behandelt. Unter Geminis Satz, Whisper lasse sich auch lokal auf dem eigenen Rechner betreiben, steht als Beleg genau dieser Artikel, und der aufgeklappte Hinweis zeigt daraus:
„Welche KI-Voiceover-Tools gibt es auf Deutsch? … ( Kopf & Stift, 2026 / Gradually.ai, 2026) * 5. Narakeet – Einzigartig für Schweizerdeutsch.“
Ein Anbieter verbietet, seine eigene Antwort zu zeigen
Von den sechs untersuchten Systemen untersagt genau eines in seinen Nutzungsbedingungen die Wiedergabe seiner Oberfläche und jede geschäftliche Nutzung. Die Antwort ist deshalb ausgewertet, aber nicht abgebildet. Dass ein Anbieter das Zeigen seiner eigenen Auskunft untersagt, ist selbst ein Befund über die Nachprüfbarkeit solcher Auskünfte.
Perplexity (Perplexity AI), Bildschirmfoto vom 5. August 2026, Modellstand im Bild nicht ausgewiesen, Prompt „Was ist die beste KI für Deutsche Spracherkennung?“: An erster Stelle steht „OpenAI Whisper (lokal betrieben)“. Die Antwort stützt sich auf zehn Quellen, darunter mehrfach den Verzeichniseintrag „Whisper im Test“ von ki-syndikat.de. Keine der zehn ist eine Messung; die genannte Genauigkeit von bis zu 99 Prozent ist die Werbeangabe eines Anbieters. Es besteht keine Verbindung zwischen Raven und Perplexity AI.
Sieben Bildschirmfotos, jedes mit seinem Befund.
Jede Aufnahme ist auf den Antwortbereich zugeschnitten. Weg sind Seitenleisten, Verlauf und die Quellenkarten Dritter; verändert ist nichts. Über jedem Bild steht der eine Satz, den es belegt, darunter Anbieter, Datum und Prompt.
ChatGPT gibt vier Modellen fünf von fünf Sternen für Deutsch und nennt dabei keine einzige Fehlerrate. Die drei Belege unter der Empfehlung sind die Produktseiten der drei empfohlenen Anbieter.

Claude ist das einzige der sechs Systeme, das für Deutsch durchgehend Fehlerraten nennt. Die beiden Werte für Scribe v2, 3,1 Prozent auf FLEURS und 5,5 Prozent auf Common Voice, stammen wörtlich von der Produktseite des Anbieters.

Claude liefert die Einschränkung zu den eigenen Zahlen selbst mit: fast alle genannten Werte stammten von den Anbietern, unabhängige Tests wichen typischerweise um zwei bis drei Prozentpunkte ab.

Kimis Erstplatzierter ist Gladia Solaria-3, und der Beleg dafür ist Gladias eigener Blog. Die einzige Fehlerrate der Antwort, 49,8 Prozent, stammt aus demselben Anbieterblog und bezieht sich auf ein englisches Telefonkorpus. Das ist die Aussage des Modells und nicht unsere; wir haben sie nicht nachgeprüft.

Kimi hält seinen eigenen Weg fest: Es sucht im Netz, bekommt fünfzehn Ergebnisse und hat die Rangfolge, Whisper als Goldstandard und Gladia Solaria-3 an der Spitze, schon vor dem ersten Satz der Antwort beisammen.

Gemini beantwortet die Frage nach Spracherkennung mit einer Tabelle, in der zwei von vier Zeilen Sprachsynthese sind, und nennt in der gesamten Antwort keinen einzigen Zahlenwert.

Die Aussage, Whisper sei die derzeit beste und präziseste KI auf dem Markt, trägt als Beleg den Blog eines Transkriptionsanbieters. Die einzige Zahl der gesamten Antwort beschreibt die Trainingsdatenmenge und nicht die Genauigkeit.

Welche der genannten Modelle wir selbst gemessen haben.
Vier Spalten, vier Antworten auf dieselbe Frage. Wer der Beste ist, hängt davon ab, welche Spalte man sortiert. Genau das nennt keine der sechs Antworten.
12 von 15 genannten Modellen sind bei uns gemessen · Platz bezieht sich auf alle 49 gemessenen Modelle · sortiert nach Wortfehlerrate (WER) aufsteigend
| Genanntes Modell▲ | Wortfehler · Platz im Feld▲ | Zeichenfehler▲ | Tempo▲ | Kosten / 1.000 min▲ |
|---|---|---|---|---|
| ElevenLabs Scribe v2genannt von ChatGPT, Claude, Kimi | 4,6 %Platz 4 von 49 | 2,03 % | 8,8× | 3,37 € |
| AssemblyAI Universal-3.5 Progenannt von Claude, Perplexity | 4,9 %Platz 7 von 49 | 2,35 % | 2,0× | 3,22 € |
| Mistral Voxtral Transcribe 2genannt von Claude | 5,1 %Platz 11 von 49 | 2,56 % | 12,2× | 2,76 € |
| Microsoft Azure AI Speechgenannt von Gemini | 5,1 %Platz 12 von 49 | 2,55 % | 9,2× | 5,52 € |
| Gladia Solaria-3genannt von KimiKimi nennt Solaria-3; gemessen ist Solaria-1, das Modell, das Gladias Batch-Schnittstelle liefert. Einen Modellwähler hat sie nicht. | 5,3 %Platz 16 von 49 | 2,79 % | 2,7× | 9,35 € |
| Google Cloud Speech-to-Textgenannt von Perplexity | 5,5 %Platz 18 von 49 | 2,87 % | 5,5× | 14,72 € |
| OpenAI GPT-4o Transcribegenannt von ChatGPT, Perplexity | 5,6 %Platz 23 von 49 | 2,91 % | 11,7× | 1,60 € |
| Whisper large-v3-turbogenannt von Claude, Kimi, Perplexity | 5,7 %Platz 24 von 49 | 2,49 % | 46,1× | eigene GPU |
| Speechmatics Melia-1genannt von Claude, Kimi | 5,8 %Platz 25 von 49 | 2,93 % | 7,5× | 15,95 € |
| OpenAI Whisper large-v3genannt von alle sechs | 6,2 %Platz 32 von 49 | 3,62 % | 9,4× | eigene GPU |
| NVIDIA Parakeet-TDT-0.6B-v3genannt von Claude | 6,6 %Platz 34 von 49 | 2,41 % | 65,4× | eigene GPU |
| Deepgram Nova-3genannt von ChatGPT, Kimi, Perplexity | 8,0 %Platz 42 von 49 | 3,79 % | 26,6× | 3,96 € |
| Deepgram Fluxgenannt von Claude, KimiDeepgrams Echtzeit-Modell, ein anderes Produkt als Nova-3. | nicht gemessen | – | – | – |
| ElevenLabs Scribe v2 Realtimegenannt von Claude, KimiEin anderes Produkt als Scribe v2 darüber: der Echtzeit-Zweig, den wir nicht gemessen haben. | nicht gemessen | – | – | – |
| Speechmatics Ursa 2genannt von ClaudeGemessen sind Melia-1 und Enhanced. „Ursa 2“ ist eine Modellgeneration, kein wählbares Modell: die Schnittstelle kennt nur Standard, Enhanced und Melia-1, und welche Generation dahinter steht, nennt der Hersteller nicht. Deshalb steht hier keine Zahl statt einer geratenen. | nicht gemessen | – | – | – |
Von niemandem genannt, von uns gemessen Der ruhigste Befund der Untersuchung steht in der Gegenrichtung: Auf die Frage nach der besten KI für deutsche Spracherkennung nennt keines der sechs Systeme ein Modell, das eigens auf Deutsch nachtrainiert wurde. In unserer Reihe laufen 4 davon mit. | ||||
| Whisper-LV3 German | 5,1 %Platz 13 von 49 | 1,88 % | 33,9× | eigene GPU |
| Whisper-LV3-Turbo German | 5,7 %Platz 24 von 49 | 2,49 % | 46,1× | eigene GPU |
| Parakeet German | 5,9 %Platz 26 von 49 | 2,24 % | 65,8× | eigene GPU |
| Moonshine Streaming Small DE | 7,5 %Platz 41 von 49 | 2,86 % | 26,0× | eigene GPU |
Zuordnung, keine Wertung: die Tabelle enthält nur, was in den sechs Antworten gefallen ist, und nicht die volle Bestenliste. Ein Modell, das bei uns über zwei Wege läuft, steht mit dem besseren der beiden.
Der Stand dieser Untersuchung ist der 5. und 6. August 2026. Fünf Wochen alte Auskünfte eines Sprachmodells sind eine Momentaufnahme, und wir behaupten nicht, dass die sechs Systeme heute dasselbe antworten. Wir fragen sie deshalb erneut und schreiben das Datum oben fort. Was wir selbst messen und wie, steht in der Methodik; die Modelle dahinter in der Wertung zur deutschen Spracherkennung.
STT-Benchmark · 01.09.2026 · jede Zahl unabhängig nachprüfbar







