Untersuchung · Sechs Systeme · Abfrage 5. und 6. August 2026

Welche Spracherkennung empfiehlt die KI? Und woher weiß sie das?

Wir haben sechs KI-Assistenten gefragt, welche Spracherkennung Deutsch am besten kann, und jede Quelle nachgelesen, auf die sie sich berufen. Vier verschiedene Empfehlungen kamen zurück, und keine einzige belegte Fehlerrate für Deutsch.

01Die Frage

Ein Satz, sechsmal gestellt.

Am 5. und 6. August 2026, in deutscher Sprache, ohne Vorlauf und ohne Nachfrage. Der Wortlaut war jedes Mal derselbe und ist in fünf der sechs Aufnahmen im Bild zu lesen.

Was ist die beste KI für Deutsche Spracherkennung?
Die sechs Antworten mit ihrer jeweils erstgenannten Empfehlung und der Frage, ob sie für Deutsch eine Fehlerrate nennen
SystemAn erster StelleNennt es eine Fehlerrate für Deutsch?
ChatGPTOpenAIDeepgram Nova-3Keine Fehlerrate. Statt Zahlen eine Skala aus fünf Sternen, in der vier Modelle die volle Punktzahl für Deutsch bekommen.
ClaudeAnthropicElevenLabs Scribe v2Durchgehend Zahlen, mehr als bei allen anderen. Sie stammen weit überwiegend von den Anbietern der genannten Produkte.
Gemini 3.6 FlashGoogleOpenAI WhisperKein einziger Zahlenwert in der ganzen Antwort.
Google-KI-ModusGoogleOpenAI WhisperEine einzige Zahl, und die beschreibt die Trainingsdatenmenge: über 680.000 Stunden Audio.
KimiMoonshot AIGladia Solaria-3Viele Preise und Latenzen, aber genau eine Fehlerrate, und die ist auf einem englischen Telefonkorpus gemessen.
PerplexityPerplexity AIOpenAI Whisper, lokal betriebenKeine Fehlerrate. Genannt wird eine Genauigkeit von bis zu 99 Prozent, und das ist die Werbeangabe eines Anbieters.

Vier verschiedene Namen an erster Stelle: Deepgram Nova-3, ElevenLabs Scribe v2, OpenAI Whisper, Gladia Solaria-3. Drei der sechs Systeme nennen für Deutsch keine einzige Fehlerrate. Und die Systeme beantworten nicht einmal dieselbe Frage: Die eine Hälfte nennt Modelle, die andere fertige Programme, sodass Whisper und ein Programm, das Whisper benutzt, als konkurrierende Antworten nebeneinanderstehen.

02Die Quellen

Vierundzwanzig Belege, zwei echte Messungen.

Jede Quelle, die in einer der sechs Antworten sichtbar war, wurde aufgerufen und gelesen. Die Frage dabei war immer dieselbe: Hat diese Quelle selbst etwas gemessen, und wenn ja, auf Deutsch?

Genau zwei der vierundzwanzig Quellen sind eine unabhängige, nachvollziehbare Messung. Die eine, ein laufender Vergleich über 3.500 Stichproben mit offen einsehbarem Messwerkzeug, misst ausdrücklich auf Englisch und wird trotzdem als Beleg für eine deutsche Rangfolge angeführt. Die andere, ein wissenschaftlicher Vergleich über 86 Systeme und 12 Datensätze, steht in Kimis Trefferliste an neunter Stelle und schafft es in keinen Satz der Antwort. Alles andere ist Herstellerseite, Anbieterblog, Werkzeugverzeichnis oder ein Video.

Das Muster ist zirkulär. In drei von sechs Antworten ist die Quelle, die den Sieger belegt, die Seite des Siegers. Der Google-KI-Modus empfiehlt Voicy und belegt es mit Voicys eigenem Blog, in dem Voicy auf Platz eins steht. Kimi empfiehlt Gladia Solaria-3 und belegt es viermal mit Gladias Blog. Gemini und der KI-Modus stützen ihre Whisper-Aussage auf den Blogbeitrag eines Transkriptionsanbieters, der sich in demselben Beitrag selbst auf Platz eins setzt. Wer die Antwort ernst nimmt, liest eine Verkaufsaussage, die einmal durch ein Sprachmodell gelaufen ist und dabei ihre Herkunft verloren hat.

Bei den Zahlen wird es enger. Claude ist das einzige System, das durchgehend Fehlerraten nennt, und nennt für einen unabhängigen Test vom Juli 2026 die Werte 6,4 Prozent und 7,0 Prozent. Beide im Bild genannten Quellen wurden gelesen. Belegbar ist genau dies und nicht mehr: Keine der beiden enthält diese Zahlen. Die eine führt an derselben Stelle 3,3 Prozent und listet das erstgenannte Modell überhaupt nicht, die andere kommt auf 2,2 und 2,6 Prozent.

Was unter einem Beleg steht, wenn man ihn aufklappt

Gemini stützt seine gesamte Antwort auf zwei Quellen. Die eine ist der Blog eines Anbieters, die andere ein Agenturartikel über KI-Sprechstimmen, der das Thema Spracherkennung nicht behandelt. Unter Geminis Satz, Whisper lasse sich auch lokal auf dem eigenen Rechner betreiben, steht als Beleg genau dieser Artikel, und der aufgeklappte Hinweis zeigt daraus:

„Welche KI-Voiceover-Tools gibt es auf Deutsch? … ( Kopf & Stift, 2026 / Gradually.ai, 2026) * 5. Narakeet – Einzigartig für Schweizerdeutsch.“
Quellenhinweis in der Gemini-Antwort vom 5. August 2026, aufgeklappt unter der Aussage über den lokalen Betrieb von Whisper. Der Hinweis zeigt die Karte einer fremden Seite und steht deshalb als Zitat hier und nicht als Bild.

Ein Anbieter verbietet, seine eigene Antwort zu zeigen

Von den sechs untersuchten Systemen untersagt genau eines in seinen Nutzungsbedingungen die Wiedergabe seiner Oberfläche und jede geschäftliche Nutzung. Die Antwort ist deshalb ausgewertet, aber nicht abgebildet. Dass ein Anbieter das Zeigen seiner eigenen Auskunft untersagt, ist selbst ein Befund über die Nachprüfbarkeit solcher Auskünfte.

Perplexity (Perplexity AI), Bildschirmfoto vom 5. August 2026, Modellstand im Bild nicht ausgewiesen, Prompt „Was ist die beste KI für Deutsche Spracherkennung?“: An erster Stelle steht „OpenAI Whisper (lokal betrieben)“. Die Antwort stützt sich auf zehn Quellen, darunter mehrfach den Verzeichniseintrag „Whisper im Test“ von ki-syndikat.de. Keine der zehn ist eine Messung; die genannte Genauigkeit von bis zu 99 Prozent ist die Werbeangabe eines Anbieters. Es besteht keine Verbindung zwischen Raven und Perplexity AI.
03Die Aufnahmen

Sieben Bildschirmfotos, jedes mit seinem Befund.

Jede Aufnahme ist auf den Antwortbereich zugeschnitten. Weg sind Seitenleisten, Verlauf und die Quellenkarten Dritter; verändert ist nichts. Über jedem Bild steht der eine Satz, den es belegt, darunter Anbieter, Datum und Prompt.

ChatGPT gibt vier Modellen fünf von fünf Sternen für Deutsch und nennt dabei keine einzige Fehlerrate. Die drei Belege unter der Empfehlung sind die Produktseiten der drei empfohlenen Anbieter.

Antwort von ChatGPT mit einer Tabelle aus fünf Modellen, jeweils mit Sternebewertung für Deutsch, Echtzeit und lokalen Betrieb, darunter Empfehlungen nach Anwendungsfall
Bildschirmfoto vom 5. August 2026, ChatGPT (OpenAI), Modellstand im Bild nicht ausgewiesen, Prompt: „Was ist die beste KI für Deutsche Spracherkennung?“. Ausschnitt: Antwortbereich. ChatGPT und das ChatGPT-Logo sind Marken der OpenAI OpCo, LLC. Es besteht keine Verbindung zwischen Raven und OpenAI.

Claude ist das einzige der sechs Systeme, das für Deutsch durchgehend Fehlerraten nennt. Die beiden Werte für Scribe v2, 3,1 Prozent auf FLEURS und 5,5 Prozent auf Common Voice, stammen wörtlich von der Produktseite des Anbieters.

Antwort von Claude, gegliedert in Cloud-Modelle und lokal betreibbare Modelle, mit Prozentangaben zur Wortfehlerrate und kleinen Quellenmarken hinter den Sätzen
Bildschirmfoto vom 6. August 2026, Claude (Anthropic), Modellstand im Bild nicht ausgewiesen, Prompt: „Was ist die beste KI für Deutsche Spracherkennung?“. Ausschnitt: Antwortbereich, erster Teil. Claude und das Claude-Logo sind Marken der Anthropic PBC. Es besteht keine Verbindung zwischen Raven und Anthropic.

Claude liefert die Einschränkung zu den eigenen Zahlen selbst mit: fast alle genannten Werte stammten von den Anbietern, unabhängige Tests wichen typischerweise um zwei bis drei Prozentpunkte ab.

Schluss derselben Claude-Antwort mit einem Absatz über zwei Einschränkungen und einer Rückfrage an den Nutzer
Bildschirmfoto vom 6. August 2026, Claude (Anthropic), Modellstand im Bild nicht ausgewiesen, Prompt: „Was ist die beste KI für Deutsche Spracherkennung?“. Ausschnitt: Antwortbereich, Schluss der Antwort. Claude und das Claude-Logo sind Marken der Anthropic PBC. Es besteht keine Verbindung zwischen Raven und Anthropic.

Kimis Erstplatzierter ist Gladia Solaria-3, und der Beleg dafür ist Gladias eigener Blog. Die einzige Fehlerrate der Antwort, 49,8 Prozent, stammt aus demselben Anbieterblog und bezieht sich auf ein englisches Telefonkorpus. Das ist die Aussage des Modells und nicht unsere; wir haben sie nicht nachgeprüft.

Antwort von Kimi, gegliedert nach Genauigkeit, Echtzeit, Preis, Datenschutz und Fachvokabular, mit einer Entscheidungstabelle am Ende
Bildschirmfoto vom 5. August 2026, Kimi (Moonshot AI), Modellstand im Bild nicht ausgewiesen, Prompt: „Was ist die beste KI für Deutsche Spracherkennung?“. Ausschnitt: Antwortbereich. Kimi und das Kimi-Logo sind Marken der Moonshot AI. Es besteht keine Verbindung zwischen Raven und Moonshot AI.

Kimi hält seinen eigenen Weg fest: Es sucht im Netz, bekommt fünfzehn Ergebnisse und hat die Rangfolge, Whisper als Goldstandard und Gladia Solaria-3 an der Spitze, schon vor dem ersten Satz der Antwort beisammen.

Aufgeklappte Denkschritte derselben Kimi-Antwort mit dem Hinweis auf eine Websuche und fünfzehn Ergebnissen
Bildschirmfoto vom 5. August 2026, Kimi (Moonshot AI), Modellstand im Bild nicht ausgewiesen, Prompt: „Was ist die beste KI für Deutsche Spracherkennung?“. Ausschnitt: Antwortbereich mit den Denkschritten vor der Antwort. Kimi und das Kimi-Logo sind Marken der Moonshot AI. Es besteht keine Verbindung zwischen Raven und Moonshot AI.

Gemini beantwortet die Frage nach Spracherkennung mit einer Tabelle, in der zwei von vier Zeilen Sprachsynthese sind, und nennt in der gesamten Antwort keinen einzigen Zahlenwert.

Geteilte Gemini-Antwort mit Erstellungsdatum, einer vierzeiligen Tabelle nach Anwendungsbereich und drei ausführlichen Abschnitten darunter
Bildschirmfoto einer am 5. August 2026 um 09:53 Uhr erstellten Antwort, Gemini (Google), Modell 3.6 Flash, Prompt: „Was ist die beste KI für Deutsche Spracherkennung?“. Ausschnitt: Antwortbereich. Google, Gemini und das Google-Logo sind Marken von Google LLC. Es besteht keine Verbindung zwischen Raven und Google.

Die Aussage, Whisper sei die derzeit beste und präziseste KI auf dem Markt, trägt als Beleg den Blog eines Transkriptionsanbieters. Die einzige Zahl der gesamten Antwort beschreibt die Trainingsdatenmenge und nicht die Genauigkeit.

Antwort des Google-KI-Modus mit einem Absatz über Whisper und einer Liste von Werkzeugen nach Einsatzzweck
Bildschirmfoto vom 6. August 2026, 09:50 Uhr, Google-KI-Modus (Google Suche), Modellstand im Bild nicht ausgewiesen, Prompt: „Was ist die beste KI für Deutsche Spracherkennung?“. Ausschnitt: Antwortbereich. Google und das Google-Logo sind Marken von Google LLC. Es besteht keine Verbindung zwischen Raven und Google.
04Die Gegenprobe

Welche der genannten Modelle wir selbst gemessen haben.

Vier Spalten, vier Antworten auf dieselbe Frage. Wer der Beste ist, hängt davon ab, welche Spalte man sortiert. Genau das nennt keine der sechs Antworten.

12 von 15 genannten Modellen sind bei uns gemessen · Platz bezieht sich auf alle 49 gemessenen Modelle · sortiert nach Wortfehlerrate (WER) aufsteigend

In den KI-Antworten genannte Modelle mit unseren eigenen Messwerten, darunter die auf Deutsch nachtrainierten Modelle, die kein System genannt hat
Genanntes ModellWortfehler · Platz im FeldZeichenfehlerTempoKosten / 1.000 min
ElevenLabs Scribe v2genannt von ChatGPT, Claude, Kimi4,6 %Platz 4 von 492,03 %8,8×3,37 €
AssemblyAI Universal-3.5 Progenannt von Claude, Perplexity4,9 %Platz 7 von 492,35 %2,0×3,22 €
Mistral Voxtral Transcribe 2genannt von Claude5,1 %Platz 11 von 492,56 %12,2×2,76 €
Microsoft Azure AI Speechgenannt von Gemini5,1 %Platz 12 von 492,55 %9,2×5,52 €
Gladia Solaria-3genannt von KimiKimi nennt Solaria-3; gemessen ist Solaria-1, das Modell, das Gladias Batch-Schnittstelle liefert. Einen Modellwähler hat sie nicht.5,3 %Platz 16 von 492,79 %2,7×9,35 €
Google Cloud Speech-to-Textgenannt von Perplexity5,5 %Platz 18 von 492,87 %5,5×14,72 €
OpenAI GPT-4o Transcribegenannt von ChatGPT, Perplexity5,6 %Platz 23 von 492,91 %11,7×1,60 €
Whisper large-v3-turbogenannt von Claude, Kimi, Perplexity5,7 %Platz 24 von 492,49 %46,1×eigene GPU
Speechmatics Melia-1genannt von Claude, Kimi5,8 %Platz 25 von 492,93 %7,5×15,95 €
OpenAI Whisper large-v3genannt von alle sechs6,2 %Platz 32 von 493,62 %9,4×eigene GPU
NVIDIA Parakeet-TDT-0.6B-v3genannt von Claude6,6 %Platz 34 von 492,41 %65,4×eigene GPU
Deepgram Nova-3genannt von ChatGPT, Kimi, Perplexity8,0 %Platz 42 von 493,79 %26,6×3,96 €
Deepgram Fluxgenannt von Claude, KimiDeepgrams Echtzeit-Modell, ein anderes Produkt als Nova-3.nicht gemessen
ElevenLabs Scribe v2 Realtimegenannt von Claude, KimiEin anderes Produkt als Scribe v2 darüber: der Echtzeit-Zweig, den wir nicht gemessen haben.nicht gemessen
Speechmatics Ursa 2genannt von ClaudeGemessen sind Melia-1 und Enhanced. „Ursa 2“ ist eine Modell­generation, kein wählbares Modell: die Schnittstelle kennt nur Standard, Enhanced und Melia-1, und welche Generation dahinter steht, nennt der Hersteller nicht. Deshalb steht hier keine Zahl statt einer geratenen.nicht gemessen
Von niemandem genannt, von uns gemessen

Der ruhigste Befund der Untersuchung steht in der Gegenrichtung: Auf die Frage nach der besten KI für deutsche Spracherkennung nennt keines der sechs Systeme ein Modell, das eigens auf Deutsch nachtrainiert wurde. In unserer Reihe laufen 4 davon mit.

Whisper-LV3 German5,1 %Platz 13 von 491,88 %33,9×eigene GPU
Whisper-LV3-Turbo German5,7 %Platz 24 von 492,49 %46,1×eigene GPU
Parakeet German5,9 %Platz 26 von 492,24 %65,8×eigene GPU
Moonshine Streaming Small DE7,5 %Platz 41 von 492,86 %26,0×eigene GPU

Zuordnung, keine Wertung: die Tabelle enthält nur, was in den sechs Antworten gefallen ist, und nicht die volle Bestenliste. Ein Modell, das bei uns über zwei Wege läuft, steht mit dem besseren der beiden.

Der Stand dieser Untersuchung ist der 5. und 6. August 2026. Fünf Wochen alte Auskünfte eines Sprachmodells sind eine Momentaufnahme, und wir behaupten nicht, dass die sechs Systeme heute dasselbe antworten. Wir fragen sie deshalb erneut und schreiben das Datum oben fort. Was wir selbst messen und wie, steht in der Methodik; die Modelle dahinter in der Wertung zur deutschen Spracherkennung.

STT-Benchmark · 01.09.2026 · jede Zahl unabhängig nachprüfbar