Das beste Modell ist nicht das bekannteste.
Die großen, bekannten STT-Modelle sind Generalisten, über Dutzende Sprachen optimiert und für Deutsch selten die erste Wahl. Wir messen selbst, auf echtem deutschem Audio, und legen jede Zahl offen.
Die Frage ist nicht „wer ist Platz 1“, sondern „bestes Modell wofür“.
Hersteller messen sich selbst. Wir messen nach.
Hersteller berichten ihre Benchmark-Zahlen selbst, und die fallen erwartbar gut aus. Deshalb messen wir regelmäßig nach: flächendeckend über den Markt, offene Modelle auf eigener Infrastruktur, geschlossene APIs mit denselben Fixtures gegengemessen, damit unsere Kunden immer das aktuell beste Modell bekommen, nicht das bekannteste. Raven ist bewusst hersteller-unabhängig gebaut und setzt auf Open Source, damit deine Daten in der EU bleiben und du nicht an einen Anbieter gekettet bist.
Genauigkeit kostet. Finde deinen Punkt.
Eine Tabelle zeigt Rangplätze. Diese Karte zeigt, was sie dich kostet. Wähle die Achse, die für dich zählt.
★ GPT-Audio ausgelassen (Ausreißer)
Die Messkonsole.
Ein gemeinsamer WER verfälscht. Wähl Audiotyp und Hosting, die Rangfolge richtet sich danach.
| Modell▲ | WER · Gesamt▲ | CER · Gesamt▲ | Kosten▲ | Tempo▲ | Sprachen▲ | Hosting▲ |
|---|---|---|---|---|---|---|
Qwen3-ASR-Flash · Sync DashScope | 4,1 %★ | 2,0 % | 1,93 € | 6,3× | MULTI | API |
Qwen3-ASR-Flash · Datei DashScope | 4,2 % | 2,0 % | 1,77 € | 1,5× | MULTI | API |
| 5,1 % | 2,1 % | eigene GPU | 9,6× | DE | SELF | |
| 5,4 % | 2,6 % | eigene GPU | 3,3× | MULTI | SELF | |
Qwen3-Omni-Flash DashScope | 5,5 % | 3,0 % | 4,69 € | 4,5× | MULTI | API |
| 5,8 % | 2,9 % | eigene GPU | 16,1× | DE | SELF | |
Gladia Gladia · EU | 6,1 % | 3,3 % | 9,35 € | 2,8× | MULTI | EU |
Universal-2 AssemblyAI | 6,2 % | 3,5 % | 4,14 € | 2,2× | MULTI | API |
| 6,2 % | 3,2 % | 1,84 € | 8,3× | MULTI | EU | |
| 6,2 % | 3,2 % | 2,76 € | 8,8× | MULTI | EU | |
Whisper-1 OpenAI | 6,2 % | 3,2 % | 5,52 € | 10,1× | MULTI | API |
| 6,3 % | 2,7 % | eigene GPU | 35,9× | DE | SELF | |
Chirp 3 (via OpenRouter) Google · OpenRouter | 6,5 % | 3,6 % | 14,72 € | 5,5× | MULTI | API |
GPT-4o-mini-transcribe OpenAI | 6,7 % | 3,7 % | 1,60 € | 12,8× | MULTI | API |
| 6,9 % | 3,3 % | eigene GPU | 7,1× | MULTI | SELF | |
Gemini 2.5 Flash Google | 7,1 % | 3,4 % | 0,67 € | 7,2× | MULTI | API |
| 7,5 % | 3,7 % | eigene GPU | 8,2× | MULTI | SELF | |
| 7,5 % | 4,5 % | eigene GPU | 9,4× | MULTI | SELF | |
Qwen3-Omni-Turbo DashScope | 7,9 % | 3,8 % | 7,85 € | 4,4× | MULTI | API |
Whisper-LV3-Turbo Groq | 8,1 % | 4,7 % | 0,61 € | 29× | MULTI | API |
GPT-4o-transcribe-diarize OpenAI | 9,7 % | 4,8 % | – | 2,4× | MULTI | API |
Nova (EU) Deepgram · EU | 9,7 % | 4,9 % | 3,96 € | 27,9× | MULTI | EU |
Nova (US) Deepgram | 9,8 % | 4,9 % | 3,96 € | 8,8× | MULTI | API |
| 18,9 % | 13,1 % | 0,08 € | 24,9× | MULTI | EU | |
GPT-Audio OpenAI | 49,2 % | 36,5 % | 50,87 € | 8× | MULTI | API |
Warum ein Durchschnitt lügt.
Jedes Dataset misst eine andere Schwierigkeit, von sauber vorgelesenen Sätzen bis zu frei gesprochener Rede. Ein gemittelter WER mischt alles und verschweigt, wofür ein Modell wirklich taugt. Keines dieser Sets ist ein echtes Meeting; zusammen sind sie eine Untergrenze für die deutsche Wortfehlerrate.
Vorgelesene Sätze aus dem Google FLEURS-Datensatz. Sauber artikuliert, kontrollierte Aufnahmebedingungen, misst die Grundgenauigkeit auf klarer Lesesprache.
google/fleursMultilingual LibriSpeech, professionell eingelesene Hörbücher. Lange, sauber gelesene Passagen, neben FLEURS die einfachste Disziplin. Modelle, die mit spontaner Sprache kämpfen, holen sich hier ihre Punkte zurück, deshalb lügt der Gesamtdurchschnitt.
facebook/multilingual_librispeechDer meistzitierte deutsche ASR-Benchmark (flozi00 & primeLine): CommonVoice-Aufnahmen und Hörbücher, neu transkribiert. Gemischte Quellen, aber durchweg gelesene Sprache, schwerer als reine Lesesätze, jedoch nicht spontan und kein Meeting. Ein allgemeines Genauigkeits-Signal.
flozi00/asr-german-mixed-evalsFrei gesprochene Parlamentsreden mit Saalakustik, Versprechern und Fülllauten. Von den vier am nächsten an echtem gesprochenem Deutsch, formell und kein Meeting, aber der realistischste Test hier.
facebook/voxpopuliWer wann spricht, gemessen als Diarization Error Rate auf offenen, von jedem nachrechenbaren Sets, reproduziert im öffentlichen raven.eval-Toolkit. DER ist dataset-relativ, und das Protokoll entscheidet: ohne angegebenen Collar und Overlap-Regel ist eine DER-Zahl Rauschen, unsere bewegt sich allein durch den Collar um rund 7 pp. Keines dieser Sets ist ein echtes Meeting mit starker Überlappung, genau dort ist Ravens Aufnahme pro Spur der reale Vorteil.
Der Standard-Benchmark für Diarisierung: Rundfunk, Panels und Debatten „in the wild“. Wir fahren pyannotes community-1-Modell und messen mit unserem eigenen Scorer exakt die Zahl, die der Hersteller selbst berichtet, dieselbe Metrik (kein Collar, Overlap gewertet), auf committeten RTTMs nachrechenbar. Der Beweis, dass unser Messstand stimmt, bevor wir etwas Eigenes behaupten.
diarizers-community/voxconverseDeutsche Telefongespräche, der deutsche Anker. community-1 landet zwischen pyannote 3.1 (19,0 %) und dem kommerziellen pyannoteAI/precision-2 (8,3 %), genau wo ein offenes Modell hingehört. Protokoll nach dem ETH-Benchmark (arXiv 2509.26177). Dasselbe Audio liest bei Collar 0,0 20,58 % statt 16,08 %, ~7 pp allein durch die Konvention, deshalb steht der Collar immer dabei.
talkbank/callhomeVier-Sprecher-Meetings (CC-BY), am nächsten an echter Meeting-Dynamik. Der Lauf ist noch nicht promoted; die Zahl erscheint hier, sobald sie im raven.eval-Toolkit committet und per make verify nachrechenbar ist. Kein Platzhalter-Wert bis dahin.
Prüf jede Zahl selbst nach.
github.com/PhilflowIO/raven.evalJede DER-Zahl oben hängt an den exakten RTTMs, aus denen sie berechnet wurde. make verify lädt Gold und Hypothese neu und rechnet die Werte ohne GPU und ohne gated Modell nach. Die CI macht das bei jedem Push, keine Zahl kann also von ihren Daten abdriften. Du brauchst keinen Account und kein Vertrauen in uns, nur das Repo.
make verifyZero-Setup-Re-Score ohne GPU. Prüft jede Zahl gegen ihre committeten RTTMs (±0,05 pp).make reproduce METRIC=der DATASET=voxconverse-test MODEL=pyannote-community-1Voller Neu-Lauf aus dem Roh-Audio (dein HF-Token, gated Lizenz, GPU).Eine Zahl verschweigt zu viel.
Wir messen auf mehreren unabhängigen Achsen, damit du das Modell nach deinem Trade-off wählst, nicht nach einem gemittelten Gesamtwert.
Genauigkeit WER · CER
Wie viele Wörter (WER) bzw. Zeichen (CER) das Modell falsch versteht. Niedriger ist besser, gemessen pro Dataset, nicht als ein gemittelter Wert.
Tempo RTFx
Wie viele Minuten Audio pro Minute Rechenzeit durchlaufen. 10× heißt: 10 Minuten Meeting in 1 Minute transkribiert.
Wer hat wann gesprochen DER
Ordnet jeden Satz dem richtigen Sprecher zu. Weil Raven jeden Teilnehmer auf einer eigenen Spur aufnimmt, kennen wir die richtige Antwort exakt, kein geschätztes Referenz-Audio.
Wer hat wann gesprochen. Self-hosted vor Cloud.
Eine eigene deutsche Eval. Weil Raven jeden Teilnehmer auf einer eigenen Spur aufnimmt, ist die Referenz exakt gemessen, nicht aus gemischtem Audio geschätzt.
Alle Diarizer laufen auf demselben echten deutschen Meeting-Set, eine Rangliste, direkt vergleichbar. Auf der Gesamt-DER erreicht das beste self-hostbare Modell rund die halbe Fehlerrate der Cloud-Dienste. Der Vorsprung kommt vor allem aus der Sprach-Abdeckung: es verpasst weniger echte Sprecher-Zeit, es trennt Stimmen nicht feiner. Die Aufschlüsselung steht direkt in der Tabelle: Confusion (reine Trennschärfe), Miss und FA neben der DER. Sortier nach Confusion, und das beste self-hostbare Modell führt nicht mehr, dann trennen andere sauberer.
Makro-Mittel über das gesamte saubere Meeting-Set.
| Modell | DER · Gesamt▲ | Confusion | Miss | FA | Hosting | Lizenz |
|---|---|---|---|---|---|---|
DiariZen v2nur Referenz Referenz-Bestwert, aber CC-BY-NC lizenziert, daher nur Referenz und nicht kommerziell einsetzbar. | 5,65 % | 1,32 % | 3,58 % | 0,75 % | SELF | CC-BY-NC |
Bester self-hostbarer Wert. Niedrigste DER durch bessere Sprach-Abdeckung, verpasst weniger echte Sprache. Unbegrenzte Sprecherzahl. | 8,07 %★ | 2,73 % | 2,44 % | 2,90 % | SELF | CC-BY-4.0 |
MIT-Lizenz, saubere Sprecher-Trennung. Cap 8 Sprecher. | 8,68 % | 0,59 % | 2,40 % | 5,69 % | SELF | MIT |
Harter 4-Sprecher-Cap, bricht bei vielen Sprechern stark ein. | 12,21 % | 7,61 % | 4,03 % | 0,57 % | SELF | CC-BY-4.0 |
Cloud-Dienst (Deepgram Nova-3, EU-Region), via Async-Callback gemessen. | 12,94 % | 1,27 % | 7,31 % | 4,36 % | EU | proprietary |
Cloud-Dienst (Deepgram Nova-3, US-Region), via Async-Callback gemessen. | 13,02 % | 1,38 % | 7,26 % | 4,38 % | API | proprietary |
Cloud-Dienst (EU-Region möglich). | 15,03 % | 1,40 % | 6,74 % | 6,89 % | EU | proprietary |
Cloud-Dienst (Mistral, EU). | 15,39 % | 2,31 % | 11,00 % | 2,12 % | EU | proprietary |
Cloud-Dienst. | 17,95 % | 2,81 % | 8,92 % | 6,23 % | API | proprietary |
Cloud-Dienst (EU in-region). | 21,45 % | 7,82 % | 10,46 % | 3,17 % | EU | proprietary |
Cloud-Dienst (AssemblyAI). | 23,80 % | 4,43 % | 6,62 % | 13,48 % | API | proprietary |
Cloud-Dienst (EU). | 23,81 % | 2,35 % | 18,36 % | 4,16 % | EU | proprietary |
OpenAI GPT-4o-transcribe mit ~25-Minuten-Limit. Die langen Meetings sind nicht am Stück verarbeitbar, daher nicht auf dem clean-8-Set messbar. | – | – | – | – | API | proprietary |
Der Vorsprung des besten self-hostbaren Modells liegt in der Abdeckung: es verpasst weniger echte Sprecher-Zeit. Stimmen feiner trennen (reine Verwechslung) tut es nicht. Sortier die Tabelle nach Confusion, und andere Modelle liegen vorn. Wir zeigen beide Metriken, weil beide zählen. Der Abstand auf der Gesamt-DER ist tendenziell, nicht statistisch abgesichert.
Vier Prinzipien. Keine Ausreden.
Eigene Messungen
Keine Hersteller-Zahlen, jedes Modell selbst getestet, auf identischem Audio und mit identischer Metrik.
Echtes deutsches Audio
Parlamentsreden, vorgelesene Sätze, Hörbücher und gemischte Quellen, echte Aufnahmen statt synthetischer Testsätze, von sauberer Lesesprache bis frei gesprochener Rede.
Ein Verfahren für alle
Self-hosted und kommerzielle APIs, gleiche Daten, gleiche Metriken. Wo Messungen fehlen, zeigen wir leere Zellen statt geglätteter Durchschnitte.
Offene Methodik
Aufbau und Daten sind nachvollziehbar und reproduzierbar. Jede Zahl ist auf ihr Dataset zurückführbar.
Bester gemessener WER über alle vier Datasets: 4,1 %. Kosten je 1000 Min. von 0,08 € bis 50,87 €, Tempo bis 36× Echtzeit.
Willst du wissen, welches Modell deine Meetings am besten versteht?
Raven nimmt jeden Sprecher auf einer eigenen Spur auf, routet automatisch zum passenden Modell und hält die Auswertung in Deutschland. Dieselbe Mess-Disziplin, die du oben siehst, angewendet auf dein echtes Audio.
STT-Benchmark · 08.06.2026 · jede Zahl unabhängig nachprüfbar










