Wer hat wann gesprochen. Und wie oft liegt das Modell daneben?
Ein Modell kann jedes Wort richtig schreiben und die Sprecher trotzdem vertauschen. Für ein Protokoll ist das der teurere Fehler, deshalb bekommt er eine eigene Wertung. Gemessen wird als DER: verwechselte plus verpasste plus fälschlich als Sprache gewertete Zeit.
Wer hat wann gesprochen. Self-hosted vor Cloud.
Eine eigene deutsche Eval. Weil Raven jeden Teilnehmer auf einer eigenen Spur aufnimmt, ist die Referenz exakt gemessen, nicht aus gemischtem Audio geschätzt.
Alle Diarizer laufen auf demselben echten deutschen Meeting-Set, eine Rangliste, direkt vergleichbar. Auf der Gesamt-DER erreicht das beste self-hostbare Modell rund die halbe Fehlerrate der Cloud-Dienste. Der Vorsprung kommt vor allem aus der Sprach-Abdeckung: es verpasst weniger echte Sprecher-Zeit, es trennt Stimmen nicht feiner. Die Aufschlüsselung steht direkt in der Tabelle: Confusion (reine Trennschärfe), Miss und FA neben der DER. Sortier nach Confusion, und das beste self-hostbare Modell führt nicht mehr, dann trennen andere sauberer.
Links wählst du den Datensatz. Neben Ravens eigenem Meeting-Set stehen drei offene Referenzsets: VoxConverse, CALLHOME-de und AMI. Auf CALLHOME-de stehen mehrere Diarizer nebeneinander: deutsche Telefongespräche, dieselben Aufnahmen, dasselbe Gold, derselbe Scorer. Eine öffentliche deutsche Diarisierungs-Rangliste veröffentlicht sonst niemand. DER ist dataset-relativ, und das Protokoll entscheidet: ohne angegebenen Collar und Overlap-Regel ist eine DER-Zahl Rauschen, deshalb steht der Collar in jeder Tabelle dabei. Die öffentlichen Zahlen sind im raven.eval-Toolkit von jedem nachrechenbar. Keines der offenen Sets ist ein echtes Meeting mit starker Überlappung, genau dort ist Ravens Aufnahme pro Spur der reale Vorteil.
Makro-Mittel über das gesamte saubere Meeting-Set.
| Modell▲ | DER · Gesamt▲ | Confusion▲ | Miss▲ | FA▲ | Hosting▲ | Lizenz▲ |
|---|---|---|---|---|---|---|
DiariZen v2nur Referenz BUT Speech@FIT | 5,65 % | 1,32 % | 3,58 % | 0,75 % | SELF | CC-BY-NC |
pyannote | 8,07 %★ | 2,73 % | 2,44 % | 2,90 % | SELF | CC-BY-4.0 |
BUT Speech@FIT | 8,68 % | 0,59 % | 2,40 % | 5,69 % | SELF | MIT |
NVIDIA | 12,21 % | 7,61 % | 4,03 % | 0,57 % | SELF | CC-BY-4.0 |
Deepgram · EU | 12,94 % | 1,27 % | 7,31 % | 4,36 % | EU | proprietary |
Deepgram | 13,02 % | 1,38 % | 7,26 % | 4,38 % | API | proprietary |
| 15,03 % | 1,40 % | 6,74 % | 6,89 % | EU | proprietary | |
Mistral | 15,39 % | 2,31 % | 11,00 % | 2,12 % | EU | proprietary |
Rev | 17,95 % | 2,81 % | 8,92 % | 6,23 % | API | proprietary |
Soniox | 21,45 % | 7,82 % | 10,46 % | 3,17 % | EU | proprietary |
AssemblyAI | 23,80 % | 4,43 % | 6,62 % | 13,48 % | API | proprietary |
Gladia | 23,81 % | 2,35 % | 18,36 % | 4,16 % | EU | proprietary |
| – | – | – | – | API | proprietary |
Nicht gemessen: Auf Raven-Meetings liegt für 2 von 15 Modellen dieser Wertung keine Messung vor. Sie fehlen deshalb in der Tabelle. Das heißt nicht, dass sie hier nicht anwendbar wären, sondern nur, dass sie hier noch nicht angetreten sind. Warum, steht jeweils dahinter: Universal-3.5 Pro: Nur auf den öffentlichen Referenzsets angetreten. Von diesem Anbieter steht auf Ravens eigenem Set das ältere Universal-2 · Sortformer v1 (offline): Nur auf den öffentlichen Referenzsets angetreten: Ravens Meetings sind länger, als dieses Modell am Stück verarbeiten kann. Der Nachfolger Sortformer v2 steht in der Tabelle.
Der Vorsprung des besten self-hostbaren Modells liegt in der Abdeckung: es verpasst weniger echte Sprecher-Zeit. Stimmen feiner trennen (reine Verwechslung) tut es nicht. Sortier die Tabelle nach Confusion, und andere Modelle liegen vorn. Wir zeigen beide Metriken, weil beide zählen. Der Abstand auf der Gesamt-DER ist tendenziell, nicht statistisch abgesichert.
Prüf jede Zahl selbst nach.
github.com/PhilflowIO/raven.evalJede öffentliche DER-Zahl in der Tabelle hängt an den exakten RTTMs, aus denen sie berechnet wurde. make verify lädt Gold und Hypothese neu und rechnet die Werte ohne GPU und ohne gated Modell nach. Die CI macht das bei jedem Push, keine Zahl kann also von ihren Daten abdriften. Du brauchst keinen Account und kein Vertrauen in uns, nur das Repo.
make verifyZero-Setup-Re-Score ohne GPU. Prüft jede Zahl gegen ihre committeten RTTMs (±0,05 pp).make reproduce METRIC=der DATASET=voxconverse-test MODEL=pyannote-community-1Voller Neu-Lauf aus dem Roh-Audio (dein HF-Token, gated Lizenz, GPU).13 Diarizer stehen in dieser Runde. Die Matrix ist noch nicht überall gefüllt: nicht jedes Modell ist bisher auf jedem der vier Datensätze gelaufen, und eine leere Zelle bleibt leer, statt mit einem Durchschnitt aufgefüllt zu werden. Was in den Korpora steckt, auf denen hier gemessen wird, steht in der Korpus-Übersicht; wie gerechnet wird, in der Methodik.
STT-Benchmark · 08.06.2026 · jede Zahl unabhängig nachprüfbar




