Diarisierungsfehler · Deutsche Meetings · Stand 08.06.2026

Wer hat wann gesprochen. Und wie oft liegt das Modell daneben?

Ein Modell kann jedes Wort richtig schreiben und die Sprecher trotzdem vertauschen. Für ein Protokoll ist das der teurere Fehler, deshalb bekommt er eine eigene Wertung. Gemessen wird als DER: verwechselte plus verpasste plus fälschlich als Sprache gewertete Zeit.

01Sprecher-Diarisierung

Wer hat wann gesprochen. Self-hosted vor Cloud.

Eine eigene deutsche Eval. Weil Raven jeden Teilnehmer auf einer eigenen Spur aufnimmt, ist die Referenz exakt gemessen, nicht aus gemischtem Audio geschätzt.

Alle Diarizer laufen auf demselben echten deutschen Meeting-Set, eine Rangliste, direkt vergleichbar. Auf der Gesamt-DER erreicht das beste self-hostbare Modell rund die halbe Fehlerrate der Cloud-Dienste. Der Vorsprung kommt vor allem aus der Sprach-Abdeckung: es verpasst weniger echte Sprecher-Zeit, es trennt Stimmen nicht feiner. Die Aufschlüsselung steht direkt in der Tabelle: Confusion (reine Trennschärfe), Miss und FA neben der DER. Sortier nach Confusion, und das beste self-hostbare Modell führt nicht mehr, dann trennen andere sauberer.

Links wählst du den Datensatz. Neben Ravens eigenem Meeting-Set stehen drei offene Referenzsets: VoxConverse, CALLHOME-de und AMI. Auf CALLHOME-de stehen mehrere Diarizer nebeneinander: deutsche Telefongespräche, dieselben Aufnahmen, dasselbe Gold, derselbe Scorer. Eine öffentliche deutsche Diarisierungs-Rangliste veröffentlicht sonst niemand. DER ist dataset-relativ, und das Protokoll entscheidet: ohne angegebenen Collar und Overlap-Regel ist eine DER-Zahl Rauschen, deshalb steht der Collar in jeder Tabelle dabei. Die öffentlichen Zahlen sind im raven.eval-Toolkit von jedem nachrechenbar. Keines der offenen Sets ist ein echtes Meeting mit starker Überlappung, genau dort ist Ravens Aufnahme pro Spur der reale Vorteil.

13 Modelle · Raven-Meetings · sortiert nach DERBester self-hostbarer Wert self-hosted

Makro-Mittel über das gesamte saubere Meeting-Set.

ModellDER · GesamtConfusionMissFAHostingLizenz
DiariZen v2nur Referenz
BUT Speech@FIT
5,65 %1,32 %3,58 %0,75 %SELFCC-BY-NC
pyannote
8,07 %2,73 %2,44 %2,90 %SELFCC-BY-4.0
BUT Speech@FIT
8,68 %0,59 %2,40 %5,69 %SELFMIT
12,21 %7,61 %4,03 %0,57 %SELFCC-BY-4.0
Deepgram · EU
12,94 %1,27 %7,31 %4,36 %EUproprietary
Deepgram
13,02 %1,38 %7,26 %4,38 %APIproprietary
15,03 %1,40 %6,74 %6,89 %EUproprietary
15,39 %2,31 %11,00 %2,12 %EUproprietary
17,95 %2,81 %8,92 %6,23 %APIproprietary
Soniox
21,45 %7,82 %10,46 %3,17 %EUproprietary
AssemblyAI
23,80 %4,43 %6,62 %13,48 %APIproprietary
23,81 %2,35 %18,36 %4,16 %EUproprietary
APIproprietary

Nicht gemessen: Auf Raven-Meetings liegt für 2 von 15 Modellen dieser Wertung keine Messung vor. Sie fehlen deshalb in der Tabelle. Das heißt nicht, dass sie hier nicht anwendbar wären, sondern nur, dass sie hier noch nicht angetreten sind. Warum, steht jeweils dahinter: Universal-3.5 Pro: Nur auf den öffentlichen Referenzsets angetreten. Von diesem Anbieter steht auf Ravens eigenem Set das ältere Universal-2 · Sortformer v1 (offline): Nur auf den öffentlichen Referenzsets angetreten: Ravens Meetings sind länger, als dieses Modell am Stück verarbeiten kann. Der Nachfolger Sortformer v2 steht in der Tabelle.

DER = Verwechslung + Miss + FA · alle Modelle auf demselben clean-8-Meeting-Set gegen per-Spur-Referenz gemessen, Collar 0,25, niedriger ist besser · der Sprecher-Bucket wirkt nur auf die DER-Spalte, Confusion/Miss/FA sind die clean-8-Werte · sortier nach Confusion für die reine Trennschärfe
Abdeckung ≠ Trennschärfe

Der Vorsprung des besten self-hostbaren Modells liegt in der Abdeckung: es verpasst weniger echte Sprecher-Zeit. Stimmen feiner trennen (reine Verwechslung) tut es nicht. Sortier die Tabelle nach Confusion, und andere Modelle liegen vorn. Wir zeigen beide Metriken, weil beide zählen. Der Abstand auf der Gesamt-DER ist tendenziell, nicht statistisch abgesichert.

Prüf jede Zahl selbst nach.

github.com/PhilflowIO/raven.eval

Jede öffentliche DER-Zahl in der Tabelle hängt an den exakten RTTMs, aus denen sie berechnet wurde. make verify lädt Gold und Hypothese neu und rechnet die Werte ohne GPU und ohne gated Modell nach. Die CI macht das bei jedem Push, keine Zahl kann also von ihren Daten abdriften. Du brauchst keinen Account und kein Vertrauen in uns, nur das Repo.

make verifyZero-Setup-Re-Score ohne GPU. Prüft jede Zahl gegen ihre committeten RTTMs (±0,05 pp).
make reproduce METRIC=der DATASET=voxconverse-test MODEL=pyannote-community-1Voller Neu-Lauf aus dem Roh-Audio (dein HF-Token, gated Lizenz, GPU).

13 Diarizer stehen in dieser Runde. Die Matrix ist noch nicht überall gefüllt: nicht jedes Modell ist bisher auf jedem der vier Datensätze gelaufen, und eine leere Zelle bleibt leer, statt mit einem Durchschnitt aufgefüllt zu werden. Was in den Korpora steckt, auf denen hier gemessen wird, steht in der Korpus-Übersicht; wie gerechnet wird, in der Methodik.

STT-Benchmark · 08.06.2026 · jede Zahl unabhängig nachprüfbar