Wer hat was gesagt? Nvidias offenes Modell trennt bis zu acht Sprecher in Echtzeit
Nemotron 3 Diarization erkennt bis zu acht Stimmen, führt einen unabhängigen Vergleich an und läuft auf eigener Hardware. Was das für Protokolle heißt.
Nvidia hat am 23. September 2026 Nemotron 3 Diarization veröffentlicht, ein Modell, das in Tonaufnahmen erkennt, wer wann spricht. Diese sogenannte Sprechertrennung ist der Teil, der aus einem bloßen Transkript ein brauchbares Protokoll macht: Erst wenn feststeht, welcher Satz von welcher Person stammt, lassen sich Beschlüsse, Zusagen und Rückfragen zuordnen.
Das Modell hat rund 100 Millionen Parameter, ist mit offenen Gewichten auf Hugging Face verfügbar und darf auch kommerziell eingesetzt werden. Es unterscheidet bis zu acht Sprecher, doppelt so viele wie sein Vorgänger, und arbeitet auf Wunsch im laufenden Gespräch mit einer Verzögerung von unter einer Sekunde.
Platz eins im unabhängigen Vergleich
Auf der Vergleichsliste Voice Arena Diarization Bench, die zwölf Systeme an 139 englischsprachigen Gesprächen mit zusammen rund 22 Stunden Ton misst, liegt das Modell mit einer Fehlerquote von 14,72 Prozent vorn. Gemessen wird die Diarization Error Rate, also der Anteil der Gesprächszeit, der falsch oder gar nicht zugeordnet wird. Auf Platz zwei folgt DiariZen von der Universität Brno mit 19,34 Prozent, auf Platz drei der kommerzielle Dienst pyannoteAI Precision-3 mit 20,56 Prozent. Nvidias eigener Vorgänger kam auf 24,61 Prozent.
Deutlich dahinter liegen die Sprechertrennungen großer Transkriptionsdienste: ElevenLabs Scribe v2 mit 40,71 Prozent, AssemblyAI mit 44,64 Prozent, Speechmatics mit 53,30 Prozent und Deepgram Nova-3 mit 67,13 Prozent. Nvidia selbst gibt über acht Testsätze gemittelt 41 Prozent weniger Fehler als beim Vorgängermodell an.
Eine Einschränkung gehört dazu: Die Vergleichsdaten sind fast durchweg englisch. Das Modell wurde nach Nvidias Angaben mit Material aus 21 Sprachen trainiert, auf der Modellkarte ausdrücklich genannt sind aber nur Englisch, Mandarin und mehrere indische Sprachen. Wie gut es deutsche Besprechungen trennt, ist nicht belegt und muss am eigenen Material geprüft werden.

Was es technisch voraussetzt
Nemotron 3 Diarization baut auf Nvidias Sortformer-Architektur auf und verarbeitet Mono-Ton mit 16 Kilohertz, gängige Formate wie WAV, MP3 oder Opus eingeschlossen. Die Verzögerung lässt sich einstellen, von 0,32 Sekunden für Liveanwendungen bis zu rund 30 Sekunden für die nachträgliche Auswertung, die etwas genauer arbeitet. Namen kennt das Modell nicht: Es liefert anonyme Kennungen wie Sprecher 1 und Sprecher 2, die Zuordnung zu Personen bleibt ein eigener Schritt.
Offiziell vorausgesetzt wird eine Nvidia-Grafikkarte ab der Ampere-Generation unter Linux. Eine CPU-Fassung bietet Nvidia nicht an, aus der Community gibt es erste inoffizielle Umsetzungen. Eingebunden wird das Modell über Nvidias Werkzeugkasten NeMo. Für die eigentliche Verschriftlichung empfiehlt Nvidia die eigenen Spracherkennungsmodelle Parakeet TDT 0.6B v3 und Nemotron ASR 3.5 Streaming, eine Anleitung für die Kombination liegt im Repository.
Mehr als acht Personen verkraftet das Modell nicht. Nvidia schreibt dazu selbst:
Enthält eine Aufnahme mehr Sprecher, kann Gesprochenes fehlen oder dem falschen Kanal zugeordnet werden.
Lizenz: offen, mit einer Ausnahme
Das Modell steht unter der OpenMDW-Lizenz 1.1. Sie erlaubt kommerzielle Nutzung ohne Weitergabepflicht für eigene Anpassungen, die erzeugten Ergebnisse gehören dem Anwender. Bedingung ist lediglich, bei einer Weitergabe des Modells Lizenztext und Urheberhinweise beizulegen.
Vorsicht bei der Auswahl: Neben dem Hauptmodell gibt es auf Hugging Face eine zugangsbeschränkte Vorschaufassung. Sie unterliegt einer reinen Evaluationslizenz, die nur interne Tests erlaubt und den produktiven Einsatz ausschließt. Für den Betrieb kommt nur das Hauptmodell nvidia/Nemotron-3-Diarization infrage.
Warum das für den Datenschutz interessant ist
Besprechungsprotokolle entstehen heute oft über Cloud-Dienste, die Ton hochladen, verschriftlichen und die Sprecher trennen. Stimmen sind personenbezogene Daten, Gesprächsinhalte häufig vertraulich. Wer Mitschnitte an einen Dienst außerhalb der EU schickt, braucht Auftragsverarbeitungsvertrag, Rechtsgrundlage und eine Absicherung des Drittlandtransfers.
Ein offenes Modell, das eine der großen kommerziellen Lösungen im Vergleich schlägt, verschiebt diese Abwägung. Zusammen mit einer lokal betriebenen Spracherkennung lässt sich die gesamte Kette auf einem eigenen Server abbilden, ohne dass eine Aufnahme das Haus verlässt. Die Einwilligung der Gesprächsteilnehmer in die Aufzeichnung ersetzt das allerdings nicht.
Was das für Ihr Unternehmen heißt
- Prüfen Sie Ihre bisherige Protokollkette. Klären Sie, welcher Dienst heute Ihre Besprechungen verschriftlicht und wo die Aufnahmen verarbeitet werden. Das ist die Grundlage für jeden Vergleich.
- Testen Sie mit deutschen Aufnahmen. Die veröffentlichten Werte gelten für englische Gespräche. Zehn bis zwanzig echte Besprechungen mit Ihren Stimmen, Dialekten und Raumakustik zeigen, ob die Trennung trägt.
- Rechnen Sie Hardware gegen Abogebühren. Für den Eigenbetrieb braucht es eine Nvidia-Grafikkarte. Bei regelmäßigem Aufkommen kann ein eigener Server günstiger sein als Minutenpreise, bei wenigen Terminen im Monat eher nicht.
- Achten Sie auf die richtige Lizenz. Nur das Hauptmodell ist für den produktiven Einsatz freigegeben, die Vorschaufassung nicht.
- Klären Sie die Einwilligung. Auch eine lokale Auswertung setzt voraus, dass alle Beteiligten der Aufzeichnung zugestimmt haben.
Wenn Sie prüfen möchten, ob sich Ihre Besprechungsprotokolle datenschutzfreundlich auf eigener Hardware automatisieren lassen, sprechen Sie uns an.