Sprechererkennung: Wer sagt was im Interview?
Diarisierung trennt eine Aufnahme nach Stimmen. Erfahren Sie, wo sie irrt, und wie Sie Sprecher im Transkript benennen und korrigieren.
Veröffentlicht
Sprechererkennung, im Fachjargon Diarisierung, beantwortet die Frage „Wer spricht wann?“. Ein Diarisierungsmodell teilt eine Aufnahme in Redebeiträge und ordnet sie nach Stimmen. Die Gruppen heißen dann Sprecher 1, Sprecher 2 und so weiter, denn das Modell kennt Stimmen, keine Personen. Die Namen vergeben Sie selbst. Danach prüfen Sie das Transkript an jeder Stelle, an der der Sprecher wechselt, gegen die Aufnahme.
Dieser Ratgeber beschreibt die Schritte mit TrueScribe unter Windows oder Linux. Die Sprechererkennung gehört zu TrueScribe Pro und läuft auf Ihrem Rechner.
Transkription und Diarisierung sind zwei Aufgaben
Die Spracherkennung macht aus Schall Wörter. Whisper, das Modell, mit dem TrueScribe transkribiert, beherrscht Spracherkennung, Übersetzung und das Erkennen der Sprache. Wer gerade spricht, steht im Transkript nicht.
Ein Diarisierungsmodell achtet auf die Stimmen statt auf die Wörter. TrueScribe führt es nach der Transkription aus und ordnet jedes Segment des Transkripts einem Sprecher zu. Wechselt der Sprecher mitten in einem Segment, kann TrueScribe das Segment an dieser Stelle teilen.
Wo die Diarisierung irrt
pyannote.metrics, ein Werkzeug zur Bewertung von Diarisierung, unterscheidet drei Fehlerarten:
- Verpasste Sprache. Das Modell hält Sprache für Stille.
- Fehlalarm. Das Modell hält Stille oder Geräusche für Sprache.
- Verwechslung. Das Modell hört die Sprache, schreibt sie aber dem falschen Sprecher zu.
Im Interviewtranskript fällt vor allem die Verwechslung auf. Dann steht etwa eine Frage unter dem Namen des Gastes. Überlappende Sprache ist eine bekannte Schwachstelle. Das Paper zu pyannote.metrics weist darauf hin, dass Überlappungen zu mehr verpasster Sprache führen können, wenn ein System sie nicht erkennt. Beginnen Sie die Prüfung deshalb an Stellen, an denen beide gleichzeitig sprechen, und bei sehr kurzen Antworten.
Sprecher erkennen lassen
- Öffnen Sie das Transkript in TrueScribe.
- Lassen Sie im Bereich Sprecher in der Seitenleiste neben dem Transkript die Sprecherzahl auf Automatisch.
- Wählen Sie Sprecher erkennen.

Beim ersten Mal lädt TrueScribe das Diarisierungsmodell herunter. Danach verwendet es das Modell offline, und die Aufnahme bleibt auf Ihrem Rechner.
Damit dieser Schritt bei künftigen Aufnahmen entfällt, öffnen Sie die Einstellungen, wechseln zu Transkription und schalten Sprecher automatisch erkennen ein. TrueScribe erkennt die Sprecher dann nach jeder neuen Transkription.
Sprecher benennen
Klicken Sie im Sprecherbereich auf einen Namen wie Sprecher 1, tippen Sie den neuen Namen ein und drücken Sie die Eingabetaste. Alle Segmente dieses Sprechers tragen danach den neuen Namen.

Verwenden Sie bei Forschungsinterviews die Kürzel Ihrer Studie, etwa „Interviewerin“ und „P07“, statt echter Namen. Mehr zur Pseudonymisierung steht im Ratgeber zum DSGVO-konformen Transkribieren von Forschungsinterviews.
Korrigieren, wer was gesagt hat
Spielen Sie die Aufnahme ab und lesen Sie mit. Steht ein Segment unter dem falschen Namen, klicken Sie es mit der rechten Maustaste an, öffnen Sprecher zuweisen und wählen die richtige Person. Die Änderung gilt nur für dieses eine Segment. Mit Rückgängig nehmen Sie sie zurück.

Mit demselben Menü beheben Sie auch die anderen häufigen Fehler:
- Eine Stimme fehlt. Wählen Sie Neuer Sprecher, um eine Bezeichnung für sie anzulegen, und benennen Sie sie um.
- Eine Person unter zwei Bezeichnungen. Weisen Sie die Segmente der überzähligen Bezeichnung der richtigen Person zu. Klicken Sie die nun leere Bezeichnung im Sprecherbereich mit der rechten Maustaste an und wählen Sie Sprecher löschen.
- Geräusche oder Musik einer Person zugeordnet. Wählen Sie Kein Sprecher.
Um eine Person nach der anderen zu prüfen, entfernen Sie im Sprecherbereich das Häkchen neben den anderen Namen. Deren Segmente verschwinden aus der Liste, bis Sie das Häkchen wieder setzen.

Mit Sprechernamen exportieren
Wählen Sie Exportieren und unter Inhalt die Option Segmente. Jedes Segment enthält dann Zeitstempel und den Namen des Sprechers. Die Option Fließtext exportiert den Text ohne Sprechernamen.

TXT, SRT und WebVTT exportiert jede Version von TrueScribe. Pro ergänzt Dokumente und strukturierte Daten für den nächsten Schritt Ihrer Arbeit.
Laden Sie TrueScribe herunter, sehen Sie sich an, was Pro enthält, oder vergleichen Sie es mit noScribe, einem weiteren lokalen Transkriptionsprogramm mit Sprechererkennung.