Zurück zum Blog
9 Min.von Mathias

Interviewtranskripte anonymisieren: Warum Suchen-und-Ersetzen im Deutschen nicht reicht

Pseudonym oder anonym, deutsche Flexion, indirekte Identifikatoren und die Schlüsselliste: eine praktische Anleitung zum Anonymisieren von Interviewtranskripten in Abschlussarbeiten — mit Formulierungsvorschlag für den Methodenteil.

AnonymisierungDSGVOTranskriptionMethodik

Die Interviews sind geführt, die Transkripte stehen, die Abgabe ist in vier Wochen. Und irgendwo in der Betreuung fiel der Satz: „Anonymisiert wird natürlich vorher.“ Also öffnet ihr Word, drückt Strg+H und ersetzt „Müller“ durch „B1“.

Das ist der Punkt, an dem die meisten Abschlussarbeiten still einen Fehler machen — manchmal einen methodischen, gelegentlich einen rechtlichen. Dieser Text zeigt, was beim Anonymisieren von Interviewtranskripten tatsächlich schiefgeht, warum Suchen-und-Ersetzen im Deutschen besonders unzuverlässig ist, und wie eine Reihenfolge aussieht, die haltbar ist.

Zuerst: Ihr anonymisiert vermutlich gar nicht

Die beiden Begriffe werden synonym benutzt und sind es nicht.

Pseudonymisiert heißt: Die Namen sind ersetzt, aber es existiert irgendwo eine Zuordnung — eine Schlüsselliste, die ursprüngliche Audiodatei, eure Erinnerung. Die Daten bleiben personenbezogen, die DSGVO gilt vollständig weiter.

Anonym heißt: Niemand kann die Person mit verhältnismäßigem Aufwand wieder identifizieren — auch ihr nicht, auch nicht mit den Originalaufnahmen. Erst dann fällt die Verarbeitung aus dem Anwendungsbereich der DSGVO heraus (Erwägungsgrund 26).

Solange ihr die Audiodateien noch auf der Festplatte habt, ist euer Material pseudonymisiert. Das ist völlig in Ordnung und der Normalfall in qualitativer Forschung. Nur solltet ihr es im Methodenteil dann auch so nennen. Eine Arbeit, die „vollständig anonymisiert“ behauptet und im Anhang eine Schlüsselliste führt, widerspricht sich selbst — und das ist genau die Sorte Detail, die in einer Verteidigung auffällt.

Warum Suchen-und-Ersetzen im Deutschen scheitert

Im Englischen funktioniert es halbwegs: „Smith“ bleibt „Smith“, egal wo im Satz. Das Deutsche flektiert, komponiert und spricht anders als es schreibt — und Transkripte sind gesprochene Sprache.

Genitiv und Dativ. Ihr ersetzt „Müller“. Im Transkript steht aber auch „Müllers Abteilung“, „bei Müllern“, „dem Müller seine Idee“. Die erste Form entgeht euch garantiert, weil sie ein Zeichen länger ist als euer Suchbegriff.

Komposita. „Die Müllersche Methode“, „das Müller-Projekt“, „im Haslerhof“. Namen verstecken sich in zusammengesetzten Wörtern, die keine Suchfunktion als Namen erkennt.

Teiltreffer in beide Richtungen. Ersetzt ihr „Ost“ irgendwo, trefft ihr „Osteoporose“. Ersetzt ihr „Berg“, trefft ihr „übergeben“. Umgekehrt: „Frau Dr. Anna M.“ und „die Anna“ und „unsere Chefin“ sind dieselbe Person, und nur eine der drei Formen steht auf eurer Liste.

Sprechsprache. Transkribiert wird, was gesagt wurde. Also „der Hofer Sepp“, „d Frau Müller“, verschluckte Endungen, Dialektformen von Ortsnamen. Wer nach der Duden-Schreibweise sucht, findet die Hälfte nicht.

Konsistenz über Dateien hinweg. Interviewperson 3 erwähnt eine Kollegin, die selbst Interviewperson 7 ist. Bekommt sie in Datei 3 ein anderes Pseudonym als in Datei 7, könnt ihr die Verbindung später nicht mehr auswerten. Bekommt sie dasselbe, obwohl das an einer Stelle nicht auffallen sollte, habt ihr sie enttarnt.

Der Fehler, der wirklich zählt: indirekte Identifikatoren

Namen sind das kleinere Problem. Deanonymisiert wird über Merkmalskombinationen, und die überleben jedes Suchen-und-Ersetzen, weil sie gar keine Eigennamen sind.

„Die einzige Hebamme im Bezirk.“ „Seit der Fusion 2019 leite ich die Abteilung.“ „Nach meinem Unfall im März.“ „Ich bin die einzige Frau im Team.“ Jede einzelne Angabe ist harmlos. Zusammen benennen sie eine Person eindeutig, und zwar besonders zuverlässig für genau die Leserinnen und Leser, vor denen ihr sie schützen wolltet: die Kolleginnen aus demselben Feld.

Worauf ihr im Transkript achten müsst:

Und der Gegenfehler: zu viel wegnehmen

Wer alles ersetzt, hat am Ende ein Transkript, das nichts mehr aussagt. Wenn eure Forschungsfrage regionale Unterschiede betrifft, dürft ihr die Region nicht durch [ORT] ersetzen. Wenn es um Hierarchien geht, braucht ihr die Funktionsbezeichnung.

Die brauchbare Regel: ersetzt Identifikatoren, erhaltet Bedeutung. Statt „[ORT]“ schreibt „[Landgemeinde, ca. 3.000 Einwohner]“. Statt „[FIRMA]“ schreibt „[Industriebetrieb, ca. 200 Beschäftigte]“. Die analytische Information bleibt, die Identifikation fällt weg. Und dokumentiert die Ersetzungsregel, damit sie nachvollziehbar ist.

Eine Reihenfolge, die funktioniert

  1. Roh sichern. Ein unveränderter Satz Transkripte, getrennt gespeichert. Ihr werdet mindestens einmal zurückmüssen.
  2. Schlüsselliste anlegen — echte Namen zu Pseudonymen, in einer eigenen, verschlüsselten Datei, nicht im selben Ordner und nicht im Anhang der Arbeit.
  3. Direkte Identifikatoren ersetzen: Personen, Organisationen, Orte, Telefonnummern, Mailadressen — konsistent über alle Dateien.
  4. Einmal komplett lesen, mit der Frage „wer könnte das sein?“ Das ist der Durchgang für die indirekten Merkmale, und er lässt sich nicht automatisieren.
  5. Gegenlesen lassen — idealerweise von jemandem aus dem Feld, der die Personen kennen könnte. Wer niemanden erkennt, den ihr nicht auch erkannt habt, seid ihr fertig.
  6. Löschfrist festlegen. Wann verschwinden Audiodateien und Schlüsselliste? Das gehört in die Einwilligungserklärung und sollte dann auch passieren.

Was Software hier kann — und was nicht

Automatische Erkennung nimmt euch Schritt 3 ab, und zwar deutlich zuverlässiger als eine Suchfunktion: Ein Modell erkennt „Müllers“ als gebeugte Form von „Müller“, findet Namen, die nicht auf eurer Liste stehen, hält Pseudonyme über alle Dateien hinweg konsistent und markiert Ortsangaben und Organisationen mit.

Was Software nicht kann, ist Schritt 4. Ob „die einzige Hebamme im Bezirk“ identifizierend ist, hängt davon ab, wie viele Hebammen es dort gibt — und das weiß nur ihr. Jedes Werkzeug, das euch diesen Durchgang abnehmen zu können behauptet, verspricht zu viel.

Themera anonymisiert Transkripte deshalb mit Vorschlägen zum Bestätigen: Jede erkannte Stelle wird angezeigt, ihr entscheidet je Fund, und die Zuordnung bleibt über alle Dateien eines Projekts konsistent. Die deutsche Flexion ist dabei der eigentliche Aufwand gewesen, und genau daran scheitert Strg+H.

Formulierungsvorschlag für den Methodenteil

„Die Transkripte wurden vor der Auswertung pseudonymisiert. Namen von Personen, Organisationen und Orten wurden durch konsistente Kürzel ersetzt; Angaben, die für die Fragestellung erforderlich sind, wurden durch verallgemeinernde Beschreibungen erhalten (z. B. [Industriebetrieb, ca. 200 Beschäftigte]). In einem zweiten Durchgang wurden indirekte Identifikatoren geprüft und, soweit ohne inhaltlichen Verlust möglich, entfernt. Die Zuordnungsliste wird getrennt vom Datenmaterial verschlüsselt aufbewahrt und nach Abschluss des Verfahrens gelöscht. Eine vollständige Anonymisierung ist aufgrund der geringen Fallzahl im untersuchten Feld nicht gewährleistet; die Teilnehmenden wurden hierüber vorab informiert.“

Der letzte Satz ist der, den fast niemand schreibt und der eine Arbeit methodisch sofort erwachsener wirken lässt. Eine erkannte Grenze ist kein Mangel — eine übersehene schon.

Fazit

Anonymisieren ist keine Formatierungsaufgabe am Ende, sondern ein Arbeitsschritt mit eigener Methodik. Der automatisierbare Teil ist die Fleißarbeit — Namen finden, beugen, konsistent halten. Der Teil, der über den Schutz eurer Interviewpartner entscheidet, ist ein aufmerksamer Lesedurchgang, den euch niemand abnimmt.

Wenn ihr sehen wollt, wie die Erkennung an echtem Material arbeitet, bevor ihr eure eigenen Transkripte hochladet: Beispielanalyse ansehen — ohne Account. Oder kostenlos mit eigenem Material testen, drei Analysen frei, ohne Kreditkarte. Zum rechtlichen Rahmen dahinter: Interviews mit KI auswerten und die DSGVO.

Themera mit eigenen Daten testen

3 Analysen kostenlos. Keine Kreditkarte. Datenverarbeitung in der EU, DSGVO-konform.

Kostenlos starten