ClairaClaira Help Desk

Erkennung personenbezogener Daten

Andere Sprachen

Nutzen Sie Claira, um personenbezogene Daten in Dokumenten in Nuix Discover zu erkennen und zu extrahieren.

Erkennung personenbezogener Daten

Meldungen zu Datenschutzverletzungen, aufsichtsrechtliche Compliance und Datenschutz-Folgenabschätzungen erfordern allesamt zu wissen, welche personenbezogenen Daten in Ihren Dokumenten stecken. Tausende Dateien manuell nach Namen, E-Mail-Adressen, Sozialversicherungsnummern und Adressen zu durchsuchen ist langsam und fehleranfällig.

Claira kann den extrahierten Text durchsuchen und personenbezogene Daten (PbD) kennzeichnen, was Ihrem Team erheblich Zeit spart und das Risiko verringert, etwas zu übersehen.

So hilft Claira

  • Erkennt mehrere Arten personenbezogener Daten. Namen, E-Mail-Adressen, Telefonnummern, Sozialversicherungsnummern, physische Adressen, Kontonummern, und mehr.
  • Unterstützt Compliance-Workflows. Ob Sie auf eine Meldepflicht bei Datenschutzverletzungen, ein Auskunftsersuchen betroffener Personen oder eine aufsichtsrechtliche Prüfung reagieren -- Claira hilft Ihnen zu erkennen, was Aufmerksamkeit braucht.
  • Funktioniert im großen Maßstab. Führen Sie die Erkennung personenbezogener Daten über einen gesamten Dokumentbestand in einem einzigen Massen-Scan aus.

Wann Sie dies einsetzen sollten

  • Meldung von Datenschutzverletzungen und Reaktion auf Vorfälle
  • Datenschutz-Folgenabschätzungen
  • Vorbereitung von Dokumenten für die Produktion mit Schwärzungslisten
  • Auskunftsersuchen betroffener Personen nach DSGVO, CCPA oder ähnlichen Regelungen

Beispiel-Prompts

Sie können Ihren Prompt zur Erkennung personenbezogener Daten je nachdem anpassen, wie gezielt oder umfassend die Ergebnisse ausfallen sollen.

Der umfassende Prompt „Erscheinungsformen" unten steht auch in der App unter Investigations > Comprehensive PII (surface forms) in der Vorlagenauswahl zur Verfügung, mit einem vollständigen Hilfeartikel hier.

Umfassende Extraktion personenbezogener Daten (eindeutige Erscheinungsformen)

Nutzen Sie dies, wenn Sie jede eigenständige geschriebene Form personenbezogener Daten benötigen, ohne Normalisierung, in einer einzigen maschinenfreundlichen Zeile aus zitierten Werten. Das folgende Format eignet sich gut als Eingabe für Search Term Families in Nuix Discover: Jeder Wert (oder eine Gruppe, die Sie als eine Familie behandeln) kann zu gruppierten Such- oder QC-Begriffen über den Bestand hinweg werden, ohne jede vom Modell gefundene Variante erneut eintippen zu müssen.

Prompt zu umfassenden personenbezogenen Daten (eindeutige Erscheinungsformen)

Extrahieren Sie jede eindeutige Instanz personenbezogener Daten (PbD) aus diesem Dokument. Dazu zählen unter anderem: vollständige Namen, Teilnamen, Initialen, Spitznamen, Titel mit Namen (z. B. Herr Müller, Dr. Schmidt), E-Mail-Adressen, Telefonnummern, physische Adressen, Geburtsdaten, staatlich ausgestellte Kennungen (Sozialversicherungsnummer, Personalausweisnummer, Reisepassnummern, Führerscheinnummern), Kontonummern, Krankenaktennummern, IP-Adressen und Benutzernamen. Beziehen Sie keine Daten oder URLs ein, die nicht in E-Mail-Adressen enthalten sind. Befolgen Sie diese Regeln genau:

  • Geben Sie jede eindeutige Erscheinungsform jeder PbD-Instanz exakt so aus, wie sie im Dokument erscheint. Ist dieselbe Person, Adresse oder sonstige Entität in mehreren Formaten geschrieben, nehmen Sie jedes unterschiedliche Format als eigenen Eintrag auf (z. B. "Hans Müller", "H. Müller", "Herr Müller", "Müller, Hans").
  • Führen Sie keine Duplikate derselben exakt formatierten Zeichenfolge auf. Jeder Eintrag in der Ausgabe muss zeichengenau eindeutig sein.
  • Normalisieren, korrigieren, formatieren Sie keinen Wert um, und erweitern oder kürzen Sie keinen Wert ab. Bewahren Sie die ursprüngliche Groß-/Kleinschreibung, Zeichensetzung, Abstände und Schreibweise, einschließlich augenscheinlicher Tippfehler.
  • Nehmen Sie bei Adressen jedes unterschiedliche geschriebene Format gesondert auf (z. B. "Hauptstr. 123", "Hauptstraße 123", "123 Main St, Montreal, QC").
  • Nehmen Sie bei Telefonnummern jedes unterschiedliche geschriebene Format gesondert auf (z. B. "514-555-1234", "(514) 555-1234", "+1 514 555 1234").
  • Fassen Sie jeden Wert in gerade doppelte Anführungszeichen. Trennen Sie Einträge durch ein Komma. Verwenden Sie keine Zeilenumbrüche, Aufzählungszeichen, Nummerierung, geschweifte Klammern, eckige Klammern oder sonstige Umschließungen oder Trennzeichen.
  • Fügen Sie keinen einleitenden Text, erläuternden Text, Überschriften, Beschriftungen, Kategorien, Zählungen, abschließende Kommentare oder Schlussbemerkungen hinzu. Die Antwort muss mit dem ersten Anführungszeichen beginnen und mit dem letzten Anführungszeichen enden. Werden keine personenbezogenen Daten gefunden, geben Sie genau aus: "KEINE PBD ERKANNT"

Beispiel einer korrekt formatierten Ausgabe: "Hans Müller","H. Müller","Herr Müller","hans@mueller.de","514-555-1234","Hauptstr. 123"

Gezielte Extraktion

Nutzen Sie dies, wenn Sie genau wissen, nach welchen Arten personenbezogener Daten Sie suchen, und statt einer vollständigen Erfassung aller Erscheinungsformen eine einfache Liste aus Wertepaaren wünschen.

Prompt zu gezielten personenbezogenen Daten

Bestimmen Sie alle Namen und E-Mail-Adressen. Bilden Sie Paare im Format: [Name] <[E-Mail]> // [Name] <[E-Mail]>

Tipps für bessere Ergebnisse

Beginnen Sie mit dem umfassenden Prompt an einer kleinen Stichprobe, um zu verstehen, welche Arten personenbezogener Daten in Ihrem Bestand vorkommen. Wechseln Sie dann für den Massen-Scan zu einem gezielten Prompt, wenn Sie nur bestimmte Arten benötigen.
  • Search Term Families. Die Ausgabe des umfassenden Prompts ist eine starke Eingabe für Search Term Families in Nuix Discover: Jede zurückgegebene Zeichenfolge (oder eine Gruppe, die Sie manuell bilden) kann eine Familie für Suche und QC begründen. Passen Sie die Zugehörigkeit bei Bedarf an, bevor Sie sie fallweit ausführen.
  • Geben Sie das benötigte Format an. Erwarten nachgelagerte Werkzeuge eine andere Struktur (zum Beispiel ein erzählendes Schwärzungsprotokoll), sagen Sie das im Prompt, oder nutzen Sie das gezielte Beispiel, wenn gepaarte Felder ausreichen.
  • Behandeln Sie rohe personenbezogene Daten in gespeicherten Sichtungsfeldern mit Sorgfalt. Das umfassende Format listet Werte so, wie sie im Text erscheinen. Beschränken Sie die Sichtbarkeit des Feldes und befolgen Sie die Datenumgangs- und Aufbewahrungsrichtlinie Ihrer Organisation.
  • Kombinieren Sie mit menschlicher Sichtung. Die Erkennung personenbezogener Daten ist hochriskant. Nutzen Sie Clairas Ausgabe als Ausgangspunkt und lassen Sie dann eine sichtende Person bestätigen, bevor Sie auf Grundlage der Ergebnisse handeln.
Claira analysiert ausschließlich extrahierten Text. Erscheinen personenbezogene Daten in Bildern, handschriftlichen Notizen oder gescannten Dokumenten mit schlechter OCR-Qualität, werden sie möglicherweise nicht erkannt. Prüfen Sie stets die OCR-Qualität, bevor Sie sich auf eine KI-gestützte Erkennung personenbezogener Daten verlassen.

Brauchen Sie Hilfe? Schreiben Sie uns an support@claira.to.

War diese Seite hilfreich?

Weiterlesen

Brauchen Sie weitere Hilfe?

Wenden Sie sich an unser Support-Team unter support@claira.to — wir helfen Ihnen gerne weiter.