ClairaClaira Help Desk

PDF-Unitisierung

Andere Sprachen

Nutzen Sie Claira, um die Dokumentgrenzen innerhalb eines zusammengesetzten PDFs zu finden, es im Nuix-Discover-Bildbetrachter zu trennen und die neuen Teildokumente anschließend objektiv zu kodieren.

PDF-Unitisierung

Ein einzelnes PDF enthält oft viele separate Dokumente, die zusammengefügt wurden -- eine Scan-Charge, eine als eine Datei produzierte Sammlung, eine E-Mail mit zu einer Datei zusammengeführten Anhängen. Unitisierung ist der Vorgang, bei dem erkannt wird, wo jedes einzelne Dokument beginnt und endet, damit die Datei wieder in einzelne Datensätze getrennt werden kann.

Im Bildbetrachter von Nuix Discover wird die Trennung durch eine Seitenbereichs-Zeichenfolge gesteuert. Dieser Arbeitsablauf nutzt Claira, um die Grenzen zu bestimmen und diese Zeichenfolge zu erzeugen, wendet die Trennung im Bildbetrachter an und führt anschließend eine objektive Kodierung an den neu entstandenen Teildokumenten aus -- denn diese entstehen praktisch ohne eigene Metadaten.

Wann Sie diesen Arbeitsablauf einsetzen sollten

  • Scan-Chargen. Papiersammlungen, die als ein durchgehendes PDF je Box oder Ordner gescannt wurden.
  • Zusammengesetzte Produktionen. Eine Partei hat viele Datensätze als eine einzige Datei produziert.
  • Zusammengeführte Familien. E-Mails, die zusammen mit ihren Anhängen als PDF gedruckt wurden.
  • Übergroße Datensätze. Eine Tabelle, ein Journal oder eine Datei, die Sichtende nach Person, Datum oder Datensatztyp getrennt brauchen, um sie sichten zu können.

Der Arbeitsablauf

Schritt 1: Die zusammengesetzten PDFs finden

Erkennen Sie die Dokumente, die eine Unitisierung brauchen. Hohe Seitenzahlen, generische Titel (Scan_001.pdf) und Dokumente, deren erste Seiten den letzten überhaupt nicht ähneln, sind die üblichen Anzeichen. Kennzeichnen Sie sie, damit Sie die Menge methodisch durcharbeiten können.

Schritt 2: Eine Vorlage zur PDF-Unitisierung ausführen

Öffnen Sie das Dokument in der Einzelsichtung und wählen Sie dann die passende Vorlage:

  • PDF Unitization — die Grenzen sind offensichtlich: Jede kompetente sichtende Person würde dieselben Linien ziehen.
  • PDF Unitization (Custom Split) — die Trennung hängt von etwas ab, das die Seiten allein nicht verraten. Ersetzen Sie den Platzhalterblock durch ein oder zwei einfache Sätze, z. B. „Ein Dokument je Rechnung." oder „Ein Dokument je namentlich genannter Person, alle Unterlagen dieser Person zusammen."
Stellen Sie das Dropdown Scannen als auf Bild, damit Claira die tatsächlichen PDF-Seiten liest. Extrahierter Text erhält keine Seitengrenzen, und bei der Unitisierung geht es ausschließlich um Seitengrenzen.

Claira liefert einen strukturierten Bericht: Gesamtseitenzahl, eine Zeile je Teildokument (Seitenbereich, Typ, Datum, Startsignal), die Unitisierungs-Zeichenfolge und eine Liste unsicherer Seiten.

Schritt 3: Die vorgeschlagenen Grenzen qualitätskontrollieren

Bevor Sie irgendetwas trennen, prüfen Sie Clairas Arbeit:

  • Lösen Sie jeden UNSICHER-Eintrag auf. Öffnen Sie diese Seiten im Betrachter und entscheiden Sie, wohin sie gehören.
  • Prüfen Sie stichprobenartig die Grenzseiten. Sehen Sie sich bei jedem vorgeschlagenen Bereich die erste und letzte Seite an -- Grenzfehler liegen an den Rändern, nicht in der Mitte.
  • Verifizieren Sie die Abdeckung. Die Bereiche müssen jede Seite genau einmal erfassen -- keine Lücken, keine Überschneidungen. Nuix Discover meldet einen Fehler, wenn dieselbe Seite in einem Unitisierungsdurchgang zweimal vorkommt.

Schritt 4: Die Datei im Bildbetrachter trennen

Öffnen Sie das Dokument im Bildbetrachter von Nuix Discover und starten Sie eine Unitisierung. Fügen Sie Clairas Zeichenfolge ein und verwenden Sie dabei die Standardsyntax:

  • Bindestrich für einen zusammenhängenden Bereich: 5-9
  • Komma, um nicht zusammenhängende Seiten zum selben Ausgabedokument zusammenzufassen: 1-3, 7
  • Semikolon zwischen Ausgabedokumenten: 1-4; 5-9; 10-22
  • Ein einseitiges Dokument wird als bloße Zahl geschrieben
  • Die Seitenreihenfolge innerhalb eines Satzes wird beachtet, sodass 7-5 in umgekehrter Reihenfolge zusammenstellt
Beispiel einer Unitisierungs-Zeichenfolge

1-4; 5-9; 10-22

Schritt 5: Die neuen Teildokumente objektiv kodieren

Die neuen Dokumente erben keine Metadaten von der Quelldatei -- nur das Dokumentdatum wird befüllt, gesetzt auf das Datum der Unitisierung. Jedes andere Feld beginnt leer, wofür der Arbeitsablauf zur objektiven Kodierung genau richtig ist.

Sammeln Sie die neu erstellten Dokumente und führen Sie die objektive Kodierung an ihnen aus:

  • Nutzen Sie Multi-Code, um Datum, Titel, Autor und Dokumenttyp in einem Durchgang zu befüllen, oder führen Sie die einzelnen Vorlagen aus — Extract dates, Extract author, Identify document type.
  • Schreiben Sie zunächst in eigene KI-Felder (z. B. OC Date, OC Author) statt in Ihre primären Metadatenfelder, damit Sie vor der Übernahme qualitätskontrollieren können.
  • Ein Teildokument, das in der Quelle nur als Bild vorlag, bleibt auch nach der Trennung nur ein Bild -- scannen Sie es auch hier als Bild.

Schritt 6: Qualitätskontrolle und Übernahme

Prüfen Sie die kodierten Werte stichprobenartig gegen die Teildokumente, lösen Sie Ersatzwerte auf und kopieren Sie dann die qualitätskontrollierten Ergebnisse aus den KI-Feldern in Ihre primären Metadatenfelder. Ab diesem Punkt verhalten sich die Teildokumente wie jeder andere Datensatz in der Sichtung.

Bewährte Praktiken

  • Jeweils ein zusammengesetztes PDF. Die Unitisierung ist eine Entscheidung je Datei; führen Sie die Vorlage in der Einzelsichtung aus statt als Massen-Scan, und bewahren Sie den Bericht neben dem Dokument in einem Memo-Feld auf.
  • Erst trennen, dann kodieren. Das Kodieren der zusammengesetzten Datei verschwendet Aufwand -- die extrahierten Werte gehören zu den Teildokumenten, nicht zum Container.
  • Bewahren Sie das Quelldokument auf. Löschen Sie das zusammengesetzte Original nicht; es ist Ihre Prüfspur dafür, woher jedes Teildokument stammt.
  • Wechseln Sie bewusst zur benutzerdefinierten Trennung. Kennzeichnet die offensichtliche Fassung weiterhin Seiten als unsicher, ist das Ihr Hinweis, dass die Trennung eine Anweisung braucht, keinen erneuten Durchlauf.

Einschränkungen

  • Claira schlägt vor, der Bildbetrachter setzt um. Claira gibt die Seitenbereichs-Zeichenfolge aus, aber die Trennung selbst geschieht im Bildbetrachter von Nuix Discover -- prüfen Sie die Zeichenfolge, bevor Sie sie anwenden.
  • Seitenzahlen sind physisch. Die Bereiche zählen PDF-Seiten ab 1, nicht Bates-Nummern oder gedruckte Seitenzahlen.
  • Metadaten werden nicht übernommen. Nur das Dokumentdatum wird bei den neuen Dokumenten befüllt (gesetzt auf das Unitisierungsdatum) -- planen Sie den Durchgang zur objektiven Kodierung ein, statt ihn zu ignorieren.
  • Sehr lange Dateien fordern jedes Modell. Bei Dateien mit Hunderten Seiten sollten Sie die Trennung in Etappen vornehmen: ein grober erster Durchgang, dann die größeren Abschnitte erneut unitisieren.

Brauchen Sie Hilfe? Schreiben Sie uns an support@claira.to.

War diese Seite hilfreich?

Weiterlesen

Brauchen Sie weitere Hilfe?

Wenden Sie sich an unser Support-Team unter support@claira.to — wir helfen Ihnen gerne weiter.