Unitisation de PDF
See in EnglishUtilisez Claira pour trouver les frontières de documents dans un PDF compilé, le découper dans le visualiseur d'images de Nuix Discover, puis coder objectivement les nouveaux sous-documents.
Unitisation de PDF
Un seul PDF contient souvent plusieurs documents distincts assemblés — un lot de numérisation, une collection produite en un seul fichier, un courriel avec ses pièces jointes aplaties. L'unitisation est le processus qui consiste à identifier où chaque document constitutif commence et se termine afin que le fichier puisse être redécoupé en documents individuels.
Dans le visualiseur d'images de Nuix Discover, le découpage est piloté par une chaîne de plages de pages. Ce flux de travail utilise Claira pour tracer les frontières et produire cette chaîne, applique le découpage dans le visualiseur d'images, puis exécute le codage objectif sur les sous-documents nouvellement créés — parce qu'ils naissent presque sans métadonnées propres.
Quand utiliser ce flux de travail
- Lots de numérisation. Des collections papier numérisées en un PDF continu par boîte ou par chemise.
- Productions compilées. Une partie a produit de nombreux documents en un seul fichier.
- Familles aplaties. Des courriels imprimés en PDF avec leurs pièces jointes à la suite.
- Documents surdimensionnés. Un dossier, un registre ou un fichier que les réviseurs doivent découper par personne, par date ou par type de document pour le rendre révisable.
Le flux de travail
Étape 1 : Trouver les PDF compilés
Identifiez les documents qui nécessitent une unitisation. Un nombre de pages élevé, des titres génériques (Scan_001.pdf) et des documents dont les premières pages ne ressemblent en rien aux dernières sont les indices habituels. Étiquetez-les pour travailler méthodiquement sur l'ensemble.
Étape 2 : Exécuter un modèle d'unitisation de PDF
Ouvrez le document en revue unique, puis choisissez le modèle qui convient :
- Unitisation de PDF — les frontières sont évidentes d'elles-mêmes : tout réviseur compétent tracerait les mêmes lignes.
- Unitisation de PDF (découpage personnalisé) — le découpage dépend de quelque chose que les pages seules ne révèlent pas. Remplacez le bloc de substitution par une ou deux phrases simples, p. ex. « Un document par facture. » ou « Un document par individu nommé, tous les dossiers de cette personne ensemble. »
Claira retourne un rapport structuré : le nombre total de pages, une ligne par document constitutif (plage de pages, type, date, signal de départ), la chaîne d'unitisation et la liste des pages incertaines.
Étape 3 : Contrôler les frontières proposées
Avant de découper quoi que ce soit, vérifiez le travail de Claira :
- Résolvez chaque entrée INCERTAIN. Ouvrez ces pages dans le visualiseur et décidez où elles appartiennent.
- Vérifiez les pages de frontière. Pour chaque plage proposée, regardez sa première et sa dernière page — les erreurs de frontière se cachent aux extrémités, pas au milieu.
- Vérifiez la couverture. Les plages doivent rendre compte de chaque page exactement une fois — aucun trou, aucun chevauchement. Nuix Discover renvoie une erreur si la même page apparaît deux fois dans une même passe d'unitisation.
Étape 4 : Découper le fichier dans le visualiseur d'images
Ouvrez le document dans le visualiseur d'images de Nuix Discover et lancez une unitisation. Collez la chaîne de Claira, selon la syntaxe standard :
- Trait d'union pour une plage contiguë :
5-9 - Virgule pour joindre des pages non contiguës dans le même document de sortie :
1-3, 7 - Point-virgule entre les documents de sortie :
1-4; 5-9; 10-22 - Un document d'une seule page s'écrit comme un simple numéro
- L'ordre des pages dans un ensemble est respecté, donc
7-5assemble en ordre inverse
Étape 5 : Coder objectivement les nouveaux sous-documents
Les nouveaux documents n'héritent pas des métadonnées du fichier source — seule la date du document est remplie, fixée à la date de l'unitisation. Tous les autres champs commencent vides, et c'est exactement à cela que sert le flux de travail Codage objectif.
Rassemblez les documents nouvellement créés et exécutez le codage objectif sur eux :
- Utilisez Multi-Code pour remplir la date, le titre, l'auteur et le type de document en une seule passe, ou exécutez les modèles individuels — Extraire les dates, Extraire l'auteur, Identifier le type de document.
- Écrivez d'abord dans des champs IA dédiés (p. ex.
OC Date,OC Auteur) plutôt que dans vos champs de métadonnées principaux, pour pouvoir contrôler la qualité avant de valider. - Un sous-document qui était uniquement en image dans le fichier source reste uniquement en image après le découpage — analysez-le aussi en mode Image.
Étape 6 : Contrôler la qualité et promouvoir
Vérifiez par échantillonnage les valeurs codées par rapport aux sous-documents, résolvez les valeurs de secours, puis copiez les résultats contrôlés des champs IA vers vos champs de métadonnées principaux. À partir de là, les sous-documents se comportent comme n'importe quels autres documents de la revue.
Bonnes pratiques
- Un PDF compilé à la fois. L'unitisation est une décision par fichier; exécutez le modèle en revue unique plutôt qu'en analyse en lot, et conservez le rapport à côté du document dans un champ Mémo.
- Découper d'abord, coder ensuite. Coder le fichier compilé est un effort perdu — les valeurs extraites appartiennent aux sous-documents, pas au contenant.
- Conserver le document source. Ne supprimez pas l'original compilé; c'est votre piste de vérification pour retracer l'origine de chaque sous-document.
- Passer au découpage personnalisé délibérément. Si la version aux frontières évidentes continue de signaler des pages incertaines, c'est le signe que le découpage a besoin d'une instruction, pas d'une relance.
Limites
- Claira propose; le visualiseur d'images dispose. Claira produit la chaîne de plages de pages, mais le découpage lui-même se fait dans le visualiseur d'images de Nuix Discover — vérifiez la chaîne avant de l'appliquer.
- Les numéros de pages sont physiques. Les plages comptent les pages du PDF à partir de 1, pas les numéros Bates ni les numéros de pages imprimés.
- Les métadonnées ne sont pas héritées. Seule la date du document est remplie sur les nouveaux documents (fixée à la date de l'unitisation) — planifiez la passe de codage objectif, ne la subissez pas.
- Les très longs fichiers mettent tout modèle à l'épreuve. Pour des fichiers de centaines de pages, envisagez un découpage par étapes : une première passe grossière, puis une nouvelle unitisation des blocs les plus gros.
Besoin d'aide? Contactez support@claira.to
Cette page vous a aide?
Continuer la lecture
Codage objectif
Utilisez Claira pour extraire et normaliser des métadonnées factuelles sur les documents (dates, titres, auteurs, types de documents) dans Nuix Discover.
Confirmation des faits
Utilisez Claira pour vérifier si un fait précis est appuyé dans un document et en extraire les passages pertinents.
Besoin d'aide supplémentaire?
Contactez notre équipe de support à support@claira.to — nous sommes là pour vous aider.