Documents numériques et analyse automatique
PDF natif ou PDF scanné : même extension, pas le même document.
L'un contient du texte et des objets numériques. L'autre peut n'être qu'une photographie de pages. Pour rechercher une référence, lire un rapport ou automatiser un classement, la différence change tout.
Par Fabien Rigault · Mis à jour le 3 septembre 2026
La différence technique
Deux PDF peuvent se ressembler parfaitement à l'écran.
PDF natif
Il est généré directement depuis un logiciel : traitement de texte, outil de dessin, logiciel de calcul ou application métier. Le fichier conserve généralement une couche de texte, des objets vectoriels et des métadonnées.
- texte sélectionnable et recherchable ;
- références extractibles sans OCR ;
- traits souvent nets à fort zoom ;
- analyse documentaire plus directe.
PDF scanné
Il provient d'un scanner, d'une photo ou d'une transformation qui a aplati les pages en images. Sans couche de texte, l'ordinateur voit des pixels, pas les mots pourtant lisibles par une personne.
- texte absent ou non sélectionnable ;
- recherche impossible sans OCR ;
- qualité dépendante du scan ;
- risque d'erreurs de reconnaissance.
Sur un chantier
Ce n'est pas un détail informatique.
Un rapport de contrôle peut contenir des dizaines de références de plans, de lots et d'observations. Dans un PDF natif, ces chaînes de caractères peuvent être lues et rapprochées des documents de l'affaire. Dans un scan, il faut d'abord reconstruire le texte par OCR, puis contrôler ce qui a été reconnu.
Un zéro confondu avec la lettre O, un indice B lu comme un 8 ou une référence coupée sur deux lignes suffit à rattacher une observation au mauvais document. La qualité du fichier source devient donc une question de traçabilité, pas seulement de confort de lecture.
Le même raisonnement vaut pour un cartouche de plan. Un PDF exporté directement depuis le logiciel de dessin offre une information plus exploitable qu'une impression papier rescannée de travers. Demander le fichier numérique d'origine reste souvent plus fiable que corriger ensuite un mauvais scan.
Recherche
Retrouver une référence ou une observation sans parcourir toutes les pages.
Classement
Extraire les informations utiles sans les ressaisir à la main.
Accessibilité
Permettre aux outils d'assistance de lire le texte plutôt qu'une image muette.
Ce que fait Régis aujourd'hui
Le parsing travaille sur les PDF natifs. Point.
Régis analyse en production les rapports PDF natifs émis par les bureaux de contrôle, les coordonnateurs SPS ou les MOEX. Il repère les références documentaires, les lots et les observations, puis présente le résultat dans un sas de validation humaine.
Les PDF scannés ne sont pas pris en charge à ce stade. Cette limite évite de présenter comme fiable une lecture qui dépendrait d'un OCR non contrôlé.
Régis ne décide jamais si une observation est techniquement fondée. Il prépare le rattachement et supprime de la ressaisie. L'auteur du rapport et les professionnels concernés conservent leur rôle.
Si le document est scanné
Quatre réflexes avant de lancer un OCR.
Demander le fichier source
Un export natif existe souvent encore chez l'émetteur. C'est généralement la solution la plus fiable.
Conserver l'original
La version OCR ne doit pas effacer le fichier reçu ni sa provenance.
Contrôler le résultat
Références, indices, tableaux et caractères ambigus demandent une relecture ciblée.
Tracer le traitement
Il faut pouvoir distinguer le document d'origine de la copie enrichie par OCR.

Près de 20 ans de terrain en conduite de travaux et direction d'agence de contrôle technique (Qualiconsult, Alpes Contrôles). Master Génie Civil (Cergy-Pontoise). Créateur de Régis pour mettre fin au chaos documentaire des chantiers.
Découvrir son parcours & l'histoire de Régis →Questions fréquentes
Ce que le format permet réellement.
Comment reconnaître rapidement un PDF natif ?
Essayez de sélectionner un mot et d'utiliser la recherche dans le document. Si le texte est sélectionnable et retrouvable, le PDF contient probablement une couche de texte exploitable. Ce test ne garantit toutefois ni la qualité de la structure ni l'absence de restrictions.
Un PDF scanné peut-il devenir exploitable ?
Oui, une reconnaissance optique de caractères, ou OCR, peut ajouter une couche de texte. Le résultat doit être contrôlé, car la qualité dépend du scan, de la résolution, de l'orientation, des polices et de la mise en page.
Régis analyse-t-il les rapports PDF scannés ?
Pas actuellement. Le parsing des rapports de bureau de contrôle, SPS ou MOEX fonctionne sur les PDF natifs non scannés. Cette limite est volontairement affichée.
Un plan PDF est-il forcément natif ?
Non. Un plan peut avoir été exporté depuis un logiciel de dessin, imprimé puis rescanné, ou aplati sous forme d'image. L'extension PDF ne dit pas comment son contenu a été produit.
Faut-il jeter le fichier d'origine après OCR ?
Non. Il est prudent de conserver l'original et de distinguer la version ayant reçu une couche OCR. Le traitement ne doit pas effacer la provenance ni l'historique du document.