AllFreeConverter

Guide PDF

English

Texte PDF natif ou OCR : modifier un PDF numérisé

Un PDF peut ressembler à du texte tout en ne contenant qu’une image de page. L’éditeur cherche d’abord un texte natif exploitable, puis propose un OCR local facultatif pour les pages qui en ont besoin.

Ouvrir l’éditeur PDF

Le texte natif est déjà dans le PDF

Un PDF textuel contient des caractères et leur position, que le lecteur peut sélectionner ou rechercher. La modification commence alors avec cette couche de texte existante.

  1. 1Ouvrez le PDF et attendez le chargement des lignes.
  2. 2Choisissez Modifier le texte et cliquez sur une ligne sélectionnable.
  3. 3Corrigez la ligne et vérifiez le remplacement visuel avant l’export.

Un scan est une image de page

Un PDF numérisé ne contient généralement pas de couche de caractères exploitable. La page peut rester nette, mais l’éditeur ne trouve aucun mot à sélectionner.

  1. 1Ouvrez le document et repérez les pages sans texte natif significatif.
  2. 2Conservez le texte natif présent sur les pages hybrides.
  3. 3Lancez l’OCR seulement sur les pages contenant des lignes à modifier.

Lancer l’OCR quand c’est nécessaire

La reconnaissance OCR s’exécute localement et prend en charge l’anglais, le français ou les deux. L’OCR aide à modifier le texte ; il n’ajoute pas de couche de texte invisible recherchable à un scan non modifié lors de l’export. Vérifiez les lignes reconnues et corrigez les résultats incertains avant l’export.

  1. 1Choisissez la langue OCR dans l’éditeur.
  2. 2Lancez l’OCR sur les pages manquantes ou utilisez le complément facultatif.
  3. 3Annulez si le document est trop lourd pour l’appareil, puis continuez avec des annotations manuelles.

Connaître la limite

L’OCR ne recrée pas parfaitement la typographie originale. L’identification de police reste une estimation et certains scripts complexes ou séquences combinées peuvent ne pas être reproduits correctement.

  1. 1Comparez chaque ligne modifiée avec le scan.
  2. 2Choisissez une autre police si la suggestion ne convient pas.
  3. 3Conservez le PDF original avec la copie exportée.

Optimiser la précision de l'OCR avant la reconnaissance

L'OCR déchiffre des pixels, pas des lettres : sa précision dépend presque entièrement de la qualité de l'image d'entrée. Un scan propre à 300 DPI donne des résultats nettement meilleurs qu'une photo floue à 72 DPI, quel que soit le moteur utilisé.

  • 300 DPI, la résolution de référence. En dessous de 150 DPI, les caractères deviennent ambigus ; au-delà de 600 DPI, le gain est marginal pour des fichiers bien plus lourds.
  • Numérisez directement à la bonne résolution. Agrandir ensuite une petite image n'ajoute aucun détail : l'information manquante ne se recrée pas.
  • Pages droites. Redressez les pages penchées : un angle de 2 à 3 degrés suffit à faire chuter la précision de reconnaissance.
  • Contraste franc. Encre noire sur blanc, pas de surlignage sur le texte à reconnaître, éclairage uniforme sans ombre portée.
  • Évitez le scan d'un scan. Chaque génération ajoute du bruit et de la compression ; repartez du document papier quand c'est possible.

Choisissez ensuite la langue avant de lancer la reconnaissance : l'OCR de l'éditeur fonctionne en français et en anglais. Une mauvaise langue active le mauvais dictionnaire — des mots français analysés avec un modèle anglais produisent des lettres fantaisistes. Pour un document bilingue, reconnaissez si possible les pages françaises et anglaises séparément.

Préférez une vraie application de numérisation à une simple photo : les applications de scan redressent automatiquement la page, uniformisent l'éclairage et enregistrent directement en PDF. Si vous photographiez avec l'appareil photo standard, vérifiez que le flash est désactivé et que l'image n'est pas compressée à l'extrême — une compression JPEG agressive efface les détails des petits caractères.

PDF hybrides : traiter chaque page selon sa nature

Un même PDF mélange souvent les deux mondes : un contrat généré par un logiciel (pages natives) auquel on a joint les scans des pièces d'identité (pages images). Lancer l'OCR sur tout le document est un gaspillage de temps — et risque d'écraser du texte natif parfaitement propre par une reconnaissance approximative.

Le test est simple et se fait page par page : essayez de sélectionner du texte à la souris. Si la sélection suit les mots, la page est native — n'y touchez pas, l'OCR n'apporterait rien. Si la souris ne sélectionne qu'un bloc ou rien du tout, la page est une image — c'est une candidate pour l'OCR.

Autre indice utile : la taille du fichier. Une page native de texte pèse quelques kilo-octets ; une page scannée en 300 DPI pèse plusieurs centaines de kilo-octets, voire des méga-octets. Un PDF de 40 pages qui pèse 60 Mo est presque certainement un recueil de scans — prévoyez du temps et traitez-le par lots.

Type de pageComment la reconnaîtreAction
NativeTexte sélectionnable, recherche par Ctrl+F fonctionnelleModifier directement, pas d'OCR
Image scannéeSélection impossible, le zoom floute les lettresOCR sur cette page uniquement
Mixte (page native + tampon scanné collé)Une partie sélectionnable, l'autre nonOCR sur la page si nécessaire, puis corriger et comparer avec l'image

Après chaque reconnaissance, comparez la ligne OCR avec le scan original : l'OCR assiste la modification, il ne recrée pas la typographie du document. Conservez le document original à côté de la version modifiée pour toute vérification ultérieure.

Reconnaissance défaillante : tableau de dépannage

Quand le résultat de l'OCR est inutilisable, le problème vient presque toujours de l'entrée ou du réglage — rarement du moteur lui-même. Parcourez ce tableau en partant du symptôme.

SymptômeCause probableCorrection
Caractères fantaisistes ou mots incompréhensiblesLangue mal choisie : texte français analysé avec un modèle anglaisRelancer l'OCR avec la bonne langue
Accents et cédilles manquants ou remplacésLangue ou encodage inadapté au texteVérifier la langue, relancer ; corriger à la main les cas restants
Texte incliné non reconnuPage penchée ou photo prise de biaisRedresser la page ou la rephotographier bien à plat
Lignes sautées ou paragraphes fusionnésMise en page complexe : colonnes, tableaux, encadrésTraiter page par page et vérifier chaque bloc séparément
Rien n'est reconnuRésolution trop basse (moins de 150 DPI) ou image trop sombreRenumériser à 300 DPI avec un bon contraste
Écriture manuscrite illisible pour l'OCRL'OCR est conçu pour le texte impriméNe pas compter sur l'OCR : recopier dans une zone de texte via l'éditeur

Si le document est très volumineux et que la reconnaissance semble bloquée, annulez et traitez les pages par petits lots : quelques pages à la fois restent rapides et stables, et vous repérez les erreurs au fil de l'eau.

Règle de décision : si plus d'un mot sur dix reste faux après correction des réglages, recopier le passage à la main dans une zone de texte est plus rapide que de corriger ligne par ligne. L'OCR reste utile pour repérer la structure du document, même quand vous retapez le contenu.

Scénarios réels : factures, contrats, archives

Factures et relevés. Chiffres et tableaux dominent, et une erreur d'OCR sur un montant change le sens du document. Vérifiez chaque chiffre contre l'image, en particulier les confusions classiques : 0 et O, 1 et I, 5 et S. Pour un simple archivage, une reconnaissance imparfaite suffit ; dès que vous corrigez, relisez tout.

Contrats. Le texte est dense et la moindre modification engage. Lancez l'OCR page par page dans l'éditeur, corrigez, puis relisez le document exporté intégralement avant tout envoi. Gardez le scan original comme pièce de référence : en cas de litige, c'est lui qui fait foi, pas la version reconstruite.

Archives anciennes. Encres pâles, papiers jaunis, polices d'époque : attendez-vous à une précision moindre et prévoyez une relecture attentive. Ici, l'OCR sert surtout à rendre le document cherchable et modifiable ; le scan original reste la version de référence.

Documents techniques et plans. Légendes, cotes et annotations sont souvent en petites capitales ou en italique, deux styles que l'OCR confond facilement. Vérifiez particulièrement les unités et les chiffres des cotes, et comparez le document exporté au scan à 100 % de zoom avant diffusion.

Dans les trois cas, toute la reconnaissance s'exécute localement : factures, contrats et archives ne quittent jamais votre navigateur, ce qui est essentiel pour des documents sensibles.