Guide PDF
EnglishTexte PDF natif ou OCR : modifier un PDF numérisé
Un PDF peut ressembler à du texte tout en ne contenant qu’une image de page. L’éditeur cherche d’abord un texte natif exploitable, puis propose un OCR local facultatif pour les pages qui en ont besoin.
Ouvrir l’éditeur PDFLe texte natif est déjà dans le PDF
Un PDF textuel contient des caractères et leur position, que le lecteur peut sélectionner ou rechercher. La modification commence alors avec cette couche de texte existante.
- 1Ouvrez le PDF et attendez le chargement des lignes.
- 2Choisissez Modifier le texte et cliquez sur une ligne sélectionnable.
- 3Corrigez la ligne et vérifiez le remplacement visuel avant l’export.
Un scan est une image de page
Un PDF numérisé ne contient généralement pas de couche de caractères exploitable. La page peut rester nette, mais l’éditeur ne trouve aucun mot à sélectionner.
- 1Ouvrez le document et repérez les pages sans texte natif significatif.
- 2Conservez le texte natif présent sur les pages hybrides.
- 3Lancez l’OCR seulement sur les pages contenant des lignes à modifier.
Lancer l’OCR quand c’est nécessaire
La reconnaissance OCR s’exécute localement et prend en charge l’anglais, le français ou les deux. L’OCR aide à modifier le texte ; il n’ajoute pas de couche de texte invisible recherchable à un scan non modifié lors de l’export. Vérifiez les lignes reconnues et corrigez les résultats incertains avant l’export.
- 1Choisissez la langue OCR dans l’éditeur.
- 2Lancez l’OCR sur les pages manquantes ou utilisez le complément facultatif.
- 3Annulez si le document est trop lourd pour l’appareil, puis continuez avec des annotations manuelles.
Connaître la limite
L’OCR ne recrée pas parfaitement la typographie originale. L’identification de police reste une estimation et certains scripts complexes ou séquences combinées peuvent ne pas être reproduits correctement.
- 1Comparez chaque ligne modifiée avec le scan.
- 2Choisissez une autre police si la suggestion ne convient pas.
- 3Conservez le PDF original avec la copie exportée.
Optimiser la précision de l'OCR avant la reconnaissance
L'OCR déchiffre des pixels, pas des lettres : sa précision dépend presque entièrement de la qualité de l'image d'entrée. Un scan propre à 300 DPI donne des résultats nettement meilleurs qu'une photo floue à 72 DPI, quel que soit le moteur utilisé.
- 300 DPI, la résolution de référence. En dessous de 150 DPI, les caractères deviennent ambigus ; au-delà de 600 DPI, le gain est marginal pour des fichiers bien plus lourds.
- Numérisez directement à la bonne résolution. Agrandir ensuite une petite image n'ajoute aucun détail : l'information manquante ne se recrée pas.
- Pages droites. Redressez les pages penchées : un angle de 2 à 3 degrés suffit à faire chuter la précision de reconnaissance.
- Contraste franc. Encre noire sur blanc, pas de surlignage sur le texte à reconnaître, éclairage uniforme sans ombre portée.
- Évitez le scan d'un scan. Chaque génération ajoute du bruit et de la compression ; repartez du document papier quand c'est possible.
Choisissez ensuite la langue avant de lancer la reconnaissance : l'OCR de l'éditeur fonctionne en français et en anglais. Une mauvaise langue active le mauvais dictionnaire — des mots français analysés avec un modèle anglais produisent des lettres fantaisistes. Pour un document bilingue, reconnaissez si possible les pages françaises et anglaises séparément.
Préférez une vraie application de numérisation à une simple photo : les applications de scan redressent automatiquement la page, uniformisent l'éclairage et enregistrent directement en PDF. Si vous photographiez avec l'appareil photo standard, vérifiez que le flash est désactivé et que l'image n'est pas compressée à l'extrême — une compression JPEG agressive efface les détails des petits caractères.
PDF hybrides : traiter chaque page selon sa nature
Un même PDF mélange souvent les deux mondes : un contrat généré par un logiciel (pages natives) auquel on a joint les scans des pièces d'identité (pages images). Lancer l'OCR sur tout le document est un gaspillage de temps — et risque d'écraser du texte natif parfaitement propre par une reconnaissance approximative.
Le test est simple et se fait page par page : essayez de sélectionner du texte à la souris. Si la sélection suit les mots, la page est native — n'y touchez pas, l'OCR n'apporterait rien. Si la souris ne sélectionne qu'un bloc ou rien du tout, la page est une image — c'est une candidate pour l'OCR.
Autre indice utile : la taille du fichier. Une page native de texte pèse quelques kilo-octets ; une page scannée en 300 DPI pèse plusieurs centaines de kilo-octets, voire des méga-octets. Un PDF de 40 pages qui pèse 60 Mo est presque certainement un recueil de scans — prévoyez du temps et traitez-le par lots.
| Type de page | Comment la reconnaître | Action |
|---|---|---|
| Native | Texte sélectionnable, recherche par Ctrl+F fonctionnelle | Modifier directement, pas d'OCR |
| Image scannée | Sélection impossible, le zoom floute les lettres | OCR sur cette page uniquement |
| Mixte (page native + tampon scanné collé) | Une partie sélectionnable, l'autre non | OCR sur la page si nécessaire, puis corriger et comparer avec l'image |
Après chaque reconnaissance, comparez la ligne OCR avec le scan original : l'OCR assiste la modification, il ne recrée pas la typographie du document. Conservez le document original à côté de la version modifiée pour toute vérification ultérieure.
Reconnaissance défaillante : tableau de dépannage
Quand le résultat de l'OCR est inutilisable, le problème vient presque toujours de l'entrée ou du réglage — rarement du moteur lui-même. Parcourez ce tableau en partant du symptôme.
| Symptôme | Cause probable | Correction |
|---|---|---|
| Caractères fantaisistes ou mots incompréhensibles | Langue mal choisie : texte français analysé avec un modèle anglais | Relancer l'OCR avec la bonne langue |
| Accents et cédilles manquants ou remplacés | Langue ou encodage inadapté au texte | Vérifier la langue, relancer ; corriger à la main les cas restants |
| Texte incliné non reconnu | Page penchée ou photo prise de biais | Redresser la page ou la rephotographier bien à plat |
| Lignes sautées ou paragraphes fusionnés | Mise en page complexe : colonnes, tableaux, encadrés | Traiter page par page et vérifier chaque bloc séparément |
| Rien n'est reconnu | Résolution trop basse (moins de 150 DPI) ou image trop sombre | Renumériser à 300 DPI avec un bon contraste |
| Écriture manuscrite illisible pour l'OCR | L'OCR est conçu pour le texte imprimé | Ne pas compter sur l'OCR : recopier dans une zone de texte via l'éditeur |
Si le document est très volumineux et que la reconnaissance semble bloquée, annulez et traitez les pages par petits lots : quelques pages à la fois restent rapides et stables, et vous repérez les erreurs au fil de l'eau.
Règle de décision : si plus d'un mot sur dix reste faux après correction des réglages, recopier le passage à la main dans une zone de texte est plus rapide que de corriger ligne par ligne. L'OCR reste utile pour repérer la structure du document, même quand vous retapez le contenu.
Scénarios réels : factures, contrats, archives
Factures et relevés. Chiffres et tableaux dominent, et une erreur d'OCR sur un montant change le sens du document. Vérifiez chaque chiffre contre l'image, en particulier les confusions classiques : 0 et O, 1 et I, 5 et S. Pour un simple archivage, une reconnaissance imparfaite suffit ; dès que vous corrigez, relisez tout.
Contrats. Le texte est dense et la moindre modification engage. Lancez l'OCR page par page dans l'éditeur, corrigez, puis relisez le document exporté intégralement avant tout envoi. Gardez le scan original comme pièce de référence : en cas de litige, c'est lui qui fait foi, pas la version reconstruite.
Archives anciennes. Encres pâles, papiers jaunis, polices d'époque : attendez-vous à une précision moindre et prévoyez une relecture attentive. Ici, l'OCR sert surtout à rendre le document cherchable et modifiable ; le scan original reste la version de référence.
Documents techniques et plans. Légendes, cotes et annotations sont souvent en petites capitales ou en italique, deux styles que l'OCR confond facilement. Vérifiez particulièrement les unités et les chiffres des cotes, et comparez le document exporté au scan à 100 % de zoom avant diffusion.
Dans les trois cas, toute la reconnaissance s'exécute localement : factures, contrats et archives ne quittent jamais votre navigateur, ce qui est essentiel pour des documents sensibles.