OCR de PDF numérisé

Convertissez un scan en texte

Aucune base de données : AIMRAN ne conserve ni vos fichiers, ni vos textes, ni vos résultats

Qu’est-ce que OCR de PDF numérisé ?

Un PDF scanné est en réalité une photo de chaque page : impossible d’y rechercher des mots ou d’en copier le texte. L’OCR lit ces images et reconnaît les lettres pour les transformer en vrai texte.

Vous obtenez le texte reconnu à copier ou télécharger et, si vous le souhaitez, un PDF consultable : le même document, avec le même aspect, mais dans lequel vous pouvez désormais chercher avec Ctrl+F et sélectionner le texte.

Mode d’emploi

  1. Glissez le PDF scanné.
  2. Choisissez la langue du document : espagnol, anglais ou les deux.
  3. Activez « Créer un PDF consultable » si vous voulez le PDF avec texte.
  4. Cliquez sur « Reconnaître le texte » et attendez le traitement de toutes les pages.
  5. Copiez ou téléchargez le texte et, si vous l’avez demandé, le PDF consultable.

Avantages

Détails techniques

La reconnaissance utilise tesseract.js avec le moteur LSTM, la segmentation automatique et la conservation des espaces entre les mots. Chaque page est rendue avec pdf.js à environ 300 ppp, avec un maximum de 4200 px de côté, la résolution recommandée pour Tesseract. Pour le PDF consultable, Tesseract génère une couche de texte invisible par page, superposée avec pdf-lib à la page d’origine sans toucher à l’image et en respectant sa rotation. Les données de langue sont téléchargées la première fois (environ 2 Mo pour l’espagnol, 3 Mo pour l’anglais et 5 Mo pour les deux). La précision dépend de la qualité du scan ; l’écriture manuscrite n’est pas reconnue de façon fiable.

Questions fréquentes

Comment convertir un PDF scanné en texte modifiable ?

Glissez le PDF, choisissez la langue et cliquez sur « Reconnaître le texte ». Copiez ensuite le texte ou téléchargez-le en .txt pour le modifier.

Qu’est-ce qu’un PDF consultable ?

C’est un PDF qui a exactement l’aspect du scan d’origine mais qui contient le texte reconnu caché en dessous : vous pouvez y rechercher des mots et copier des passages.

Comment savoir si mon PDF a besoin d’OCR ?

Si vous ne pouvez pas sélectionner le texte à la souris ou si la recherche ne trouve rien, le PDF est scanné et a besoin d’OCR.

Comment obtenir de meilleurs résultats ?

Scannez à une bonne résolution, avec des pages droites et bien éclairées, et choisissez la bonne langue du document.

Plus d’outils : PDF