OCR de PDF numérisé
Convertissez un scan en texte
Aucune base de données : AIMRAN ne conserve ni vos fichiers, ni vos textes, ni vos résultats
Qu’est-ce que OCR de PDF numérisé ?
Un PDF scanné est en réalité une photo de chaque page : impossible d’y rechercher des mots ou d’en copier le texte. L’OCR lit ces images et reconnaît les lettres pour les transformer en vrai texte.
Vous obtenez le texte reconnu à copier ou télécharger et, si vous le souhaitez, un PDF consultable : le même document, avec le même aspect, mais dans lequel vous pouvez désormais chercher avec Ctrl+F et sélectionner le texte.
Mode d’emploi
- Glissez le PDF scanné.
- Choisissez la langue du document : espagnol, anglais ou les deux.
- Activez « Créer un PDF consultable » si vous voulez le PDF avec texte.
- Cliquez sur « Reconnaître le texte » et attendez le traitement de toutes les pages.
- Copiez ou téléchargez le texte et, si vous l’avez demandé, le PDF consultable.
Avantages
- Transforme les scans en PDF consultables sans changer leur aspect.
- Reconnaissance en espagnol, en anglais ou dans les deux langues.
- Traite toutes les pages du document en une fois.
- Gratuit et sans inscription.
Détails techniques
La reconnaissance utilise tesseract.js avec le moteur LSTM, la segmentation automatique et la conservation des espaces entre les mots. Chaque page est rendue avec pdf.js à environ 300 ppp, avec un maximum de 4200 px de côté, la résolution recommandée pour Tesseract. Pour le PDF consultable, Tesseract génère une couche de texte invisible par page, superposée avec pdf-lib à la page d’origine sans toucher à l’image et en respectant sa rotation. Les données de langue sont téléchargées la première fois (environ 2 Mo pour l’espagnol, 3 Mo pour l’anglais et 5 Mo pour les deux). La précision dépend de la qualité du scan ; l’écriture manuscrite n’est pas reconnue de façon fiable.
Questions fréquentes
Comment convertir un PDF scanné en texte modifiable ?
Glissez le PDF, choisissez la langue et cliquez sur « Reconnaître le texte ». Copiez ensuite le texte ou téléchargez-le en .txt pour le modifier.
Qu’est-ce qu’un PDF consultable ?
C’est un PDF qui a exactement l’aspect du scan d’origine mais qui contient le texte reconnu caché en dessous : vous pouvez y rechercher des mots et copier des passages.
Comment savoir si mon PDF a besoin d’OCR ?
Si vous ne pouvez pas sélectionner le texte à la souris ou si la recherche ne trouve rien, le PDF est scanné et a besoin d’OCR.
Comment obtenir de meilleurs résultats ?
Scannez à une bonne résolution, avec des pages droites et bien éclairées, et choisissez la bonne langue du document.
Plus d’outils : PDF
- Fusionner des PDF · Combinez plusieurs PDF et réorganisez les pages par glisser-déposer
- Diviser un PDF · Par plages, chaque page ou toutes les N pages
- Compresser un PDF · Trois niveaux de compression avec qualité réglable
- Pivoter des pages · Faites pivoter certaines pages ou toutes
- Supprimer des pages · Retirez les pages dont vous ne voulez pas
- Réorganiser les pages · Faites glisser les miniatures pour changer l’ordre
- Extraire des pages · Placez les pages choisies dans un nouveau PDF
- PDF en JPG/PNG · Une image par page, DPI au choix