OCR für gescannte PDFs

Einen Scan in Text umwandeln

Keine Datenbank: AIMRAN speichert weder deine Dateien noch Texte oder Ergebnisse

Was ist OCR für gescannte PDFs?

Ein gescanntes PDF ist eigentlich ein Foto jeder Seite: Du kannst weder nach Wörtern suchen noch den Text kopieren. OCR liest diese Bilder und erkennt die Buchstaben, um sie in echten Text umzuwandeln.

Du erhältst den erkannten Text zum Kopieren oder Herunterladen und auf Wunsch ein durchsuchbares PDF: dasselbe Dokument mit demselben Aussehen, in dem du nun mit Strg+F suchen und Text markieren kannst.

So funktioniert es

  1. Zieh das gescannte PDF hinein.
  2. Wähle die Sprache des Dokuments: Spanisch, Englisch oder beide.
  3. Aktiviere „Durchsuchbares PDF erstellen“, wenn du das PDF mit Text möchtest.
  4. Klicke auf „Text erkennen“ und warte, bis alle Seiten verarbeitet sind.
  5. Kopiere oder lade den Text herunter und, falls angefordert, das durchsuchbare PDF.

Vorteile

Technische Details

Die Erkennung nutzt tesseract.js mit der LSTM-Engine, automatischer Seitensegmentierung und Beibehaltung der Leerzeichen zwischen Wörtern. Jede Seite wird mit pdf.js mit etwa 300 dpi gerendert, mit maximal 4200 px pro Seite, der für Tesseract empfohlenen Auflösung. Für das durchsuchbare PDF erzeugt Tesseract pro Seite eine unsichtbare Textebene, die mit pdf-lib über die Originalseite gelegt wird, ohne das Bild zu verändern und unter Berücksichtigung seiner Drehung. Die Sprachdaten werden beim ersten Mal heruntergeladen (etwa 2 MB für Spanisch, 3 MB für Englisch und 5 MB für beide). Die Genauigkeit hängt von der Scanqualität ab; Handschrift wird nicht zuverlässig erkannt.

Häufige Fragen

Wie wandle ich ein gescanntes PDF in bearbeitbaren Text um?

Zieh das PDF hinein, wähle die Sprache und klicke auf „Text erkennen“. Kopiere dann den Text oder lade ihn als .txt herunter, um ihn zu bearbeiten.

Was ist ein durchsuchbares PDF?

Ein PDF, das genauso aussieht wie der ursprüngliche Scan, aber den erkannten Text unsichtbar darunter enthält, sodass du nach Wörtern suchen und Passagen kopieren kannst.

Woran erkenne ich, ob mein PDF OCR braucht?

Wenn du den Text nicht mit der Maus markieren kannst oder die Suche nichts findet, ist das PDF gescannt und braucht OCR.

Wie erziele ich bessere Ergebnisse?

Scanne in guter Auflösung, mit geraden, gut ausgeleuchteten Seiten, und wähle die richtige Sprache des Dokuments.

Weitere Tools: PDF