OCR de PDF escaneado

Convierte un escaneo en texto

Sin base de datos: AIMRAN no guarda tus archivos, textos ni resultados

¿Qué es OCR de PDF escaneado?

Un PDF escaneado es, en realidad, una foto de cada página: no puedes buscar palabras ni copiar el texto. El OCR lee esas imágenes y reconoce las letras para convertirlas en texto de verdad.

Obtienes el texto reconocido para copiarlo o descargarlo y, si quieres, un PDF buscable: el mismo documento, con el mismo aspecto, pero en el que ya puedes buscar con Ctrl+F y seleccionar el texto.

Cómo se usa

  1. Arrastra el PDF escaneado.
  2. Elige el idioma del documento: español, inglés o ambos.
  3. Activa «Crear PDF buscable» si quieres el PDF con texto.
  4. Pulsa «Reconocer texto» y espera a que procese todas las páginas.
  5. Copia o descarga el texto y, si lo has pedido, el PDF buscable.

Ventajas

Detalles técnicos

El reconocimiento usa tesseract.js con el motor LSTM, modo de segmentación automático y conservación de los espacios entre palabras. Cada página se renderiza con pdf.js a unos 300 ppp, con un máximo de 4200 px por lado, que es la resolución recomendada para Tesseract. Para el PDF buscable, Tesseract genera una capa de texto invisible por página que se superpone con pdf-lib a la página original, sin tocar la imagen y respetando su rotación. Los datos de idioma se descargan la primera vez (unos 2 MB el español, 3 MB el inglés y 5 MB ambos). La precisión depende de la calidad del escaneo; la escritura a mano no se reconoce de forma fiable.

Preguntas frecuentes

¿Cómo convertir un PDF escaneado en texto editable?

Arrastra el PDF, elige el idioma y pulsa «Reconocer texto». Después copia el texto o descárgalo en .txt para editarlo.

¿Qué es un PDF buscable?

Es un PDF que se ve igual que el escaneo original pero lleva el texto reconocido oculto debajo, de modo que puedes buscar palabras y copiar fragmentos.

¿Cómo saber si mi PDF necesita OCR?

Si no puedes seleccionar el texto con el ratón o la búsqueda no encuentra nada, el PDF está escaneado y necesita OCR.

¿Cómo conseguir mejores resultados?

Escanea a buena resolución, con las páginas rectas y bien iluminadas, y elige el idioma correcto del documento.

Más herramientas de PDF