Cómo aplicar OCR a un PDF escaneado para buscar y copiar su texto
2026-09-14
Un PDF escaneado es una pila de fotos. Sin OCR (reconocimiento óptico de caracteres) no puedes buscarlo, copiarlo ni citarlo. El OCR lee las formas de las letras de las imágenes y añade encima una capa de texto real e invisible.
Paso 1: comprueba qué tienes en realidad
Abre el archivo e intenta seleccionar una palabra. Si el cursor agarra texto, tu PDF ya tiene capa de texto y no necesitas OCR. Si dibuja un recuadro sobre una foto, es un escaneo y el OCR es el camino.
Paso 2: ejecuta la herramienta y elige el idioma
Abre la herramienta de OCR, suelta el escaneo y elige el idioma del documento. Los datos de idioma importan: pasar modelos ingleses sobre un escaneo japonés produce disparate con seguridad. El reconocimiento corre en tu dispositivo; un contrato escaneado no necesita subirse a ninguna parte.
Paso 3: verifica contra el original
El OCR es un motor de probabilidades, no un mecanógrafo. Revisa nombres, números e importes contra la imagen de la página, sobre todo en documentos importantes. Los escaneos limpios de texto impreso suelen quedar casi perfectos; los recibos de poco contraste y las notas manuscritas, no.
Lo que mejora la precisión
- Más resolución de escaneo: 300 DPI es el punto óptimo; por debajo de 150 DPI la precisión cae rápido.
- Páginas rectas: endereza los escaneos torcidos antes del OCR.
- Un idioma por pasada: los documentos bilingües van mejor con dos pasadas que con un modelo mixto.
Tras el OCR: lo que obtienes
El resultado es un PDF buscable en cualquier lector, o texto plano para pegar donde quieras. Buscar 'factura 1042' en cientos de páginas solo funciona si existe la capa de texto: ese es todo el punto.