Los mejores ajustes de escaneo para OCR

La precisión del OCR se decide antes de escanear. La resolución, el modo de color y el formato le dan al reconocimiento de texto su mejor oportunidad.

Por

Founder & Developer of PDFtoWord

El OCR lee la forma de las letras y las convierte de nuevo en texto, lo que significa que la nitidez con la que se capturaron esas formas desde el principio marca un límite estricto a la precisión que puede alcanzar el resultado. Ningún motor de OCR recupera detalles que un mal escaneo nunca llegó a capturar. Esto es lo que realmente influye en la precisión, ajuste por ajuste:

Ajuste Recomendación Por qué
Resolución 300 PPP Por debajo de 200 PPP la precisión cae, sobre todo en fuentes pequeñas y notas al pie; por encima de 400 PPP el archivo crece sin mejora real, salvo en texto muy fino (recibos, letra pequeña legal), donde 400–600 PPP sí ayuda
Modo de color Escala de grises El blanco y negro puro (1 bit) pierde texto tenue; el color completo captura información que el OCR no necesita y dispara el tamaño del archivo sin ganar precisión
Rectitud de la página Alineada con el borde Una página torcida perjudica el reconocimiento porque los motores de OCR esperan líneas de texto horizontales
Iluminación Uniforme y plana Una luz intensa con sombras crea un degradado de brillo que puede hacer que el OCR interprete mal el texto en las zonas más oscuras
Formato de archivo PNG, TIFF o PDF sin comprimir La compresión JPEG agresiva introduce artefactos en bloque alrededor de los bordes de las letras que degradan la lectura

Si escaneas con la cámara del teléfono en lugar de un escáner plano, la resolución como ajuste no se aplica de la misma forma: acércate lo suficiente para que el texto ocupe una parte razonable del encuadre y asegúrate de que el enfoque sea nítido, ya que el desenfoque tiene el mismo efecto que una resolución baja. La excepción al modo de color es cuando el documento tiene resaltados en color, sellos o diagramas que importan visualmente: ahí conviene escanear en color y aceptar el archivo más grande, porque la pérdida de precisión para el texto puro es pequeña frente a lo que se conserva.

Sobre la rectitud, un escáner plano con el papel alineado a la guía del borde la resuelve casi por completo; una cámara de teléfono necesita una toma más cuadrada y deliberada de lo que parece necesario. Escanear a PDF corrige esto de forma automática al escanear con el móvil, recortando y enderezando cada página mientras la capturas — la misma herramienta que conviene usar si un día nublado cerca de una ventana o una luz interior difusa te dan mejor resultado que el sol directo o una sola lámpara de escritorio.

Con un escaneo limpio —300 PPP, escala de grises, recto y bien iluminado— el siguiente paso es OCR PDF, que añade una capa de texto con la que se pueda buscar; o empieza directamente con Escanear a PDF si estás capturando con el teléfono, ya que se encarga de recortar y enderezar como parte del mismo proceso.

Dos lecturas relacionadas: cómo hacer que un PDF escaneado se pueda buscar explica qué hace el OCR una vez que el escaneo está listo, y por qué no puedes seleccionar ni buscar texto en un PDF cubre la razón de fondo por la que los escaneos no se pueden buscar desde el principio. Si vas a escanear algo que no está en español, ¿funciona OCR PDF en otros idiomas? explica qué alfabetos y caracteres acentuados se reconocen de forma fiable.

La herramienta OCR PDF no pide registro, no añade marca de agua, y el archivo desaparece justo después de procesarlo.