Cómo convertir un PDF escaneado a Word

Un conversor normal de PDF a Word lee texto. Un PDF escaneado no tiene ninguno, solo la foto de una página. La ruta de dos pasos a un Word editable.

Por

Founder & Developer of PDFtoWord

Subes un PDF escaneado a un conversor, descargas el .docx y lo abres para encontrarte con… una imagen. No texto roto, ni formato con errores: una imagen de verdad colocada sobre la página, sin nada en lo que puedas hacer clic ni editar. Eso no es un fallo del conversor. Es una descripción de lo que realmente contiene un PDF escaneado.

Un PDF creado desde Word, Google Docs o una página web guarda caracteres reales: letras, con una fuente y una posición. Convertirlo a Word consiste en leer esos caracteres y reconstruirlos como párrafos. Un PDF escaneado no guarda nada de eso. Un escáner, una fotocopiadora o la cámara de un teléfono capturaron una fotografía de la página, y esa fotografía es todo lo que contiene el archivo. En lo que respecta al formato, no hay texto que extraer: solo píxeles, igual que el dibujo de una alfombra. Pasa esa página por un conversor de PDF a Word y lo único honesto que puede hacer es colocar la imagen en una página, porque no hay texto debajo que recuperar.

La solución es hacerlo en dos pasos: primero OCR, después convertir. OCR PDF lee la forma de las letras en cada página y las añade de nuevo como una capa de texto real e invisible situada justo debajo de la imagen original; la página se ve exactamente igual, este paso no toca la apariencia en absoluto, pero el archivo ahora contiene texto real que un conversor puede leer. Una vez que existe esa capa de texto, PDF a Word tiene algo con lo que trabajar: lee el texto reconocido y lo reconstruye como un .docx editable, con párrafos en los que puedes hacer clic, reescribir y reformatear, no la imagen de una página. Si tu documento mezcla páginas escaneadas con páginas que ya tienen texto real, algo habitual en PDF de varias fuentes montados a partir de archivos distintos, el OCR lo detecta automáticamente: las páginas que ya son texto se dejan tal cual, y solo a las páginas realmente escaneadas se les añade una capa de texto.

La precisión del OCR depende de la calidad del escaneo. Una página limpia, recta, bien iluminada y de alta resolución se reconoce casi a la perfección. Una página borrosa, torcida, tenue o manuscrita produce más errores, y deberías esperar tener que revisar el resultado en lugar de confiar en él al pie de la letra, sobre todo nombres, números y cualquier cosa escrita a mano, ya que el OCR está pensado para texto impreso. Las tablas y los diseños a varias columnas son el caso más difícil: el OCR reconoce las palabras correctamente pero puede perder la estructura de cuadrícula original, así que una tabla de una factura escaneada puede volver como texto de Word en un orden aproximadamente correcto en lugar de una tabla limpia. Si el origen es principalmente una tabla —un extracto bancario, una factura—, PDF a Excel después del OCR suele dar un resultado más útil que Word.

Lectura relacionada: Cómo hacer que un PDF escaneado sea buscable para el paso de OCR por sí solo, cuando solo necesitas que funcione Ctrl+F, y Por qué no puedes seleccionar ni buscar texto en un PDF para las tres razones por las que un PDF se resiste a copiarse, siendo “es un escaneo” la más habitual.

El camino completo, OCR PDF seguido de PDF a Word, no pide registro, no añade marca de agua, y no guarda tu archivo en nuestros servidores.