El software de OCR reconoce las formas para las que ha sido entrenado. Si lo apuntas a un idioma que no conoce, no falla de forma evidente: hace lo posible por hacer coincidir lo que ve con caracteres que sí conoce, y devuelve un texto que a primera vista parece plausible y que en realidad es un sinsentido. Vale la pena saber exactamente qué se admite antes de confiar en el resultado.
OCR PDF reconoce texto en inglés e hindi. Un documento escaneado en cualquiera de esos dos idiomas obtiene un reconocimiento preciso, que se añade como una capa de texto invisible y buscable bajo la imagen original de la página: la página sigue teniendo el aspecto de tu escaneo, pero el texto se vuelve seleccionable y localizable con Ctrl/Cmd+F.
Un documento en español, francés, alemán, árabe, chino o cualquier idioma fuera de ese par igualmente se procesa; la herramienta no detecta el idioma y se niega a continuar, porque ese es un problema genuinamente difícil de resolver bien para cada guion posible. Lo que se obtiene en su lugar es el texto que el reconocedor produjo emparejando formas de caracteres que conoce con un idioma que no conoce, lo que para un idioma de alfabeto latino como el español o el francés puede dar un resultado parcialmente correcto (las letras compartidas se reconocen; los caracteres acentuados y la ortografía propia del idioma, a menudo no) y para un guion no latino como el árabe o el chino resulta esencialmente ininteligible. La señal práctica para detectarlo: busca una palabra que sepas con certeza que está en la página una vez que termine el OCR. Si Ctrl/Cmd+F no la encuentra, o la encuentra como caracteres desordenados, el reconocimiento no funcionó de verdad para ese idioma, sea cual sea el resultado que haya devuelto la herramienta.
Qué hacer depende del tamaño del documento. Para uno corto, vuelve a escribirlo — para una página o dos, esto es realmente más rápido que pelear con un resultado de OCR impreciso y corregir a mano cada error. Para uno largo que necesitas buscable pero no editable, la mayoría de los lectores de PDF integrados en navegadores y sistemas operativos (Chrome, Adobe Reader, Vista previa de macOS) incluyen sus propias funciones de OCR o de capa de texto para un abanico de idiomas más amplio que cualquier herramienta online por sí sola, así que vale la pena comprobar qué tienes ya en tu dispositivo antes de dar por hecho que necesitas una herramienta nueva. Y si lo que necesitas es traducir el documento, no solo hacerlo buscable, ten en cuenta que el OCR y la traducción son problemas distintos: extraer el texto de la imagen con la herramienta adecuada y traducirlo después por separado da resultados más fiables que esperar que un solo paso haga ambas cosas.
Si un documento está mayoritariamente en inglés o hindi con palabras sueltas en otro idioma —un nombre, un lugar, un término técnico—, el texto en el idioma admitido que lo rodea seguirá reconociéndose correctamente; solo las palabras en el idioma extranjero podrían llegar mal. Suele ser un problema menor, corregible a mano, más que un motivo para descartar el OCR por completo.
Una vez que tu documento está en un idioma admitido, el resto del flujo de trabajo no cambia: OCR PDF hace que el texto sea buscable y seleccionable, y a partir de ahí puedes convertirlo a un documento Word editable o comprimir el resultado si el escaneo es pesado. Para profundizar más, Los mejores ajustes de escaneo para OCR y Cómo hacer que un PDF escaneado sea buscable cubren el resto del proceso.
La herramienta OCR PDF es gratuita, no requiere cuenta, no añade marca de agua y no guarda tu archivo una vez terminado el procesamiento.