O software de OCR reconhece as formas para as quais foi treinado. Aponte-o para um idioma que ele não conhece, e ele não falha de forma evidente — faz o possível para associar o que vê a caracteres que conhece, e devolve um texto que parece plausível à primeira vista, mas que na verdade não faz sentido nenhum. Vale a pena saber exatamente o que é compatível antes de confiar no resultado.
O OCR em PDF reconhece texto em inglês e hindi. Um documento digitalizado em qualquer um desses dois idiomas recebe um reconhecimento preciso, adicionado como uma camada de texto invisível e pesquisável sob a imagem original da página — a página continua com a aparência da sua digitalização, mas o texto se torna selecionável e localizável com Ctrl/Cmd+F.
Um documento em espanhol, francês, alemão, árabe, chinês ou qualquer idioma fora desse par ainda assim é processado — a ferramenta não detecta o idioma e recusa o processamento, porque esse é um problema genuinamente difícil de resolver bem para qualquer sistema de escrita possível. O que você recebe em vez disso é o texto que o reconhecedor produziu ao comparar formas de caracteres que conhece com um idioma que não conhece, o que, para um idioma de alfabeto latino como espanhol ou francês, pode gerar um resultado parcialmente correto — letras compartilhadas são reconhecidas; caracteres acentuados e a ortografia específica do idioma, muitas vezes não — e, para um sistema de escrita não latino como árabe ou chinês, é essencialmente sem sentido. O indício prático para descobrir se funcionou: procure uma palavra que você sabe com certeza que está na página depois que o OCR terminar. Se Ctrl/Cmd+F não a encontrar, ou a encontrar como caracteres embaralhados, o reconhecimento não funcionou de verdade para aquele idioma, independentemente do que a ferramenta tenha retornado.
Se o seu documento estiver em outro idioma, o caminho depende do que você precisa. Um documento curto vale digitar de novo — para uma ou duas páginas, isso é genuinamente mais rápido do que lutar contra um resultado de OCR impreciso e corrigir manualmente cada erro. Um documento longo que precisa ser pesquisável, mas não necessariamente editável, pode se resolver com o que já existe no seu dispositivo: a maioria dos leitores de PDF embutidos em navegadores e sistemas operacionais (Chrome, Adobe Reader, Visualização do macOS) inclui seus próprios recursos de OCR ou de camada de texto para uma gama de idiomas mais ampla do que qualquer ferramenta online isolada, e vale a pena verificar isso antes de presumir que precisa de uma ferramenta totalmente nova. E se o que você precisa é traduzir o documento, não apenas torná-lo pesquisável, vale lembrar que OCR e tradução são problemas separados — extrair o texto da imagem com a ferramenta certa e depois traduzi-lo separadamente dá resultados mais confiáveis do que esperar que uma única etapa faça as duas coisas.
Documentos em vários idiomas são um caso à parte: se um documento está majoritariamente em inglês ou hindi, com palavras ocasionais em outro idioma — um nome, um lugar, um termo técnico —, o texto ao redor no idioma compatível ainda será reconhecido corretamente; apenas as próprias palavras no idioma estrangeiro podem sair erradas. Geralmente é um problema pequeno, fácil de corrigir manualmente, e não um motivo para evitar o OCR por completo.
Depois que o seu documento estiver em um idioma compatível, o restante do fluxo de trabalho não muda: o OCR em PDF torna o texto pesquisável e selecionável, e a partir daí você pode convertê-lo em um documento Word editável ou comprimir o resultado se a digitalização for grande.
Leitura relacionada: As melhores configurações de escâner para OCR e Como tornar um PDF digitalizado pesquisável. A ferramenta OCR em PDF é gratuita para inglês e hindi, sem conta, sem marca d’água, e o arquivo nunca fica armazenado do nosso lado.