O OCR lê o formato das letras e as transforma de volta em texto — o que significa que a nitidez com que essas formas foram capturadas de início impõe um limite rígido à precisão que o resultado pode ter. Nenhum mecanismo de reconhecimento recupera detalhes que uma digitalização ruim nunca capturou. Isto é o que realmente muda o resultado:
| Configuração | Recomendação | Por quê |
|---|---|---|
| Resolução | 300 DPI | Nitidez suficiente para distinguir caracteres parecidos (“rn” de “m”) sem inflar o arquivo à toa |
| Modo de cor | Escala de cinza | Preto e branco puro perde texto claro; cor total só aumenta o arquivo sem ganho de precisão |
| Alinhamento | Página reta, sem inclinação | Texto torto atrapalha mecanismos que esperam linhas horizontais |
| Iluminação | Uniforme e difusa | Sombras e gradientes de brilho confundem o reconhecimento nos cantos mais escuros |
| Formato de saída | PNG, TIFF ou PDF sem compressão | JPEG muito comprimido introduz artefatos nas bordas das letras |
Resolução é o fator isolado mais importante. Abaixo de 200 DPI, a precisão cai de forma perceptível, sobretudo em fontes pequenas e notas de rodapé. Acima de 300–400 DPI, o ganho é mínimo para texto normal — embora um texto muito pequeno ou fino, como a letra miúda de um documento jurídico, possa se beneficiar de 400–600 DPI. Digitalizando com a câmera do celular em vez de um scanner de mesa, o DPI como configuração não se aplica do mesmo jeito: aproxime-se o bastante para que o texto preencha uma boa parte do enquadramento e garanta foco nítido, já que o desfoque tem o mesmo efeito de um DPI baixo.
Escala de cinza é o ponto ideal para a maioria dos documentos. A limiarização em preto e branco puro (1 bit) pode perder texto claro e transformar marcas de caneta leves ou marcas d’água em ruído; a cor total captura informação que o OCR não precisa e gera um arquivo bem maior sem ganho de precisão em texto simples. A exceção fica por conta de documentos com destaques coloridos, carimbos ou diagramas que importam visualmente — aí vale digitalizar em cores e aceitar o arquivo maior, já que a perda de precisão em texto puro é pequena perto do que se ganha em informação visual.
O alinhamento importa mais do que parece. Uma página visivelmente torta prejudica de forma mensurável o reconhecimento, porque os mecanismos de OCR esperam linhas de texto razoavelmente retas. Um scanner de mesa com o papel alinhado à guia de borda evita isso quase por completo; a câmera do celular exige uma foto mais quadrada e deliberada do que parece necessário — o Digitalizar para PDF corrige isso automaticamente ao capturar com o celular, cortando e endireitando cada página no momento da digitalização.
A luz também conta: uniforme e difusa é melhor do que forte e com sombras. Uma única luz de teto ou uma janela atrás da câmera cria um gradiente de brilho ao longo da página que pode fazer o OCR interpretar mal o texto nos cantos mais escuros, mesmo quando ninguém lendo notaria problema algum. Um dia nublado perto de uma janela, ou uma luz interna difusa, é melhor que sol direto ou uma única luminária de mesa.
E quanto ao formato do arquivo: salve ou exporte a digitalização como PNG, TIFF ou PDF sem compressão sempre que possível, em vez de um JPEG muito comprimido. A compressão do JPEG introduz pequenos artefatos em blocos nas bordas — inclusive nas bordas das letras — e, embora uma compressão moderada geralmente não seja problema, uma compressão agressiva prejudica de forma mensurável a precisão do OCR em texto fino.
Com uma digitalização limpa — 300 DPI, escala de cinza, reta e bem iluminada — o passo seguinte é o OCR em PDF, que adiciona uma camada de texto pesquisável, ou o Digitalizar para PDF se a captura for pelo celular, já que ele cuida do corte e do endireitamento na mesma etapa. Como tornar um PDF digitalizado pesquisável detalha o que o OCR faz depois que a digitalização está pronta, e Por que você não consegue selecionar ou pesquisar texto em um PDF explica o motivo por trás de digitalizações que nunca foram pesquisáveis.
Vai digitalizar algo que não está em português? O OCR em PDF funciona em outros idiomas? mostra quais alfabetos e caracteres acentuados são reconhecidos de forma confiável — e a ferramenta OCR em PDF em si não pede cadastro, não deixa marca d’água e apaga o arquivo assim que o processamento termina.