Reconhecer o texto de um PDF (OCR)
Um documento digitalizado é só uma imagem: nada se busca nele, nada se copia. O reconhecimento de caracteres acrescenta uma camada de texto sob a imagem — a aparência não muda, mas o documento fica pesquisável.
Grátis · 100% local — nada é enviado- 1Abra seu PDF digitalizado.
- 2Inicie o reconhecimento e escolha o idioma.
- 3Baixe o PDF, agora pesquisável.
Como reconhecer o texto de um PDF digitalizado
Um documento digitalizado é uma fotografia de página: o Ctrl F não acha nada, o mouse não seleciona nada, e o arquivo fica opaco para qualquer busca — inclusive para você mesmo, três meses depois, atrás do número de uma nota fiscal em uma pasta de duzentos arquivos. O reconhecimento de caracteres lê a imagem e coloca embaixo dela uma camada de texto invisível: a aparência não muda um pixel sequer, mas o documento passa a ser pesquisável, selecionável e copiável, e pode em seguida ser convertido em Word ou em Excel. Abra o PDF, escolha o idioma, diga quais páginas — só as que parecem digitalizadas, todas, ou uma faixa tipo 2-5, 8 — e mande reconhecer. O raro aqui está em onde a conta acontece: o motor roda dentro do navegador, e assim um laudo médico, um contracheque ou um processo inteiro não precisam ser entregues a um serviço online só para ficarem legíveis. São alguns segundos por página, e o tamanho do arquivo não esbarra em cota nem em fila.
Os idiomas, e o dia em que o motor hesita
Português com acento, til e cedilha; ao lado dele inglês, espanhol, alemão, italiano e francês, mais um modo misto para o relatório técnico que troca de idioma no meio. O modelo do idioma escolhido é baixado uma vez só, no primeiro uso, e depois fica no dispositivo: a segunda digitalização já funciona offline. Nenhum reconhecimento é cem por cento confiável, e quem promete isso está vendendo alguma coisa — uma página nítida e reta, escaneada a 300 dpi, sai quase perfeita; foto torta de celular, carimbo atravessado no texto e anotação à mão dão erro. Em vez de esconder esse ponto fraco, o Vélin o mostra: as palavras em que o motor hesitou vão para uma revisão, cada uma com o recorte da imagem original ao lado do texto reconhecido e a confiança em porcentagem. Corrija, ou desmarque a palavra para descartá-la; as quase ilegíveis já chegam desmarcadas e podem ser resgatadas uma a uma. Depois disso o texto se relê e se edita como qualquer outro, e um CPF que acabou de ficar pesquisável pode ser tarjado, ou trocado com localizar e substituir, antes de o arquivo sair da sua mão.
Perguntas frequentes
O OCR é feito em um servidor?
Não — e isso é raro, mas é justamente o ponto: o motor de reconhecimento roda dentro do seu navegador. Um documento sigiloso digitalizado não sai do seu dispositivo.
Quais idiomas são reconhecidos?
Português, inglês, francês, espanhol, alemão e italiano — mais um modo francês + inglês para documentos misturados. O modelo do idioma escolhido é baixado no primeiro uso e depois fica no dispositivo.
A aparência do digitalizado muda?
Não. A imagem continua igual; o texto reconhecido é colocado embaixo dela, invisível, só para busca e cópia.
Quanto tempo leva o reconhecimento?
Alguns segundos por página em um computador recente, mais no celular: todo o cálculo acontece no seu aparelho, sem fila e sem cota.
O texto reconhecido é cem por cento confiável?
Não, e nenhum motor é: uma digitalização nítida e reta dá um resultado ótimo; uma fotocópia torta ou tramada, bem menos. O texto reconhecido serve para buscar e copiar; releia antes de usá-lo como referência.