VélinPDF
Fonte, tamanho e cor: os do texto ao lado — ajustáveis depois de colocar o texto

Reconhecer o texto de um PDF (OCR)

Um documento digitalizado é só uma imagem: nada se busca nele, nada se copia. O reconhecimento de caracteres acrescenta uma camada de texto sob a imagem — a aparência não muda, mas o documento fica pesquisável.

Grátis · 100% local — nada é enviado
  1. 1Abra seu PDF digitalizado.
  2. 2Inicie o reconhecimento e escolha o idioma.
  3. 3Baixe o PDF, agora pesquisável.

Como reconhecer o texto de um PDF digitalizado

Um documento digitalizado é uma fotografia de página: o Ctrl F não acha nada, o mouse não seleciona nada, e o arquivo fica opaco para qualquer busca — inclusive para você mesmo, três meses depois, atrás do número de uma nota fiscal em uma pasta de duzentos arquivos. O reconhecimento de caracteres lê a imagem e coloca embaixo dela uma camada de texto invisível: a aparência não muda um pixel sequer, mas o documento passa a ser pesquisável, selecionável e copiável, e pode em seguida ser convertido em Word ou em Excel. Abra o PDF, escolha o idioma, diga quais páginas — só as que parecem digitalizadas, todas, ou uma faixa tipo 2-5, 8 — e mande reconhecer. O raro aqui está em onde a conta acontece: o motor roda dentro do navegador, e assim um laudo médico, um contracheque ou um processo inteiro não precisam ser entregues a um serviço online só para ficarem legíveis. São alguns segundos por página, e o tamanho do arquivo não esbarra em cota nem em fila.

Os idiomas, e o dia em que o motor hesita

Português com acento, til e cedilha; ao lado dele inglês, espanhol, alemão, italiano e francês, mais um modo misto para o relatório técnico que troca de idioma no meio. O modelo do idioma escolhido é baixado uma vez só, no primeiro uso, e depois fica no dispositivo: a segunda digitalização já funciona offline. Nenhum reconhecimento é cem por cento confiável, e quem promete isso está vendendo alguma coisa — uma página nítida e reta, escaneada a 300 dpi, sai quase perfeita; foto torta de celular, carimbo atravessado no texto e anotação à mão dão erro. Em vez de esconder esse ponto fraco, o Vélin o mostra: as palavras em que o motor hesitou vão para uma revisão, cada uma com o recorte da imagem original ao lado do texto reconhecido e a confiança em porcentagem. Corrija, ou desmarque a palavra para descartá-la; as quase ilegíveis já chegam desmarcadas e podem ser resgatadas uma a uma. Depois disso o texto se relê e se edita como qualquer outro, e um CPF que acabou de ficar pesquisável pode ser tarjado, ou trocado com localizar e substituir, antes de o arquivo sair da sua mão.

Perguntas frequentes

O OCR é feito em um servidor?

Não — e isso é raro, mas é justamente o ponto: o motor de reconhecimento roda dentro do seu navegador. Um documento sigiloso digitalizado não sai do seu dispositivo.

Quais idiomas são reconhecidos?

Português, inglês, francês, espanhol, alemão e italiano — mais um modo francês + inglês para documentos misturados. O modelo do idioma escolhido é baixado no primeiro uso e depois fica no dispositivo.

A aparência do digitalizado muda?

Não. A imagem continua igual; o texto reconhecido é colocado embaixo dela, invisível, só para busca e cópia.

Quanto tempo leva o reconhecimento?

Alguns segundos por página em um computador recente, mais no celular: todo o cálculo acontece no seu aparelho, sem fila e sem cota.

O texto reconhecido é cem por cento confiável?

Não, e nenhum motor é: uma digitalização nítida e reta dá um resultado ótimo; uma fotocópia torta ou tramada, bem menos. O texto reconhecido serve para buscar e copiar; releia antes de usá-lo como referência.

Documento — as outras ferramentas

Ver as 42 ferramentas