VélinPDF
Police, taille et couleur : celles du texte voisin — réglables une fois le texte posé

Extraire le texte d’un PDF

Le texte du document, sans sa mise en forme. Les paragraphes sont recollés, les césures de fin de ligne réparées, les colonnes lues dans l’ordre où on les lit.

Gratuit · 100 % local — rien n’est envoyé
  1. 1Ouvrez votre PDF.
  2. 2Lancez l’extraction.
  3. 3Téléchargez le fichier texte.

Comment extraire le texte d’un PDF

Ouvrez le document, lancez l’extraction, récupérez un fichier texte. Ce qui distingue une bonne extraction d’un copier-coller brut tient à trois détails que Vélin traite : les paragraphes sont recollés au lieu d’être coupés à chaque fin de ligne, les mots coupés par un tiret en bout de ligne sont réunis, et les colonnes sont lues dans l’ordre où on les lit, et non de gauche à droite en travers de la page. Les tableaux sortent avec leurs colonnes séparées par des tabulations, prêts à être collés dans un tableur. C’est le geste qu’on fait avant de retravailler un texte, de le donner à un correcteur, de compter des signes ou d’alimenter un outil d’analyse. Le document ne quitte pas votre appareil. Le fichier obtenu est un texte brut en UTF-8, qui s’ouvre dans n’importe quel éditeur.

Copier le texte d’un PDF, ou une partie

Pour prendre un paragraphe plutôt que tout le document, glissez simplement sur le texte dans l’éditeur : la sélection prend les mots, pas des rectangles, et la copie rend des paragraphes — les mots coupés en fin de ligne sont recollés, les colonnes lues dans l’ordre, un tableau collé garde ses colonnes séparées par des tabulations, et un paragraphe à cheval sur deux pages est recousu. Au doigt, un appui long ouvre la sélection. C’est ce qui manque le plus souvent quand on copie depuis une visionneuse : on récupère un texte haché, une ligne par retour à la ligne, qu’il faut reformater à la main.

Un scan ne contient aucun texte

Si votre PDF est une image — un document numérisé, une photographie de page — il n’y a rien à extraire : l’extraction rendra un fichier vide ou presque. Passez-le d’abord par la reconnaissance de caractères, qui pose une couche de texte sous l’image ; l’extraction donnera alors ce que la reconnaissance a lu. Pour conserver la mise en forme plutôt que le seul texte, la conversion en Word est plus indiquée.

Questions fréquentes

Les colonnes sont-elles lues dans le bon ordre ?

Oui. Une page à deux colonnes est lue colonne après colonne, pas ligne par ligne en travers — c’est l’erreur habituelle des extracteurs.

Et si mon PDF est un scan ?

Un scan ne contient pas de texte. L’OCR lui en donne un ; l’extraction vient ensuite.

Les mots coupés en fin de ligne sont-ils recollés ?

Oui, la césure est réparée, et un paragraphe coupé par un saut de page est recousu.

Les tableaux sortent-ils correctement ?

En texte brut, un tableau perd sa grille : les cellules sortent séparées par des tabulations, ce qui se recolle dans un tableur. Pour de vraies cellules, passez par Convertir un PDF en Excel.

Les notes de bas de page se mélangent-elles au texte ?

Elles sortent à leur place dans la page, c’est-à-dire après le dernier paragraphe de la page. C’est fidèle au document, pas toujours commode à relire.

Exporter & alléger — les autres outils

Voir les 42 outils