VélinPDF
Schriftart, Schriftgröße und Farbe: wie beim Text daneben – einstellbar, sobald der Text steht

PDF in Text umwandeln

Der Text des Dokuments, ohne seine Gestaltung: Absätze werden wieder zusammengefügt, Trennstriche am Zeilenende repariert und Spalten in der Reihenfolge gelesen, in der man sie liest. Gerechnet wird im Browser – das Dokument bleibt DSGVO-konform auf Ihrem Gerät.

Kostenlos · 100 % lokal – nichts wird hochgeladen
  1. 1Öffnen Sie Ihr PDF.
  2. 2Starten Sie die Extraktion.
  3. 3Laden Sie die Textdatei herunter.

So holen Sie den Text aus einem PDF

Öffnen Sie das Dokument und starten Sie die Extraktion: Ein Fenster zeigt den gesamten Wortlaut, darüber die Zahl der Zeichen und der Wörter, und Sie kopieren ihn oder speichern ihn als .txt. Was eine gute Extraktion von einem rohen Kopieren unterscheidet, sind drei Kleinigkeiten. Absätze bleiben Absätze, statt an jedem Zeilenende zu zerbrechen. Am Zeilenende getrennte Wörter wachsen wieder zusammen – im Deutschen wiegt das schwerer als anderswo, weil Zusammensetzungen wie Grundstücksverkehrsgenehmigung jede Zeile sprengen und der Satz sie unablässig trennt. Und mehrspaltige Seiten werden Spalte für Spalte gelesen. Tabellen kommen mit Tabulatoren zwischen den Spalten heraus. Die fertige Datei ist reiner Text in UTF-8, also stehen Umlaute und ß richtig darin und nicht als Buchstabensalat, den ältere Extraktoren liefern. Gerechnet wird im Browser: kein Upload, kein Konto, und keine Seitenzahl, ab der ein Server abwinkt.

Nur einen Absatz mitnehmen

Für einen einzelnen Satz brauchen Sie die ganze Extraktion nicht – ziehen Sie im Editor einfach über den Text. Die Auswahl greift Wörter statt Rechtecke, und in der Zwischenablage landen Absätze: getrennte Wörter wieder zusammengesetzt, Spalten in Leserichtung, eine Tabelle mit Tabulatoren zwischen den Spalten, und ein Absatz, der über den Seitenumbruch hinweg weiterläuft, wieder in einem Stück. Auf dem Telefon öffnet ein langer Druck die Auswahl. Genau das fehlt beim Kopieren aus einem gewöhnlichen Betrachter: Aus einem zweispaltigen Amtsblatt, einer Betriebskostenabrechnung oder einem Gerichtsurteil kommt dort ein zerhackter Text, eine Zeile pro Umbruch, den Sie hinterher von Hand wieder zusammensetzen. Wer nach Normzeilen zu 55 Zeichen oder je tausend Zeichen abrechnet, liest die beiden Zahlen im Fenster der Extraktion ab. Und wer die Zellen einer Tabelle wirklich als Zellen weiterverarbeiten will, geht statt über den Wortlaut über PDF in Excel umwandeln.

Wenn der Scanner das PDF gemacht hat

Ein eingescannter Bescheid, ein per Fax eingegangenes Attest, eine abfotografierte Vertragsseite: In solchen Dateien steckt kein einziges Zeichen, sondern nur ein Bild. Die Extraktion liefert dann eine leere oder fast leere Datei – das ist keine Panne, sondern die Diagnose. Schicken Sie das Dokument zuerst durch die Texterkennung, die unter das Bild eine Textebene legt; danach gibt die Extraktion her, was erkannt wurde. Umgekehrt fördert sie auch Text zutage, den niemand sieht, und ist damit die schnellste Probe darauf, ob eine Stelle wirklich entfernt oder nur mit einem schwarzen Rechteck zugedeckt wurde – was PDF schwärzen von den meisten Werkzeugen unterscheidet. Soll die Gestaltung erhalten bleiben und nicht allein der Wortlaut, ist PDF in Word umwandeln der bessere Weg. Ein passwortgeschütztes Dokument öffnet sich erst mit dem Passwort, siehe PDF-Passwort entfernen, und eine beschädigte Datei bringt PDF reparieren wieder zum Laufen. Nichts davon verlässt Ihr Gerät; nach dem ersten Besuch arbeitet die Seite auch offline.

Häufige Fragen

Werden Spalten in der richtigen Reihenfolge gelesen?

Ja. Eine zweispaltige Seite wird Spalte für Spalte gelesen, nicht zeilenweise quer über das Blatt – das ist der übliche Fehler von Textextraktoren.

Und wenn mein PDF ein Scan ist?

Ein Scan enthält keinen Text. Die Texterkennung legt ihm eine Textebene unter, und erst danach kommt die Extraktion.

Werden am Zeilenende getrennte Wörter wieder zusammengesetzt?

Ja, die Silbentrennung wird repariert, und ein Absatz, den ein Seitenumbruch zerschnitten hat, wird wieder zusammengesetzt.

Kommen Tabellen sauber heraus?

Im reinen Text verliert eine Tabelle ihr Gitter: Die Zellen kommen durch Tabulatoren getrennt heraus und fügen sich so in eine Tabellenkalkulation ein. Für echte Zellen gehen Sie über „PDF in Excel umwandeln“.

Mischen sich Fußnoten unter den Text?

Fußnoten stehen dort, wo sie auf der Seite stehen – also nach dem letzten Absatz dieser Seite. Das ist dem Dokument treu, aber nicht immer bequem zu lesen.

Umwandeln & verkleinern — die anderen Werkzeuge

Alle 42 Werkzeuge ansehen