Startseite / Guides / So bereinigst du Text aus einem PDF

So bereinigst du Text aus einem PDF

Entferne unerwünschte Zeilenumbrüche, zusätzliche Leerzeichen und leere Zeilen aus kopiertem PDF-Text.

Warum kopierter PDF-Text seltsam aussieht

Ein PDF bewahrt in erster Linie das Seitenlayout. Text kann als positionierte Fragmente statt als fließender Absatz gespeichert sein. Beim Kopieren werden sichtbare Reihen dann zu harten Umbrüchen; Spalten, Abstände oder Trennungen können ebenfalls fehlerhaft übernommen werden.

Ein praktischer Bereinigungsablauf

  1. Kopiere nur den relevanten Text und lass das Original zur Kontrolle geöffnet.
  2. Nutze Zeilenumbrüche entfernen. Erhalte Absätze, wenn echte Absätze durch Leerzeilen getrennt sind.
  3. Bereinige das Ergebnis mit Überflüssige Leerzeichen entfernen.
  4. Entferne mit Leere Zeilen nur solche Abstände, die keine Bedeutung haben.
  5. Vergleiche Überschriften, Listen, Tabellen, Seitenzahlen und getrennte Wörter mit dem PDF.
Vorher
Der kopierte Satz endet
am sichtbaren Seitenrand,
obwohl er ein Absatz ist.
Nachher
Der kopierte Satz endet am sichtbaren Seitenrand, obwohl er ein Absatz ist.

Nicht blind bereinigen

Ein automatisches Tool erkennt nicht jede Layoutentscheidung. Ein Umbruch nach einer Überschrift kann gewollt sein; ein Bindestrich am Zeilenende kann zum Wort gehören oder nur die Trennstelle markieren. Mehrspaltige Dokumente und Tabellen müssen manuell kontrolliert werden.

Sensible Dokumente

Die Textverarbeitung dieser Tools erfolgt lokal im Browser. Der eingefügte Text wird dafür nicht an einen TextUnicorn-Server übertragen. Wie sich das von Analytics und anderen Webseitenanfragen unterscheidet, erklärt der Guide zur lokalen Verarbeitung.

Passende Guides

Alle TextUnicorn-Guides ansehen →