Warum kopierter PDF-Text seltsam aussieht
Ein PDF bewahrt in erster Linie das Seitenlayout. Text kann als positionierte Fragmente statt als fließender Absatz gespeichert sein. Beim Kopieren werden sichtbare Reihen dann zu harten Umbrüchen; Spalten, Abstände oder Trennungen können ebenfalls fehlerhaft übernommen werden.
Ein praktischer Bereinigungsablauf
- Kopiere nur den relevanten Text und lass das Original zur Kontrolle geöffnet.
- Nutze Zeilenumbrüche entfernen. Erhalte Absätze, wenn echte Absätze durch Leerzeilen getrennt sind.
- Bereinige das Ergebnis mit Überflüssige Leerzeichen entfernen.
- Entferne mit Leere Zeilen nur solche Abstände, die keine Bedeutung haben.
- Vergleiche Überschriften, Listen, Tabellen, Seitenzahlen und getrennte Wörter mit dem PDF.
Der kopierte Satz endet am sichtbaren Seitenrand, obwohl er ein Absatz ist.Nachher
Der kopierte Satz endet am sichtbaren Seitenrand, obwohl er ein Absatz ist.
Nicht blind bereinigen
Ein automatisches Tool erkennt nicht jede Layoutentscheidung. Ein Umbruch nach einer Überschrift kann gewollt sein; ein Bindestrich am Zeilenende kann zum Wort gehören oder nur die Trennstelle markieren. Mehrspaltige Dokumente und Tabellen müssen manuell kontrolliert werden.
Sensible Dokumente
Die Textverarbeitung dieser Tools erfolgt lokal im Browser. Der eingefügte Text wird dafür nicht an einen TextUnicorn-Server übertragen. Wie sich das von Analytics und anderen Webseitenanfragen unterscheidet, erklärt der Guide zur lokalen Verarbeitung.