PDF zu Text
Die Wörter aus einem PDF herausholen, in der Reihenfolge, in der sie gelesen werden.
Dateien hier ablegen
Oder einfügen, oder von diesem Gerät auswählen. Nichts wird hochgeladen: die Arbeit passiert in diesem Tab.
Dateien in diesem Tab
Noch ist nichts geladen.
Optionen
Aus welchen Seiten der Text genommen wird.
Die Wörter, Seite für Seite.
Erweitert
Text herausholen
Fügen Sie eine Datei hinzu, um anzufangen.
Was das hier macht
Dies holt die Wörter aus einem PDF in der Reihenfolge, in der ein Mensch sie liest — und nicht in der, in der die Datei sie zeichnet. Die Seite wird entlang der Lücken ohne Text zerschnitten, die größte zuerst, sodass eine über zwei Spalten laufende Überschrift vor beiden steht und eine zweispaltige Seite nicht quer gelesen wird. Sie bekommen es als reinen Text oder als JSON, das sagt, wo auf der Seite jeder Textlauf stand.
Was es nicht macht
Jedes Werkzeug hier sagt mit eigenen Worten, was es nicht kann, bevor Sie sich darauf verlassen.
- Eine gescannte Seite enthält ein Bild von Wörtern, keine Wörter. Lassen Sie zuerst die Texterkennung darüberlaufen, dann liest dies die Ebene, die sie hinzufügt.
- Die Lesereihenfolge wird daraus erschlossen, wo der Text auf der Seite sitzt. Bei Spalten, Überschriften und Tabellen stimmt sie, und auf einer wie ein Plakat gestalteten Seite kann sie falsch sein.
- Spalten werden ab drei Zeilen erkannt. Zwei kurze Spalten nebeneinander werden quer gelesen, so wie eine Tabelle.
- Quer gezeichneter Text — ein gedrehtes Wasserzeichen, eine gekippte Tabellenüberschrift — bleibt am Stück und wird nach dem aufrechten Text gelesen, statt in eine Zeile eingefügt zu werden, die er kreuzt.
Häufige Fragen
Es kam nichts heraus. Was ist schiefgegangen?
Die Seite ist fast sicher ein Scan — ein Bild von Wörtern statt Wörtern. Lassen Sie sie zuerst durch Scan durchsuchbar machen laufen, dann liest dies die Textebene, die dabei entsteht.
Bleiben Spalten und Tabellen in der richtigen Reihenfolge?
Spalten ja: Sie werden aus der Geometrie erkannt und einzeln gelesen. Tabellen werden Zeile für Zeile gelesen. Eine wie ein Plakat gestaltete Seite, mit schrägem Text oder verstreuten Blöcken, hat keine Lesereihenfolge, die man finden könnte, und man wird es merken.
Wird meine Datei irgendwohin hochgeladen?
Nein. Die Arbeit passiert in diesem Browser-Tab, auf Ihrem eigenen Rechner. In diesem Produkt gibt es keinen Server, an den eine Datei ginge — und genau deshalb ist das Versprechen überprüfbar statt Vertrauenssache: Öffnen Sie den Netzwerk-Tab Ihres Browsers und sehen Sie zu, wie die Arbeit ohne eine einzige Anfrage erledigt wird.
Gibt es eine Größenbeschränkung oder ein Limit für die Anzahl der Dateien?
Keine, die wir setzen. Die Grenze ist der Arbeitsspeicher Ihres eigenen Rechners, denn dort passiert die Arbeit: ein paar hundert Megabyte sind auf einem Laptop bequem, auf einem Telefon weniger. Es gibt keinen Tageszähler, keine Warteschlange und kein Konto.
Was kostet es, und wo ist der Haken?
Nichts, und es gibt keine Bezahlstufe, die Funktionen freischaltet: Das ganze Produkt ist das kostenlose. Das ist tragbar, weil uns der Betrieb nichts kostet — die Arbeit macht Ihr Rechner —, also gibt es keine Kosten pro Datei hereinzuholen, keine Werbung und keine Daten zu verkaufen.