Der ganze Text des Dokuments kommt in eine .txt-Datei, Seite für Seite. Trägt eine Seite keinen Text, weil sie ein Scan ist, steht das darin.
Was es nicht tut: Wir geben den Text so zurück, wie das Dokument ihn trägt: am Zeilenende getrennte Wörter bleiben getrennt, Spalten werden nicht entwirrt, Tabellen nicht als Tabellen wiederhergestellt. Das zu erraten hieße, sich stillschweigend zu irren. Eine gescannte Seite trägt überhaupt keinen Text, und die Extraktion sagt das, statt eine leere Datei zu liefern. „Einen Scan durchsuchbar machen“ liest sie dann und legt den erkannten Text darauf; die Extraktion arbeitet danach am erzeugten Dokument, ohne es erneut abzulegen.
Nichts wird hochgeladen. Trennen Sie die Netzverbindung, sobald diese Seite geladen ist: das Werkzeug arbeitet weiter. Wie Sie es selbst prüfen.