Tools

OCR - PDF durchsuchbar machen

Ein Scan ist ein Bild: nichts zu durchsuchen, auszuwählen oder zu kopieren. OCR liest die Wörter davon ab und legt eine unsichtbare Textebene über die Seite, Wort für Wort dort, wo es gedruckt wurde, sodass eine Suche die richtige Stelle hervorhebt und eine Auswahl der Zeile folgt. Die Erkennung läuft in deinem Browser mit Tesseract, in vierunddreißig Sprachen, und das gescannte Bild bleibt genau so, wie es war.

PDF-Dateien hier ablegen

Zieh sie einfach vom Desktop hierher

oder
  • Nur PDF-Dateien
  • Bis zu 15 MB pro Datei
  • 2 Dateien pro Durchgang - unbegrenzt mit Pro

Häufige Fragen

Verändert OCR das Aussehen des Scans?

Nein. Das gescannte Bild bleibt Byte für Byte, wie es war; hinzu kommt eine unsichtbare Textebene darüber, dieselbe Konstruktion, die Acrobat und jede Scanner-Software für ein durchsuchbares PDF verwenden. Suchen, Auswählen und Kopieren funktionieren; der Druck bleibt unverändert.

Wie gut ist die Erkennung?

Es ist die neuronale Engine von Tesseract 5, dieselbe, die hinter den meisten Open-Source-OCR-Lösungen steckt, als WebAssembly in deinem Browser. Ein sauberer 300-dpi-Scan von gedrucktem Text kommt fast buchstabengetreu heraus; eine schiefe, blasse oder abfotografierte Seite weniger - begradige sie zuerst mit PDF begradigen. Wörter, bei denen die Engine unsicher war, werden trotzdem platziert, damit eine Suche sie findet, und das Tool sagt, wie viele es waren.

Welche Sprachen, und kann ich mehrere wählen?

Ungarisch, Englisch, Deutsch, Französisch, Italienisch, Spanisch, Polnisch, Rumänisch, Slowakisch, Tschechisch, Kroatisch, Slowenisch, Serbisch (lateinisch und kyrillisch), Ukrainisch, Russisch, Bulgarisch, Griechisch, Türkisch, Dänisch, Schwedisch, Norwegisch, Finnisch, Niederländisch, Portugiesisch, Latein, Arabisch, Persisch, Hebräisch, Chinesisch (vereinfacht und traditionell), Japanisch, Koreanisch und deutsche Fraktur für Frakturdruck aus der Vorkriegszeit, in beliebiger Kombination - ein zweisprachiger Vertrag lässt sich mit zweien lesen. Jede Sprache ist ein eigener Download, den der Browser dann behält.

Wird das PDF hochgeladen?

Nichts wird hochgeladen: Die Datei wird in deinem Browser geöffnet und verarbeitet und verlässt nie dein Gerät. Schließ den Tab, und sie ist weg. Die OCR-Engine und ihre Sprachdateien kommen ebenfalls von dieser Website, sodass nicht einmal die Wahl der Sprache irgendwohin geschickt wird.

Welche Seiten liest es?

Standardmäßig nur die ohne Textebene, denn eine digital erstellte Seite hat bereits eine, und eine zweite würde jeden Suchtreffer verdoppeln. Hat eine frühere OCR schlechte Arbeit geleistet, stell auf jede Seite um - die neue Ebene kommt unter die alte.

Wie lange dauert es?

Länger als alles andere hier - Erkennung ist echte Arbeit, und jede Seite braucht selbst auf einem schnellen Rechner einen Moment, also lohnt es sich, einen langen Scan zu starten und laufen zu lassen. Der erste Durchlauf holt außerdem die Erkennungs-Engine und die Sprachdaten (ein paar Megabyte, von dieser Website statt von einem CDN); danach hat dein Browser sie im Cache, und die Schaltfläche zeigt Seite für Seite, wie weit es ist.

Fehlt dir etwas, oder hat dich das Ergebnis überrascht?