PDF-zu-Text-OCR
Extrahieren Sie Text aus gescannten PDFs im Browser mit pdf.js-Rendering und Tesseract.js-OCR. Privat, kostenlos und ohne Upload.
🔒 Läuft vollständig in Ihrem Browser — nichts wird hochgeladenText aus gescannten PDFs privat extrahieren
Gescannte PDFs sehen oft wie normale Dokumente aus, doch die Seiten sind in Wahrheit Bilder. Das bedeutet: Sie können weder einen Absatz markieren noch nach einer Zahl suchen oder einen Abschnitt in eine andere App einfügen. Dieses PDF-zu-Text-OCR-Tool wandelt solche reinen Bildseiten direkt in Ihrem Browser in bearbeitbaren Text um. Es eignet sich für alte Scans, Papierformulare, Belege, Buchseiten, unterschriebene Dokumente und jedes PDF, bei dem Kopieren und Suchen nicht funktionieren, weil der Text in Pixeln steckt.
Der gesamte Vorgang läuft clientseitig ab. pdfjs-dist lädt Ihre lokale PDF-Datei und rendert jede Seite auf einem HTML-Canvas, ähnlich wie ein PDF-Viewer im Browser eine Seite auf dem Bildschirm darstellt. Tesseract.js liest dann dieses Canvas und liefert die erkannten Wörter zurück. Das Tool wiederholt den Vorgang Seite für Seite, fügt zwischen den Seiten eine klare Trennlinie ein und legt den gesamten Text in einem bearbeitbaren Textfeld ab. Ihr PDF und der extrahierte Text bleiben auf Ihrem Gerät – es gibt keinen Upload, kein Konto und keine Server-Warteschlange.
Tipps für bessere PDF-OCR
Die OCR-Genauigkeit hängt von der Qualität des Scans ab. Gerade Seiten mit dunklem Text auf hellem Hintergrund funktionieren am besten. Unscharfe Seiten, starke Schatten, Handschrift, verzierte Schriften und Scans mit niedriger Auflösung können die Genauigkeit verringern. Wenn das Originaldokument verfügbar ist, scannen Sie es vor der OCR noch einmal mit höherer Auflösung. Halten Sie bei Kameraaufnahmen das Papier flach, schneiden Sie Tisch oder Hintergrund weg und sorgen Sie für eine gleichmäßige Beleuchtung der Seite.
Wählen Sie die Sprache, die dem Großteil des Dokuments entspricht. Bei der ersten Nutzung einer Sprache muss der Browser möglicherweise die OCR-Engine und das Sprachmodell herunterladen, daher kann der erste Durchlauf länger dauern. Danach beschleunigt das Browser-Caching künftige Aufträge in der Regel. Prüfen Sie das Ergebnis immer, bevor Sie es für Rechnungen, Rechtsdokumente, Namen, Adressen oder Zahlen verwenden, denn OCR kann ähnliche Zeichen wie O und 0 oder I und 1 verwechseln.
Ergebnis kopieren, bearbeiten und archivieren
Nach der Erkennung können Sie das Ergebnis direkt im Textfeld bearbeiten. Seitentrenner erleichtern den Vergleich des extrahierten Texts mit dem Original-PDF und das Entfernen von Kopfzeilen, Seiten- zahlen oder Scan-Artefakten. Nutzen Sie die Kopierschaltfläche für schnelle Notizen, E-Mail-Entwürfe und Suchen, oder laden Sie eine reine Textdatei herunter, um das OCR-Ergebnis neben dem Quell-PDF zu archivieren. Lassen Sie bei sehr langen gescannten Dokumenten den Tab geöffnet und vermeiden Sie den Wechsel in Energiesparmodi, die die Arbeit des Browsers anhalten können.
So verwenden Sie
- PDF hinzufügenZiehen Sie ein gescanntes PDF auf das Upload-Feld oder klicken Sie, um es auszuwählen.
- Sprache wählenWählen Sie die OCR-Sprache, die am besten zum Dokument passt.
- OCR startenJede Seite wird auf ein Canvas gerendert und der Reihe nach lokal erkannt.
- Kopieren oder herunterladenPrüfen Sie den zusammengeführten Text und kopieren Sie ihn oder speichern Sie ihn als .txt-Datei.