OT OCR Tools

OCR z PDF na tekst

Wyodrębniaj tekst ze skanowanych plików PDF w przeglądarce dzięki renderowaniu pdf.js i OCR Tesseract.js. Prywatnie, za darmo i bez przesyłania.

🔒 Działa całkowicie w Twojej przeglądarce — nic nie jest przesyłane

Drop one scanned PDF here or click to browse

Pages render and OCR locally in this browser tab.

Choose a PDF to begin.

0%

Advertisement

Prywatne wyodrębnianie tekstu ze skanowanych plików PDF

Skanowane pliki PDF często wyglądają jak zwykłe dokumenty, ale ich strony to w rzeczywistości obrazy. Oznacza to, że nie można zaznaczyć akapitu, wyszukać liczby ani wkleić fragmentu do innej aplikacji. Narzędzie OCR z PDF na tekst zamienia takie strony zawierające wyłącznie obrazy na edytowalny tekst bezpośrednio w przeglądarce. Przydaje się przy starych skanach, papierowych formularzach, paragonach, stronach książek, podpisanych dokumentach oraz w każdym pliku PDF, w którym kopiowanie i wyszukiwanie nie działają, bo tekst jest uwięziony w pikselach.

Cały proces odbywa się po stronie klienta. Biblioteka pdfjs-dist wczytuje lokalny plik PDF i renderuje każdą stronę na elemencie canvas HTML, podobnie jak przeglądarkowa przeglądarka PDF wyświetla stronę na ekranie. Następnie Tesseract.js odczytuje ten canvas i zwraca rozpoznane słowa. Narzędzie powtarza to strona po stronie, dodaje wyraźny separator między stronami i umieszcza połączony tekst w edytowalnym polu tekstowym. Twój plik PDF i wyodrębniony tekst pozostają na Twoim urządzeniu – bez przesyłania, konta i kolejki na serwerze.

Wskazówki dla lepszego OCR w plikach PDF

Dokładność OCR zależy od jakości skanu. Najlepiej sprawdzają się proste strony z ciemnym tekstem na jasnym tle. Nieostre strony, mocne cienie, pismo odręczne, ozdobne czcionki i skany o niskiej rozdzielczości mogą obniżyć dokładność. Jeśli masz dostęp do oryginału, zeskanuj go ponownie w wyższej rozdzielczości przed uruchomieniem OCR. W przypadku zdjęć aparatem trzymaj kartkę płasko, przytnij stół lub tło i zadbaj o równomierne oświetlenie strony.

Wybierz język odpowiadający większości dokumentu. Przy pierwszym użyciu danego języka przeglądarka może musieć pobrać silnik OCR i model językowy, więc pierwsze uruchomienie może trwać dłużej. Potem buforowanie w przeglądarce zwykle przyspiesza kolejne zadania. Zawsze sprawdź wynik, zanim użyjesz go w fakturach, dokumentach prawnych, imionach, adresach lub liczbach, ponieważ OCR może pomylić podobne znaki, takie jak O i 0 albo I i 1.

Kopiowanie, edycja i archiwizacja wyniku

Gdy rozpoznawanie się zakończy, możesz edytować wynik bezpośrednio w polu tekstowym. Separatory stron ułatwiają porównanie wyodrębnionego tekstu z oryginalnym plikiem PDF oraz usunięcie nagłówków, numerów stron lub artefaktów skanowania. Użyj przycisku kopiowania do szybkich notatek, szkiców e-maili i wyszukiwania, albo pobierz zwykły plik tekstowy, aby zarchiwizować wynik OCR obok źródłowego pliku PDF. Przy bardzo długich skanowanych dokumentach uruchom narzędzie, pozostawiając kartę otwartą, i unikaj przełączania na tryby oszczędzania energii, które mogą wstrzymać pracę przeglądarki.

Jak używać

  1. Dodaj plik PDFUpuść jeden skanowany plik PDF na pole przesyłania lub kliknij, aby go wybrać.
  2. Wybierz językWybierz język OCR, który najlepiej pasuje do dokumentu.
  3. Uruchom OCRKażda strona jest renderowana na canvas i rozpoznawana lokalnie po kolei.
  4. Skopiuj lub pobierzSprawdź połączony tekst, a następnie skopiuj go lub zapisz jako plik .txt.

Najczęściej zadawane pytania

Czy skanowane pliki PDF są przesyłane do OCR?
Nie. Strony PDF są renderowane w przeglądarce za pomocą pdfjs-dist, a Tesseract.js odczytuje obrazy stron lokalnie. Nic nie jest przesyłane.
Dlaczego pierwsze uruchomienie OCR jest wolniejsze?
Podczas pierwszego uruchomienia pobierany jest silnik OCR i wybrany model językowy. Przeglądarki zwykle buforują te pliki, więc kolejne uruchomienia OCR są szybsze.
Czy działa to na zwykłych plikach PDF z tekstem?
Może wykonać OCR na wyrenderowanych stronach, ale w cyfrowych plikach PDF z zaznaczalnym tekstem szybciej może być skopiować tekst bezpośrednio. Narzędzie sprawdza się najlepiej przy skanowanych plikach PDF lub zawierających tylko obrazy.
Czy mogę zapisać wyodrębniony tekst?
Tak. Połączony wynik pojawia się w edytowalnym polu tekstowym z separatorami stron i możesz go skopiować lub pobrać jako plik .txt.
Advertisement