OCR из PDF в текст
Извлекайте текст из отсканированных PDF в браузере с помощью рендеринга pdf.js и OCR Tesseract.js. Конфиденциально, бесплатно и без загрузки файлов.
🔒 Работает полностью в вашем браузере — ничего не загружаетсяКонфиденциальное извлечение текста из отсканированных PDF
Отсканированные PDF часто выглядят как обычные документы, но их страницы на самом деле являются картинками. Это значит, что вы не можете выделить абзац, найти число или вставить фрагмент в другое приложение. Этот инструмент OCR из PDF в текст превращает такие страницы, состоящие только из изображений, в редактируемый текст прямо в вашем браузере. Он пригодится для старых сканов, бумажных форм, чеков, страниц книг, подписанных документов и любых PDF, в которых копирование и поиск не работают, потому что текст заключён в пикселях.
Весь процесс выполняется на стороне клиента. pdfjs-dist загружает ваш локальный PDF-файл и отрисовывает каждую страницу на HTML-canvas, так же как просмотрщик PDF в браузере показывает страницу на экране. Затем Tesseract.js читает этот canvas и возвращает распознанные слова. Инструмент повторяет процесс страница за страницей, добавляет чёткий разделитель между страницами и помещает объединённый текст в редактируемое текстовое поле. Ваш PDF и извлечённый текст остаются на вашем устройстве: без загрузки, аккаунта и очереди на сервере.
Советы для более точного OCR в PDF
Точность OCR зависит от качества скана. Лучше всего работают ровные страницы с тёмным текстом на светлом фоне. Размытые страницы, сильные тени, рукописный текст, декоративные шрифты и сканы с низким разрешением могут снизить точность. Если исходный документ доступен, отсканируйте его заново с более высоким разрешением перед запуском OCR. При съёмке камерой держите бумагу ровно, обрежьте стол или фон и следите за равномерным освещением страницы.
Выберите язык, который соответствует большей части документа. При первом использовании языка браузеру может потребоваться загрузить движок OCR и языковую модель, поэтому первый запуск может занять больше времени. Затем кэширование в браузере обычно ускоряет последующие задачи. Всегда проверяйте результат, прежде чем использовать его для счетов, юридических документов, имён, адресов или чисел, ведь OCR может путать похожие символы, например O и 0 или I и 1.
Копируйте, редактируйте и архивируйте результат
Когда распознавание завершится, вы можете редактировать результат прямо в текстовом поле. Разделители страниц упрощают сравнение извлечённого текста с исходным PDF и удаление колонтитулов, номеров страниц или артефактов сканирования. Используйте кнопку копирования для быстрых заметок, черновиков писем и поиска, или скачайте простой текстовый файл, чтобы сохранить результат OCR рядом с исходным PDF. Для очень длинных отсканированных документов запускайте инструмент, не закрывая вкладку, и избегайте перехода в режимы энергосбережения, которые могут приостановить работу браузера.
Как использовать
- Добавьте PDFПеретащите один отсканированный PDF в область загрузки или нажмите, чтобы выбрать его.
- Выберите языкВыберите язык OCR, который лучше всего подходит документу.
- Запустите OCRКаждая страница отрисовывается на canvas и последовательно распознаётся локально.
- Скопируйте или скачайтеПроверьте объединённый текст, затем скопируйте его или сохраните как файл .txt.