OT OCR Tools

OCR из PDF в текст

Извлекайте текст из отсканированных PDF в браузере с помощью рендеринга pdf.js и OCR Tesseract.js. Конфиденциально, бесплатно и без загрузки файлов.

🔒 Работает полностью в вашем браузере — ничего не загружается

Drop one scanned PDF here or click to browse

Pages render and OCR locally in this browser tab.

Choose a PDF to begin.

0%

Advertisement

Конфиденциальное извлечение текста из отсканированных PDF

Отсканированные PDF часто выглядят как обычные документы, но их страницы на самом деле являются картинками. Это значит, что вы не можете выделить абзац, найти число или вставить фрагмент в другое приложение. Этот инструмент OCR из PDF в текст превращает такие страницы, состоящие только из изображений, в редактируемый текст прямо в вашем браузере. Он пригодится для старых сканов, бумажных форм, чеков, страниц книг, подписанных документов и любых PDF, в которых копирование и поиск не работают, потому что текст заключён в пикселях.

Весь процесс выполняется на стороне клиента. pdfjs-dist загружает ваш локальный PDF-файл и отрисовывает каждую страницу на HTML-canvas, так же как просмотрщик PDF в браузере показывает страницу на экране. Затем Tesseract.js читает этот canvas и возвращает распознанные слова. Инструмент повторяет процесс страница за страницей, добавляет чёткий разделитель между страницами и помещает объединённый текст в редактируемое текстовое поле. Ваш PDF и извлечённый текст остаются на вашем устройстве: без загрузки, аккаунта и очереди на сервере.

Советы для более точного OCR в PDF

Точность OCR зависит от качества скана. Лучше всего работают ровные страницы с тёмным текстом на светлом фоне. Размытые страницы, сильные тени, рукописный текст, декоративные шрифты и сканы с низким разрешением могут снизить точность. Если исходный документ доступен, отсканируйте его заново с более высоким разрешением перед запуском OCR. При съёмке камерой держите бумагу ровно, обрежьте стол или фон и следите за равномерным освещением страницы.

Выберите язык, который соответствует большей части документа. При первом использовании языка браузеру может потребоваться загрузить движок OCR и языковую модель, поэтому первый запуск может занять больше времени. Затем кэширование в браузере обычно ускоряет последующие задачи. Всегда проверяйте результат, прежде чем использовать его для счетов, юридических документов, имён, адресов или чисел, ведь OCR может путать похожие символы, например O и 0 или I и 1.

Копируйте, редактируйте и архивируйте результат

Когда распознавание завершится, вы можете редактировать результат прямо в текстовом поле. Разделители страниц упрощают сравнение извлечённого текста с исходным PDF и удаление колонтитулов, номеров страниц или артефактов сканирования. Используйте кнопку копирования для быстрых заметок, черновиков писем и поиска, или скачайте простой текстовый файл, чтобы сохранить результат OCR рядом с исходным PDF. Для очень длинных отсканированных документов запускайте инструмент, не закрывая вкладку, и избегайте перехода в режимы энергосбережения, которые могут приостановить работу браузера.

Как использовать

  1. Добавьте PDFПеретащите один отсканированный PDF в область загрузки или нажмите, чтобы выбрать его.
  2. Выберите языкВыберите язык OCR, который лучше всего подходит документу.
  3. Запустите OCRКаждая страница отрисовывается на canvas и последовательно распознаётся локально.
  4. Скопируйте или скачайтеПроверьте объединённый текст, затем скопируйте его или сохраните как файл .txt.

Часто задаваемые вопросы

Загружаются ли отсканированные PDF для OCR?
Нет. Страницы PDF отрисовываются в вашем браузере с помощью pdfjs-dist, а Tesseract.js читает изображения страниц локально. Ничего не загружается.
Почему первый запуск OCR медленнее?
При первом запуске загружаются движок OCR и выбранная языковая модель. Браузеры обычно кэшируют эти файлы, поэтому последующие запуски OCR быстрее.
Работает ли это с обычными текстовыми PDF?
Инструмент может выполнить OCR отрисованных страниц, но из цифровых PDF с выделяемым текстом быстрее скопировать текст напрямую. Лучше всего он подходит для отсканированных PDF или PDF только из изображений.
Можно ли сохранить извлечённый текст?
Да. Объединённый результат отображается в редактируемом текстовом поле с разделителями страниц, и его можно скопировать или скачать как файл .txt.
Advertisement