OT OCR Tools

OCR із PDF у текст

Витягуйте текст зі сканованих PDF у браузері за допомогою рендерингу pdf.js та OCR Tesseract.js. Приватно, безкоштовно і без завантаження файлів.

🔒 Працює повністю у вашому браузері — нічого не завантажується

Drop one scanned PDF here or click to browse

Pages render and OCR locally in this browser tab.

Choose a PDF to begin.

0%

Advertisement

Приватне вилучення тексту зі сканованих PDF

Сканований PDF часто виглядає як звичайний документ, але його сторінки насправді є зображеннями. Це означає, що ви не можете виділити абзац, знайти число чи вставити фрагмент в іншу програму. Цей інструмент OCR із PDF у текст перетворює такі сторінки, що містять лише зображення, на редагований текст просто у вашому браузері. Він корисний для старих сканів, паперових форм, чеків, сторінок книг, підписаних документів і будь-яких PDF, у яких копіювання та пошук не працюють, бо текст «застряг» у пікселях.

Увесь процес відбувається на стороні клієнта. pdfjs-dist завантажує ваш локальний PDF-файл і відображає кожну сторінку на HTML-canvas, так само як переглядач PDF у браузері показує сторінку на екрані. Потім Tesseract.js читає цей canvas і повертає розпізнані слова. Інструмент повторює процес сторінка за сторінкою, додає чіткий роздільник між сторінками та поміщає об'єднаний текст у редаговане текстове поле. Ваш PDF і витягнутий текст залишаються на вашому пристрої: без завантаження, облікового запису чи черги на сервері.

Поради для кращого OCR у PDF

Точність OCR залежить від якості скану. Найкраще працюють рівні сторінки з темним текстом на світлому тлі. Розмиті сторінки, сильні тіні, рукописний текст, декоративні шрифти та скани з низькою роздільною здатністю можуть знизити точність. Якщо є вихідний документ, відскануйте його знову з вищою роздільною здатністю перед запуском OCR. Для знімків камерою тримайте папір рівно, обріжте стіл або тло та подбайте про рівномірне освітлення сторінки.

Оберіть мову, яка відповідає більшій частині документа. Коли ви вперше користуєтеся певною мовою, браузеру може знадобитися завантажити рушій OCR і мовну модель, тому перший запуск може тривати довше. Після цього кешування в браузері зазвичай пришвидшує наступні завдання. Завжди перевіряйте результат, перш ніж використовувати його для рахунків, юридичних документів, імен, адрес чи чисел, адже OCR може плутати схожі символи, як-от O і 0 або I і 1.

Копіюйте, редагуйте й архівуйте результат

Коли розпізнавання завершиться, ви можете редагувати результат безпосередньо в текстовому полі. Роздільники сторінок полегшують порівняння витягнутого тексту з оригінальним PDF і видалення колонтитулів, номерів сторінок чи артефактів сканування. Використовуйте кнопку копіювання для швидких нотаток, чернеток листів і пошуку, або завантажте простий текстовий файл, щоб зберегти результат OCR поруч із вихідним PDF. Для дуже довгих сканованих документів запускайте інструмент, не закриваючи вкладку, і уникайте переходу в режими енергозбереження, які можуть призупинити роботу браузера.

Як користуватися

  1. Додайте PDFПеретягніть один сканований PDF у поле завантаження або натисніть, щоб вибрати його.
  2. Оберіть мовуВиберіть мову OCR, яка найкраще відповідає документу.
  3. Запустіть OCRКожна сторінка рендериться на canvas і послідовно розпізнається локально.
  4. Скопіюйте або завантажтеПеревірте об'єднаний текст, після чого скопіюйте його або збережіть як файл .txt.

Часті запитання

Чи завантажуються скановані PDF для OCR?
Ні. Сторінки PDF відображаються у вашому браузері за допомогою pdfjs-dist, а Tesseract.js читає зображення сторінок локально. Нічого не завантажується.
Чому перший запуск OCR повільніший?
Під час першого запуску завантажується рушій OCR і вибрана мовна модель. Браузери зазвичай кешують ці файли, тож наступні запуски OCR швидші.
Чи працює це зі звичайними текстовими PDF?
Воно може виконати OCR відрендерених сторінок, але з цифрових PDF із виділюваним текстом швидше скопіювати текст напряму. Інструмент найкраще підходить для сканованих PDF або PDF лише із зображень.
Чи можна зберегти витягнутий текст?
Так. Об'єднаний результат з'являється в редагованому текстовому полі з роздільниками сторінок, і його можна скопіювати або завантажити як файл .txt.
Advertisement