OCR із PDF у текст
Витягуйте текст зі сканованих PDF у браузері за допомогою рендерингу pdf.js та OCR Tesseract.js. Приватно, безкоштовно і без завантаження файлів.
🔒 Працює повністю у вашому браузері — нічого не завантажуєтьсяПриватне вилучення тексту зі сканованих PDF
Сканований PDF часто виглядає як звичайний документ, але його сторінки насправді є зображеннями. Це означає, що ви не можете виділити абзац, знайти число чи вставити фрагмент в іншу програму. Цей інструмент OCR із PDF у текст перетворює такі сторінки, що містять лише зображення, на редагований текст просто у вашому браузері. Він корисний для старих сканів, паперових форм, чеків, сторінок книг, підписаних документів і будь-яких PDF, у яких копіювання та пошук не працюють, бо текст «застряг» у пікселях.
Увесь процес відбувається на стороні клієнта. pdfjs-dist завантажує ваш локальний PDF-файл і відображає кожну сторінку на HTML-canvas, так само як переглядач PDF у браузері показує сторінку на екрані. Потім Tesseract.js читає цей canvas і повертає розпізнані слова. Інструмент повторює процес сторінка за сторінкою, додає чіткий роздільник між сторінками та поміщає об'єднаний текст у редаговане текстове поле. Ваш PDF і витягнутий текст залишаються на вашому пристрої: без завантаження, облікового запису чи черги на сервері.
Поради для кращого OCR у PDF
Точність OCR залежить від якості скану. Найкраще працюють рівні сторінки з темним текстом на світлому тлі. Розмиті сторінки, сильні тіні, рукописний текст, декоративні шрифти та скани з низькою роздільною здатністю можуть знизити точність. Якщо є вихідний документ, відскануйте його знову з вищою роздільною здатністю перед запуском OCR. Для знімків камерою тримайте папір рівно, обріжте стіл або тло та подбайте про рівномірне освітлення сторінки.
Оберіть мову, яка відповідає більшій частині документа. Коли ви вперше користуєтеся певною мовою, браузеру може знадобитися завантажити рушій OCR і мовну модель, тому перший запуск може тривати довше. Після цього кешування в браузері зазвичай пришвидшує наступні завдання. Завжди перевіряйте результат, перш ніж використовувати його для рахунків, юридичних документів, імен, адрес чи чисел, адже OCR може плутати схожі символи, як-от O і 0 або I і 1.
Копіюйте, редагуйте й архівуйте результат
Коли розпізнавання завершиться, ви можете редагувати результат безпосередньо в текстовому полі. Роздільники сторінок полегшують порівняння витягнутого тексту з оригінальним PDF і видалення колонтитулів, номерів сторінок чи артефактів сканування. Використовуйте кнопку копіювання для швидких нотаток, чернеток листів і пошуку, або завантажте простий текстовий файл, щоб зберегти результат OCR поруч із вихідним PDF. Для дуже довгих сканованих документів запускайте інструмент, не закриваючи вкладку, і уникайте переходу в режими енергозбереження, які можуть призупинити роботу браузера.
Як користуватися
- Додайте PDFПеретягніть один сканований PDF у поле завантаження або натисніть, щоб вибрати його.
- Оберіть мовуВиберіть мову OCR, яка найкраще відповідає документу.
- Запустіть OCRКожна сторінка рендериться на canvas і послідовно розпізнається локально.
- Скопіюйте або завантажтеПеревірте об'єднаний текст, після чого скопіюйте його або збережіть як файл .txt.