PDF till text med OCR
Extrahera text från skannade PDF-filer i webbläsaren med pdf.js-rendering och Tesseract.js OCR. Privat, gratis och utan uppladdning.
🔒 Körs helt i din webbläsare — ingenting laddas uppExtrahera text från skannade PDF-filer privat
Skannade PDF-filer ser ofta ut som vanliga dokument, men sidorna är egentligen bilder. Det betyder att du inte kan markera ett stycke, söka efter ett nummer eller klistra in ett avsnitt i en annan app. Det här PDF till text med OCR-verktyget omvandlar sådana sidor som bara består av bilder till redigerbar text i din webbläsare. Det är användbart för gamla skanningar, pappersformulär, kvitton, boksidor, signerade dokument och alla PDF-filer där kopiering och sökning inte fungerar eftersom texten är instängd i pixlar.
Processen sker helt på klientsidan. pdfjs-dist läser in din lokala PDF-fil och renderar varje sida till en HTML-canvas, ungefär som en PDF-visare i webbläsaren visar en sida på skärmen. Tesseract.js läser sedan den canvasen och returnerar de igenkända orden. Verktyget upprepar processen sida för sida, lägger till en tydlig avgränsare mellan sidorna och placerar den sammanslagna texten i ett redigerbart textfält. Din PDF och den extraherade texten stannar på din enhet – ingen uppladdning, inget konto och ingen serverkö.
Tips för bättre OCR av PDF
OCR-precisionen beror på skanningens kvalitet. Raka sidor med mörk text på ljus bakgrund fungerar bäst. Suddiga sidor, kraftiga skuggor, handskrift, dekorativa typsnitt och skanningar med låg upplösning kan minska precisionen. Om originaldokumentet finns tillgängligt, skanna det igen med högre upplösning innan du kör OCR. Vid kameraskanningar bör du hålla pappret plant, beskära bort bordet eller bakgrunden och se till att sidan är jämnt belyst.
Välj det språk som passar större delen av dokumentet. Första gången du använder ett språk kan webbläsaren behöva ladda ned OCR-motorn och språkmodellen, så den första körningen kan ta längre tid. Därefter gör webbläsarens cache oftast framtida jobb snabbare. Granska alltid resultatet innan du använder det för fakturor, juridiska dokument, namn, adresser eller siffror, eftersom OCR kan förväxla liknande tecken som O och 0 eller I och 1.
Kopiera, redigera och arkivera resultatet
När igenkänningen är klar kan du redigera resultatet direkt i textfältet. Sidavgränsare gör det enklare att jämföra den extraherade texten med den ursprungliga PDF-filen och ta bort sidhuvuden, sid- nummer eller skanningsartefakter. Använd kopieringsknappen för snabba anteckningar, e-postutkast och sökningar, eller ladda ned en ren textfil när du vill arkivera OCR-resultatet bredvid käll-PDF:en. För mycket långa skannade dokument bör du hålla fliken öppen medan verktyget körs och undvika att växla till energisparlägen som kan pausa webbläsarens arbete.
Hur man använder
- Lägg till en PDFSläpp en skannad PDF i uppladdningsrutan eller klicka för att välja den.
- Välj språkVälj det OCR-språk som bäst matchar dokumentet.
- Kör OCRVarje sida renderas till en canvas och känns igen lokalt i följd.
- Kopiera eller ladda nedGranska den sammanslagna texten och kopiera den eller spara den som en .txt-fil.