PDF naar tekst OCR
Haal tekst uit gescande pdf's in je browser met pdf.js-weergave en Tesseract.js-OCR. Privé, gratis en zonder uploads.
🔒 Draait volledig in uw browser — niets wordt geüploadHaal privé tekst uit gescande pdf's
Gescande pdf's zien er vaak uit als gewone documenten, maar de pagina's zijn in werkelijkheid afbeeldingen. Dat betekent dat je geen alinea kunt selecteren, niet op een getal kunt zoeken en geen sectie in een andere app kunt plakken. Deze PDF naar tekst OCR-tool zet die pagina's met alleen afbeeldingen in je browser om in bewerkbare tekst. Handig voor oude scans, papieren formulieren, bonnetjes, boekpagina's, ondertekende documenten en elke pdf waarin kopiëren en zoeken niet werken omdat de tekst in pixels is opgesloten.
Het proces vindt volledig aan de clientzijde plaats. pdfjs-dist laadt je lokale pdf-bestand en rendert elke pagina op een HTML-canvas, zoals een pdf-viewer in de browser een pagina op het scherm toont. Tesseract.js leest dat canvas vervolgens en geeft de herkende woorden terug. De tool herhaalt dit pagina voor pagina, voegt een duidelijke scheiding tussen pagina's toe en plaatst de samengevoegde tekst in een bewerkbaar tekstvak. Je pdf en de uitgelezen tekst blijven op je apparaat: geen upload, geen account en geen serverwachtrij.
Tips voor betere pdf-OCR
De nauwkeurigheid van OCR hangt af van de kwaliteit van de scan. Rechte pagina's met donkere tekst op een lichte achtergrond werken het best. Onscherpe pagina's, zware schaduwen, handschrift, sierlijke lettertypen en scans met een lage resolutie kunnen de nauwkeurigheid verlagen. Is het brondocument beschikbaar, scan het dan opnieuw met een hogere resolutie voordat je OCR uitvoert. Houd bij scans met de camera het papier vlak, snijd de tafel of achtergrond weg en zorg dat de pagina gelijkmatig is verlicht.
Kies de taal die bij het grootste deel van het document past. De eerste keer dat je een taal gebruikt, moet de browser mogelijk de OCR-engine en het taalmodel downloaden, dus de eerste run kan langer duren. Daarna maakt browsercaching latere taken meestal sneller. Controleer het resultaat altijd voordat je het gebruikt voor facturen, juridische documenten, namen, adressen of getallen, want OCR kan soortgelijke tekens zoals O en 0 of I en 1 verwarren.
Het resultaat kopiëren, bewerken en archiveren
Als de herkenning klaar is, kun je het resultaat direct in het tekstvak bewerken. Paginascheidingen maken het makkelijker om de uitgelezen tekst met de originele pdf te vergelijken en koptekst, paginanummers of scanartefacten te verwijderen. Gebruik de kopieerknop voor snelle notities, e-mailconcepten en zoekopdrachten, of download een tekstbestand om de OCR-uitvoer naast de bron-pdf te archiveren. Laat bij zeer lange gescande documenten het tabblad open en vermijd energiebesparingsmodi die het werk van de browser kunnen pauzeren.
Hoe te gebruiken
- Voeg een pdf toeSleep één gescande pdf naar het uploadvak of klik om er een te kiezen.
- Kies de taalSelecteer de OCR-taal die het best bij het document past.
- Voer OCR uitElke pagina wordt op een canvas gerenderd en achter elkaar lokaal herkend.
- Kopieer of downloadControleer de samengevoegde tekst en kopieer die of sla hem op als .txt-bestand.