PDF til tekstkonvertering
Trekk ut ren tekst fra en PDFs tekstlag i nettleseren, side for side, klar til å kopiere eller laste ned.
Resultat
En PDF er lett å lese, men vanskelig å gjenbruke: du kan ikke alltid velge teksten rent, og det er kjedelig å kopiere side etter side for hånd. Dette verktøyet trekker ut ren tekst fra en PDF-tekstlag i én omgang, helt inne i nettleseren din, og leverer den tilbake klar til å kopiere eller laste ned - ingen opplasting, ingen konto, ingen vannmerke.
Utvinningen fungerer side for side. Hver sides tekst er hentet fra dokumentets eget tekstlag og atskilt med en tydelig "Side N"-markør, slik at en femti-siders rapport forblir organisert i stedet for å kollapse til én udifferensiert vegg av ord. Resultatet lander i en tekstboks du kan lese, velge, kopiere til utklippstavlen eller lagre som en .txt-fil som åpnes hvor som helst.
Ærlighet er viktig her: mange PDF-filer er skanninger – fotografier av papir uten tekstlag i det hele tatt. Når det skjer, vil ingen mengde ekstraksjon finne ord, så i stedet for å returnere en stille tom fil, oppdager verktøyet det tomme resultatet og forteller deg at dokumentet er en skanning, og peker deg til bilde til tekst-verktøyet (OCR) som faktisk kan lese piksler. Dette er en tekstuttrekker, ikke en OCR-motor, og den later ikke til å konvertere en PDF til et redigerbart Word-dokument.
Fordi hele prosessen kjører på din egen maskin gjennom pdf.js-motoren, forlater aldri konfidensielle kontrakter, erklæringer og poster enheten – det er ingen sidegrenser og ingen server tur-retur. Hvis du trenger sidene som bilder i stedet for tekst, gjengir PDF-til-JPG-verktøyet hver side til et bilde i stedet.