PDF-ből szöveg konvertáló
Kivonja az egyszerű szöveget a PDF szövegrétegéből a böngészőben, oldalanként, másolásra vagy letöltésre készen.
Eredmény
A PDF könnyen olvasható, de kényelmetlen az újrafelhasználás: nem lehet mindig tisztán kiválasztani a szövegét, és oldalról oldalra kézzel másolni fárasztó. Ez az eszköz egy lépésben kivonja a sima szöveget a PDF szövegrétegéből, teljes egészében a böngészőben, és másolásra vagy letöltésre készen adja vissza – nincs feltöltés, nincs fiók, nincs vízjel.
A kivonás oldalról oldalra működik. Az egyes oldalak szövegét a dokumentum saját szövegrétegéből húzzák ki, és világos „N. oldal” jelölő választja el egymástól, így az ötvenoldalas jelentés rendszerezett marad ahelyett, hogy egyetlen megkülönböztethetetlen szófalba omlana össze. Az eredmény egy szövegmezőbe kerül, amelyet elolvashat, kiválaszthat, a vágólapra másolhat, vagy mentheti .txt fájlként, amely bárhol megnyílik.
Az őszinteség itt számít: sok PDF szkennelt – papírról készült fényképek, amelyekben nincs szövegréteg. Amikor ez megtörténik, a kivonatolás semmilyen mennyiségben nem talál szavakat, így ahelyett, hogy egy csendesen üres fájlt adna vissza, az eszköz érzékeli az üres eredményt, és közli, hogy a dokumentum szkennelés, és az Image to Text (OCR) eszközre mutat, amely valóban képes pixeleket olvasni. Ez egy szövegkivonó, nem egy OCR-motor, és nem úgy tesz, mintha egy PDF-fájlt szerkeszthető Word-dokumentummá alakítana.
Mivel az egész folyamat a saját gépén fut a pdf.js motoron keresztül, a bizalmas szerződések, nyilatkozatok és feljegyzések soha nem hagyják el az eszközt – nincs oldalkorlát, és nincs oda-vissza út. Ha az oldalakra képként, nem pedig szövegként van szüksége, a PDF-ből JPG-be eszköz minden oldalt képpé jelenít meg.