Претварач PDF-а у Markdown
Извуците текст PDF-а као структурирани Markdown: стварно откривање наслова из величине фонта, откривање листи из знакова за набрајање и увлачења — а не један раван зид текста.
🔒 У потпуности се обрађује у вашем претраживачу — ништа што овде унесете се никада не отпрема.
Резултат
Обичан „PDF у текст“ избачај даје вам сваку реч без икаквог облика: наслов странице чита се исто као фуснота, а набрајана листа претвара се у надовезану реченицу. Ова алатка иде корак даље тако што чита стварну величину фонта и позицију сваке текстуалне ставке из PDF-а — преко истог pdf.js погона који користе и друге PDF алатке овог сајта — и користи те визуелне доказе за реконструкцију структуре: наслове, ставке листе и пасусе, записане као Markdown.
Откривање је заиста засновано на мерењу, а не на нагађању које се тако представља. Текстуалне ставке на страници групишу се у редове према томе колико су им блиске вертикалне позиције, величина фонта сваког реда израчунава се из сопствене матрице приказа текста, а та величина се упоређује са медијаном величине реда за цео документ — величином коју већина редова заиста користи, тј. обичан основни текст. Ред приметно већи од те медијане постаје Markdown наслов (највећи редови постају #, умерено већи постају ##); ред који почиње знаком за набрајање или је увучен у односу на околне редове постаје ставка листе `- `; све остало третира се као основни текст и спаја у пасусе.
Ово је искрено речено хеуристика, а не структурални парсер: PDF датотеке не носе гарантовано семантичко означавање, већ само визуелне инструкције где се мастило налази, па необични избори фонта дизајнера могу повремено заварати поређење величина, а табеле су изричито изван домета — распоред ћелија се не своди на наслове, листе или пасусе ни на један поуздан начин, и ова алатка се не претвара другачије. Свака страна је јасно означена разделником „Страна N“ у излазу, у складу са конвенцијом коју користи алатка за PDF-у-текст овог сајта.
Скениране странице добијају исти искрен третман као и другде на овом сајту: страница која је заиста само фотографија папира уопште нема текстуални слој, па уместо да ћутке произведе празан одељак, алатка бележи тачно које странице није могла да прочита и упућује на алатку Слика у текст (OCR) за њих. Све ради локално у вашем прегледачу — ништа се не отпрема, нема ограничења броја страница, а резултат се појављује у текстуалном пољу које можете копирати или сачувати као .md датотеку која се отвара у било ком уређивачу који подржава Markdown.