0

Convertor PDF în Markdown

Extrageți textul unui PDF ca Markdown structurat: detectarea titlului real din dimensiunea fontului, detectarea listelor din marcatori și indentare - nu un perete plat de text.

📑

Trageți și plasați documentul PDF aici

sau faceți clic pentru a răsfoi fișiere PDF

Buy Me a Coffee at ko-fi.com
Procesare... 0%
Se încarcă PDF
Extragerea textului cu poziții
Detectarea titlurilor și structurii
Gata

Rezultat

O imagine simplă „PDF în text” vă oferă fiecare cuvânt fără nicio formă: titlul unei pagini se citește exact ca o notă de subsol, iar o listă cu marcatori se transformă într-o propoziție continuă. Acest instrument face un pas mai departe citind dimensiunea și poziția reală a fontului fiecărui element de text din PDF - prin același motor pdf.js pe care îl folosesc celelalte instrumente PDF ale acestui site - și folosind acele dovezi vizuale pentru a reconstrui structura: titluri, elemente din listă și paragrafe, scrise ca Markdown.

Detectarea se bazează cu adevărat pe măsurare, nu o presupunere îmbrăcată ca una. Elementele de text dintr-o pagină sunt grupate în linii în funcție de cât de apropiate sunt pozițiile lor verticale, dimensiunea fontului fiecărei linii este calculată din propria matrice de redare a textului, iar dimensiunea respectivă este comparată cu dimensiunea medie a liniei pentru întreg documentul - dimensiunea pe care o folosesc de fapt majoritatea liniilor, adică textul obișnuit. O linie vizibil mai mare decât mediana devine un titlu Markdown (cele mai mari linii devin #, cele moderat mai mari devin ##); o linie care începe cu un caracter marcator sau care se află indentat peste liniile din jur devine un element de listă `-`; orice altceva este tratat ca text corporal și îmbinat în paragrafe.

Acesta este sincer un analizor euristic, nu structural: fișierele PDF nu au un marcaj semantic garantat, ci doar instrucțiuni vizuale pentru unde merge cerneala, așa că alegerile neobișnuite ale fonturilor ale unui designer pot păcăli ocazional comparația de dimensiune, iar tabelele sunt în mod explicit în afara domeniului de aplicare - layout-urile celulelor nu se reduc la titluri, liste sau paragrafe în niciun fel, și altfel acest instrument nu pretinde în niciun fel de încredere. Fiecare pagină este marcată clar cu un divizor „Pagina N” în rezultat, care corespunde convenției utilizate de instrumentul PDF-to-text al acestui site.

Paginile scanate primesc același tratament cinstit ca în alte locuri de pe acest site: o pagină care este într-adevăr doar o fotografie de hârtie nu are deloc strat de text, așa că, în loc să producă în tăcere o secțiune goală, instrumentul notează exact ce pagini nu a putut citi și indică instrumentul Image to Text (OCR) pentru acestea. Totul rulează local în browserul dvs. — nimic nu este încărcat, nu există limite de pagină, iar rezultatul ajunge într-o casetă de text pe care o puteți copia sau salva ca fișier .md care se deschide în orice editor compatibil Markdown.