0

PDF till Markdown Converter

Extrahera en PDF-text som strukturerad Markdown: verklig rubrikdetektering från teckenstorlek, listdetektering från punkter och indrag – inte en platt vägg av text.

📑

Dra & släpp PDF-dokument här

eller Klicka för att bläddra i PDF-filer

Buy Me a Coffee at ko-fi.com
Bearbetar... 0%
Laddar PDF
Extrahera text med positioner
Upptäcka rubriker och struktur
Klart

Resultat

En vanlig "PDF till text"-dump ger dig varje ord utan form: en sidtitel läses exakt som en fotnot, och en punktlista förvandlas till en löpande mening. Det här verktyget går ett steg längre genom att läsa varje textobjekts verkliga teckenstorlek och position från PDF-filen – via samma pdf.js-motor som den här webbplatsens andra PDF-verktyg använder – och använda det visuella beviset för att rekonstruera strukturen: rubriker, listobjekt och stycken, skrivna som Markdown.

Detekteringen är genuint mätningsbaserad, inte en gissning utklädd till en sådan. Textobjekt på en sida grupperas i rader efter hur nära deras vertikala positioner är, varje rads teckensnittsstorlek beräknas från sin egen textåtergivningsmatris och den storleken jämförs med medianradstorleken för hela dokumentet - den storlek som de flesta rader faktiskt använder, d.v.s. vanlig brödtext. En linje som är märkbart större än den medianen blir en Markdown-rubrik (de största linjerna blir #, måttligt större blir ##); en rad som börjar med ett punkttecken eller sitter indragen förbi de omgivande linjerna blir ett `-` listobjekt; allt annat behandlas som brödtext och slås samman till stycken.

Detta är ärligt talat en heuristik, inte en strukturell parser: PDF-filer har ingen garanterad semantisk markering, bara visuella instruktioner för vart bläcket tar vägen, så en designers ovanliga teckensnittsval kan ibland lura storleksjämförelsen, och tabeller är uttryckligen utanför räckvidden - celllayouter reduceras inte till rubriker, listor eller stycken, och på något annat sätt gör det här verktyget inte tillförlitligt. Varje sida är tydligt markerad med en "Sida N"-avdelare i utdata, som matchar konventionen som används av denna webbplats PDF-till-text-verktyg.

Skannade sidor får samma ärliga behandling som på andra ställen på den här webbplatsen: en sida som egentligen bara är ett fotografi av papper har inget textlager alls, så istället för att under tystnad producera en tom sektion, noterar verktyget exakt vilka sidor det inte kunde läsa och pekar på verktyget Bild till text (OCR) för dessa. Allt körs lokalt i din webbläsare — ingenting laddas upp, det finns inga sidbegränsningar och resultatet hamnar i en textruta som du kan kopiera eller spara som en .md-fil som öppnas i vilken Markdown-medveten redigerare som helst.