PDF till Markdown-konverterare
Extrahera en PDF-fils text som strukturerad Markdown: verklig rubrikigenkänning från teckenstorlek, listidentifiering från punkttecken och indrag — inte en stor vägg av text.
🔒 Bearbetas helt i din webbläsare – ingenting du anger här laddas någonsin upp.
Resultat
En enkel dump från "PDF till text" ger dig alla ord men ingen struktur: en sidrubrik läses som en fotnot, och en punktlista blir en enda lång mening. Det här verktyget går ett steg längre genom att avläsa varje textelements verkliga teckenstorlek och position från PDF:en — via samma pdf.js-motor som webbplatsens andra PDF-verktyg använder — och använder den visuella informationen för att återskapa strukturen: rubriker, listpunkter och stycken, utskriven som Markdown.
Identifieringen är genuint mätningsbaserad, inte en gissning förklädd till en sådan. Textelement på en sida grupperas till rader baserat på hur nära deras vertikala positioner är, varje rads teckenstorlek beräknas från dess egen textrenderingsmatris, och den storleken jämförs med medianradstorleken för hela dokumentet — den storlek de flesta rader faktiskt använder, dvs. vanlig brödtext. En rad som är märkbart större än den medianen blir en Markdown-rubrik (de största raderna blir #, måttligt större blir ##); en rad som börjar med ett punkttecken eller är indragen längre än de omgivande raderna blir ett `- `-listobjekt; allt annat behandlas som brödtext och slås samman till stycken.
Detta är ärligt talat en heuristik, inte en strukturell tolk: PDF-filer innehåller ingen garanterad semantisk uppmärkning, bara visuella instruktioner för var bläck ska placeras, så en designers ovanliga typsnittsval kan ibland lura storleksjämförelsen, och tabeller ligger uttryckligen utanför omfattningen — cell-layouter låter sig inte tillförlitligt reduceras till rubriker, listor eller stycken, och det här verktyget låtsas inte om något annat. Varje sida markeras tydligt med en "Sida N"-avgränsare i resultatet, i enlighet med konventionen som webbplatsens PDF-till-text-verktyg använder.
Inskannade sidor får samma ärliga behandling som på övriga webbplatsen: en sida som egentligen bara är ett fotografi av papper har inget textlager alls, så istället för att i tysthet producera ett tomt avsnitt noterar verktyget exakt vilka sidor det inte kunde läsa och hänvisar till Bild-till-text (OCR)-verktyget för dessa. Allt körs lokalt i din webbläsare — inget laddas upp, det finns inga sidbegränsningar, och resultatet hamnar i en textruta som du kan kopiera eller spara som en .md-fil som öppnas i valfri Markdown-kompatibel redigerare.