Convertitore da PDF a Markdown
Estrai il testo di un PDF come Markdown strutturato: rilevamento dell'intestazione reale dalla dimensione del carattere, rilevamento dell'elenco da punti elenco e rientro, non da una parete piatta di testo.
Risultato
Un semplice dump "da PDF a testo" ti fornisce ogni parola senza alcuna forma: il titolo di una pagina si legge esattamente come una nota a piè di pagina e un elenco puntato si trasforma in una frase continua. Questo strumento fa un ulteriore passo avanti leggendo la dimensione e la posizione reale del carattere di ogni elemento di testo dal PDF - tramite lo stesso motore pdf.js utilizzato dagli altri strumenti PDF di questo sito - e utilizzando tale prova visiva per ricostruire la struttura: intestazioni, voci di elenco e paragrafi, scritti come Markdown.
Il rilevamento è realmente basato sulla misurazione, non su un'ipotesi mascherata da tale. Gli elementi di testo su una pagina sono raggruppati in righe in base a quanto sono vicine le loro posizioni verticali, la dimensione del carattere di ciascuna riga viene calcolata dalla propria matrice di rendering del testo e tale dimensione viene confrontata con la dimensione mediana della riga per l'intero documento: la dimensione utilizzata effettivamente dalla maggior parte delle righe, ovvero il corpo del testo ordinario. Una linea notevolmente più grande di quella mediana diventa un'intestazione Markdown (le linee più grandi diventano #, quelle moderatamente più grandi diventano ##); una riga che inizia con un carattere punto elenco o è rientrata oltre le righe circostanti diventa una voce di elenco `- `; tutto il resto viene trattato come corpo del testo e unito in paragrafi.
Questo è onestamente un parser euristico, non strutturale: i file PDF non portano alcun markup semantico garantito, solo istruzioni visive su dove va l'inchiostro, quindi le scelte insolite dei caratteri di un designer possono occasionalmente ingannare il confronto delle dimensioni, e le tabelle sono esplicitamente fuori ambito: i layout delle celle non si riducono a intestazioni, elenchi o paragrafi in alcun modo affidabile, e questo strumento non pretende il contrario. Ogni pagina è chiaramente contrassegnata con un divisore "Pagina N" nell'output, corrispondente alla convenzione utilizzata dallo strumento di conversione da PDF a testo di questo sito.
Le pagine scansionate ricevono lo stesso trattamento onesto che altrove su questo sito: una pagina che in realtà è solo una fotografia di carta non ha alcun livello di testo, quindi invece di produrre silenziosamente una sezione vuota, lo strumento annota esattamente quali pagine non è riuscito a leggere e per quelle punta allo strumento Image to Text (OCR). Tutto viene eseguito localmente nel tuo browser: nulla viene caricato, non ci sono limiti di pagina e il risultato viene visualizzato in una casella di testo che puoi copiare o salvare come file .md che si apre in qualsiasi editor compatibile con Markdown.