0

Convertitore PDF in Markdown

Estrai il testo di un PDF come Markdown strutturato: rilevamento reale dei titoli dalla dimensione del font, rilevamento delle liste da punti elenco e rientri – non un'unica massa indistinta di testo.

🔒 Elaborato interamente nel tuo browser: nulla di ciò che inserisci qui verrà mai caricato.

📑

Trascina e rilascia il documento PDF qui

o Clicca per sfogliare i file PDF

Elaborazione... 0%
Caricamento PDF
Estrazione testo con posizioni
Rilevamento intestazioni e struttura
Completato

Risultato

Un semplice "dump PDF in testo" ti restituisce ogni parola senza la struttura: il titolo di una pagina si legge esattamente come una nota a piè di pagina, e un elenco puntato diventa un'unica frase di seguito. Questo strumento fa un passo in più, leggendo la dimensione e la posizione reale di ogni elemento testuale dal PDF – tramite lo stesso motore pdf.js usato dagli altri strumenti PDF di questo sito – e sfruttando queste evidenze visive per ricostruire la struttura: intestazioni, voci di elenco e paragrafi, scritti in Markdown.

Il rilevamento è realmente basato su misurazioni, non su congetture. Gli elementi testuali di una pagina vengono raggruppati in righe in base alla vicinanza delle loro posizioni verticali; la dimensione del font di ogni riga è calcolata a partire dalla propria matrice di rendering del testo; tale dimensione viene poi confrontata con la dimensione mediana delle righe dell'intero documento – la dimensione che la maggior parte delle righe effettivamente utilizza, ovvero il normale corpo del testo. Una riga visibilmente più grande di tale mediana diventa un'intestazione Markdown (le righe più grandi diventano #, quelle moderatamente più grandi ##); una riga che inizia con un carattere di punto elenco o che è rientrata rispetto alle righe circostanti diventa un elemento di lista `-`; tutto il resto viene trattato come corpo del testo e unito in paragrafi.

Si tratta onestamente di un'euristica, non di un parser strutturale: i file PDF non contengono marcature semantiche garantite, ma solo istruzioni visive su dove va l'inchiostro; pertanto, scelte di font insolite da parte di un designer possono occasionalmente trarre in inganno il confronto delle dimensioni, e le tabelle sono esplicitamente fuori dall'ambito di applicazione – i layout a celle non sono riconducibili in modo affidabile a intestazioni, elenchi o paragrafi, e questo strumento non finge il contrario. Ogni pagina è chiaramente contrassegnata nell'output da un separatore "Pagina N", coerentemente con la convenzione adottata dallo strumento PDF-to-text di questo sito.

Le pagine scannerizzate ricevono lo stesso trattamento trasparente che altrove su questo sito: una pagina che in realtà è solo una fotografia di un foglio di carta non presenta alcun livello testuale; quindi, invece di produrre silenziosamente una sezione vuota, lo strumento annota esattamente quali pagine non ha potuto leggere e rimanda allo strumento Image to Text (OCR) per gestirle. Tutto viene eseguito localmente nel tuo browser – nessun caricamento, nessun limite di pagine, e il risultato compare in una casella di testo che puoi copiare o salvare come file .md, apribile con qualsiasi editor compatibile con Markdown.