Convertisseur PDF en Markdown
Extrayez le texte d'un PDF sous forme de Markdown structuré : détection de titre réel à partir de la taille de la police, détection de liste à partir des puces et du retrait - pas un seul mur plat de texte.
Résultat
Un simple vidage « PDF en texte » vous donne chaque mot sans aucune forme : le titre d'une page se lit exactement comme une note de bas de page et une liste à puces se transforme en une phrase continue. Cet outil va encore plus loin en lisant la taille et la position réelles de la police de chaque élément de texte à partir du PDF - via le même moteur pdf.js que les autres outils PDF de ce site utilisent - et en utilisant ces preuves visuelles pour reconstruire la structure : titres, éléments de liste et paragraphes, rédigés en Markdown.
La détection est véritablement basée sur des mesures, et non sur une supposition déguisée en telle. Les éléments de texte sur une page sont regroupés en lignes en fonction de la proximité de leurs positions verticales, la taille de police de chaque ligne est calculée à partir de sa propre matrice de rendu de texte et cette taille est comparée à la taille de ligne médiane pour l'ensemble du document - la taille que la plupart des lignes utilisent réellement, c'est-à-dire le corps du texte ordinaire. Une ligne sensiblement plus grande que cette médiane devient un en-tête Markdown (les lignes les plus grandes deviennent #, les lignes moyennement plus grandes deviennent ##) ; une ligne qui commence par une puce ou qui est en retrait après les lignes environnantes devient un élément de liste `- ` ; tout le reste est traité comme corps de texte et fusionné en paragraphes.
Il s'agit honnêtement d'une heuristique, pas d'un analyseur structurel : les fichiers PDF ne comportent aucun balisage sémantique garanti, seulement des instructions visuelles sur la destination de l'encre, de sorte que les choix de polices inhabituels d'un concepteur peuvent parfois tromper la comparaison de taille, et les tableaux sont explicitement hors de portée - les dispositions de cellules ne se réduisent pas de manière fiable aux titres, aux listes ou aux paragraphes, et cet outil ne prétend pas le contraire. Chaque page est clairement marquée d'un séparateur « Page N » dans la sortie, correspondant à la convention utilisée par l'outil PDF en texte de ce site.
Les pages numérisées bénéficient du même traitement honnête qu'ailleurs sur ce site : une page qui n'est en réalité qu'une photographie de papier n'a aucune couche de texte, donc au lieu de produire silencieusement une section vide, l'outil note exactement quelles pages il n'a pas pu lire et pointe vers l'outil Image to Text (OCR) pour celles-ci. Tout s'exécute localement dans votre navigateur : rien n'est téléchargé, il n'y a pas de limite de pages et le résultat arrive dans une zone de texte que vous pouvez copier ou enregistrer sous forme de fichier .md qui s'ouvre dans n'importe quel éditeur prenant en charge Markdown.