Convertisseur PDF vers Markdown
Extrayez le texte d'un PDF sous forme de Markdown structuré : véritable détection des titres basée sur la taille des polices, listes à partir des puces et de l'indentation — pas un bloc de texte uniforme.
🔒 Entièrement traité dans votre navigateur — rien de ce que vous saisissez ici n'est jamais téléchargé.
Résultat
Une simple extraction « PDF vers texte » vous restitue chaque mot sans en conserver la forme : un titre de page se lit comme une note de bas de page, et une liste à puces devient une phrase continue. Cet outil va plus loin : il lit la taille de police réelle et la position de chaque élément de texte du PDF — grâce au même moteur pdf.js utilisé par les autres outils PDF de ce site — et utilise ces indices visuels pour reconstruire la structure : titres, éléments de liste et paragraphes, le tout rédigé en Markdown.
La détection est véritablement basée sur des mesures, pas sur une supposition déguisée. Les éléments de texte d'une page sont regroupés en lignes selon la proximité de leurs positions verticales, la taille de police de chaque ligne est calculée à partir de sa propre matrice de rendu de texte, et cette taille est comparée à la taille de ligne médiane du document entier — la taille que la plupart des lignes utilisent effectivement, c'est-à-dire celle du corps de texte ordinaire. Une ligne nettement plus grande que cette médiane devient un titre Markdown (les plus grandes lignes deviennent #, les modérément plus grandes ##) ; une ligne qui commence par une puce ou qui est en retrait par rapport aux lignes environnantes devient un élément de liste `- ` ; tout le reste est considéré comme du corps de texte et fusionné en paragraphes.
C'est honnêtement une heuristique, pas un analyseur structurel : les fichiers PDF ne contiennent aucune balise sémantique garantie, seulement des instructions visuelles indiquant où placer l'encre. Des choix de polices inhabituels peuvent donc parfois tromper la comparaison des tailles, et les tableaux sont explicitement hors du champ — les mises en page de cellules ne se réduisent pas à des titres, des listes ou des paragraphes de manière fiable, et cet outil ne prétend pas le contraire. Chaque page est clairement marquée par un séparateur « Page N » dans la sortie, selon la convention utilisée par l'outil PDF vers texte de ce site.
Les pages scannées reçoivent le même traitement honnête qu'ailleurs sur ce site : une page qui n'est en réalité qu'une photographie de document n'a aucune couche de texte. Au lieu de produire silencieusement une section vide, l'outil note exactement les pages qu'il n'a pas pu lire et renvoie vers l'outil Image vers texte (OCR) pour celles-ci. Tout s'exécute localement dans votre navigateur — rien n'est téléchargé, il n'y a aucune limite de pages, et le résultat apparaît dans une zone de texte que vous pouvez copier ou enregistrer sous forme de fichier .md ouvrable dans n'importe quel éditeur compatible Markdown.