PDF към Markdown Конвертор
Извлечете текста на PDF като структуриран Markdown: разпознаване на заглавия по размера на шрифта, разпознаване на списъци по точки и отстъп — не просто плоска стена от текст.
🔒 Обработва се изцяло във вашия браузър - нищо, което въвеждате тук, никога не се качва.
Резултат
Обикновеното „PDF към текст“ извличане дава всички думи без никаква структура: заглавието на страница чете точно като бележка под линия, а точковият списък става на едно дълго изречение. Този инструмент отива стъпка напред, като прочита действителния размер и позиция на всеки текстов елемент от PDF — чрез същия pdf.js двигател, който използват и другите PDF инструменти на този сайт — и използва тази визуална информация, за да възстанови структурата: заглавия, елементи на списък и параграфи, записани като Markdown.
Разпознаването е наистина базирано на измервания, а не на предположения, маскирани като такива. Текстовите елементи на страница се групират в редове според близостта на вертикалните им позиции, размерът на шрифта на всеки ред се изчислява от собствената му матрица на рендиране на текст и този размер се сравнява с медианния размер на ред за целия документ — размерът, който повечето редове реално използват, т.е. обикновен основен текст. Ред, който е видимо по-голям от този медианен размер, става Markdown заглавие (най-големите редове стават #, умерено по-големите стават ##); ред, който започва с водещ символ за точка или е разположен с по-голям отстъп от околните редове, става елемент на списък `- `; всичко останало се третира като основен текст и се слива в параграфи.
Това честно казано е евристика, а не структурен анализатор: PDF файловете не съдържат гарантирана семантична маркировка, а само визуални инструкции къде да отиде мастилото, така че необичайни шрифтови решения на дизайнера понякога могат да заблудят сравнението на размерите, а таблиците са изрично извън обхвата — клетъчните оформления не се свеждат по надежден начин до заглавия, списъци или параграфи и този инструмент не претендира за друго. Всяка страница е ясно обозначена с разделител „Страница N“ в изхода, следвайки конвенцията, използвана от инструмента „PDF към текст“ на този сайт.
Сканираните страници получават същото честно отношение, както и навсякъде другаде по този сайт: страница, която всъщност е просто снимка на хартия, няма текстов слой, така че вместо безмълвно да генерира празна секция, инструментът отбелязва точно кои страници не е могъл да прочете и препраща към инструмента „Изображение към текст (OCR)“ за тях. Всичко работи локално във вашия браузър — нищо не се качва, няма ограничения на броя страници и резултатът попада в текстово поле, което можете да копирате или запишете като .md файл, отварящ се във всеки редактор, поддържащ Markdown.