0

PDF към Markdown конвертор

Извлечете текста на PDF като структуриран Markdown: откриване на реално заглавие от размера на шрифта, откриване на списък от водещи символи и отстъп — не една плоска стена от текст.

📑

Плъзнете и пуснете PDF документа тук

или кликнете за преглед на PDF файлове

Buy Me a Coffee at ko-fi.com
Обработка... 0%
Зарежда се PDF
Извличане на текст с позиции
Откриване на заглавия и структура
Готово

Резултат

Обикновен дъмп от „PDF към текст“ ви дава всяка дума без никаква форма: заглавие на страница се чете точно като бележка под линия, а списъкът с водещи символи се превръща в изречение. Този инструмент отива още една крачка напред, като прочита реалния размер и позиция на шрифта на всеки текстов елемент от PDF файла — чрез същата машина pdf.js, която използват другите PDF инструменти на този сайт — и използва това визуално доказателство, за да възстанови структурата: заглавия, елементи от списък и абзаци, написани като Markdown.

Откриването е наистина базирано на измерване, а не на предположение, облечено като такова. Текстовите елементи на страницата са групирани в редове според това колко близо са техните вертикални позиции, размерът на шрифта на всеки ред се изчислява от собствената му матрица за изобразяване на текст и този размер се сравнява с размера на средната линия за целия документ - размерът, който повечето редове всъщност използват, т.е. обикновен основен текст. Линия, забележимо по-голяма от тази медиана, се превръща в заглавие Markdown (най-големите линии стават #, умерено по-големите стават ##); ред, който започва с водещ символ или е с отстъп зад околните редове, става елемент от списъка `-`; всичко останало се третира като основен текст и се обединява в параграфи.

Това е честно евристичен, а не структурен анализатор: PDF файловете не носят гарантирано семантично маркиране, само визуални инструкции за това къде отива мастилото, така че необичайните избори на шрифтове на дизайнера понякога могат да заблудят сравнението на размера, а таблиците изрично са извън обхвата – оформленията на клетките не се редуцират до заглавия, списъци или абзаци по надежден начин и този инструмент не претендира за обратното. Всяка страница е ясно маркирана с разделител „Страница N“ в изхода, съответстващ на конвенцията, използвана от инструмента за преобразуване на PDF в текст на този сайт.

Сканираните страници получават същото честно отношение, както навсякъде в този сайт: страница, която всъщност е само снимка на хартия, изобщо няма текстов слой, така че вместо безшумно да създаде празен раздел, инструментът отбелязва точно кои страници не може да прочете и насочва към инструмента Изображение към текст (OCR) за тях. Всичко работи локално във вашия браузър — нищо не се качва, няма ограничения за страници и резултатът се приземява в текстово поле, което можете да копирате или запазите като .md файл, който се отваря във всеки редактор, поддържащ Markdown.