Конвертер PDF у Markdown
Витягніть текст PDF як структурований Markdown: справжнє визначення заголовків за розміром шрифту, виявлення списків за маркерами та відступами — не суцільна стіна тексту.
🔒 Обробляється повністю у вашому браузері — те, що ви тут вводите, ніколи не вивантажується.
Результат
Звичайне перетворення «PDF у текст» дає вам усі слова, але без жодної форми: назва сторінки виглядає так само, як виноска, а маркований список перетворюється на злите речення. Цей інструмент іде далі: зчитує реальний розмір шрифту та позицію кожного текстового елемента з PDF — за допомогою того самого рушія pdf.js, який використовують інші PDF-інструменти цього сайту — і на основі цих візуальних даних відновлює структуру: заголовки, елементи списків та абзаци, записані як Markdown.
Визначення справді базується на вимірюваннях, а не на здогадках. Текстові елементи на сторінці групуються в рядки за близькістю їхніх вертикальних позицій; розмір шрифту кожного рядка обчислюється з його власної матриці рендерингу; потім цей розмір порівнюється з медіанним розміром рядка для всього документа — тобто з розміром, який використовується в більшості рядків, тобто звичайним основним текстом. Рядок, помітно більший за цю медіану, стає заголовком Markdown (найбільші рядки — #, помірно більші — ##); рядок, що починається з маркера або має більший відступ, ніж навколишні рядки, стає елементом списку `- `; усе інше вважається основним текстом і об’єднується в абзаци.
Це чесно евристика, а не структурний парсер: файли PDF не містять гарантованої семантичної розмітки, лише візуальні інструкції про те, куди наносити чорнило, тому незвичайний вибір шрифтів дизайнером іноді може обдурити порівняння розмірів, а таблиці свідомо не підтримуються — розкладка комірок не зводиться надійним чином до заголовків, списків чи абзаців, і цей інструмент не претендує на інше. Кожна сторінка чітко позначається роздільником «Сторінка N» у виводі, відповідно до домовленості, яку використовує інструмент «PDF в текст» на цьому сайті.
Відскановані сторінки отримують таку ж чесну обробку, як і скрізь на цьому сайті: сторінка, яка насправді є фотографією паперу, взагалі не має текстового шару, тож замість того, щоб мовчки створювати порожній розділ, інструмент зазначає, які саме сторінки не вдалося прочитати, та вказує на інструмент «Зображення в текст (OCR)» для них. Усе працює локально у вашому браузері — нічого не завантажується, немає обмежень на кількість сторінок, а результат з’являється у текстовому полі, яке можна скопіювати або зберегти як файл .md, що відкривається в будь-якому редакторі з підтримкою Markdown.