0

Конвертер PDF у Markdown

Витягніть текст PDF як структурований Markdown: справжнє виявлення заголовків за розміром шрифту, списків — за маркерами й відступом, а не суцільна стіна тексту.

📑

Перетягніть PDF-документ сюди

або натисніть для огляду PDF-файлів

Buy Me a Coffee at ko-fi.com
Опрацювання... 0%
Завантаження PDF
Витягання тексту з позиціями
Виявлення заголовків і структури
Готово

Результат

Звичайне «вивантаження PDF у текст» дає всі слова без жодної форми: заголовок сторінки читається так само, як виноска, а маркований список перетворюється на суцільне речення. Цей інструмент іде на крок далі, читаючи реальний розмір шрифту й позицію кожного текстового елемента з PDF — через той самий рушій pdf.js, який використовують інші PDF-інструменти цього сайту, — і використовує ці візуальні дані, щоб відновити структуру: заголовки, пункти списків і абзаци, записані як Markdown.

Виявлення справді ґрунтується на вимірюваннях, а не є здогадкою, вбраною в них. Текстові елементи сторінки групуються в рядки за близькістю вертикальних позицій, розмір шрифту кожного рядка обчислюється з його власної матриці рендерингу тексту, і цей розмір порівнюється з медіанним розміром рядків усього документа — розміром, який справді використовує більшість рядків, тобто звичайний основний текст. Рядок, помітно більший за цю медіану, стає заголовком Markdown (найбільші рядки — #, помірно більші — ##); рядок, що починається з символу-маркера або має відступ більший за сусідні рядки, стає пунктом списку `- `; усе інше вважається основним текстом і об'єднується в абзаци.

Це чесно евристика, а не структурний парсер: файли PDF не мають гарантованої семантичної розмітки, лише візуальні інструкції, куди наносити чорнило, тож незвичний вибір шрифту дизайнером інколи може обманути порівняння розмірів, а таблиці свідомо поза межами можливостей — компонування комірок не зводиться надійно до заголовків, списків чи абзаців, і цей інструмент цього не вдає. Кожна сторінка чітко позначена роздільником «Сторінка N» у виводі — так само, як це робить інструмент «PDF у текст» цього сайту.

Скановані сторінки отримують таке саме чесне ставлення, як і в інших інструментах сайту: сторінка, що є просто фотографією паперу, взагалі не має текстового шару, тож замість того, щоб мовчки видати порожній розділ, інструмент позначає, які саме сторінки він не зміг прочитати, і скеровує до інструмента «Розпізнавання тексту з фото» (OCR) для них. Усе працює локально у вашому браузері — нічого не вивантажується, лімітів на сторінки немає, а результат потрапляє в текстове поле, яке можна скопіювати або зберегти як файл .md, що відкривається в будь-якому редакторі з підтримкою Markdown.