0

Konwerter plików PDF na Markdown

Wyodrębnij tekst z pliku PDF w formie strukturalnej Markdown: rzeczywiste wykrywanie nagłówków na podstawie rozmiaru czcionki, wykrywanie list na podstawie punktorów i wcięć — a nie jednej płaskiej ściany tekstu.

📑

Przeciągnij i upuść dokument PDF tutaj

lub kliknij, aby przeglądać pliki PDF

Buy Me a Coffee at ko-fi.com
Przetwarzanie... 0%
Ładowanie pliku PDF
Wyodrębnianie tekstu z pozycjami
Wykrywanie nagłówków i struktury
Gotowe

Wynik

Zwykły zrzut „PDF na tekst” wyświetla każde słowo bez żadnego kształtu: tytuł strony brzmi dokładnie jak przypis, a lista wypunktowana zamienia się w zdanie kończące. To narzędzie idzie o krok dalej, odczytując rzeczywisty rozmiar czcionki i położenie każdego elementu tekstowego z pliku PDF — za pomocą tego samego silnika pdf.js, którego używają inne narzędzia PDF w tej witrynie — i wykorzystując te wizualne dowody do rekonstrukcji struktury: nagłówków, elementów list i akapitów zapisanych w formacie Markdown.

Wykrywanie opiera się naprawdę na pomiarach, a nie na domysłach ubranych w jedno. Elementy tekstowe na stronie są pogrupowane w linie według odległości ich położenia w pionie. Rozmiar czcionki każdej linii jest obliczany na podstawie własnej macierzy renderowania tekstu i rozmiar ten jest porównywany ze medianą rozmiaru linii w całym dokumencie — rozmiarem faktycznie używanym przez większość linii, tj. zwykłym tekstem podstawowym. Linia zauważalnie większa od mediany staje się nagłówkiem Markdown (największe linie stają się #, umiarkowanie większe stają się ##); linia rozpoczynająca się od wypunktowania lub wcięta poza otaczające ją linie staje się pozycją listy `-`; wszystko inne jest traktowane jako tekst główny i łączone w akapity.

To naprawdę heurystyka, a nie parser strukturalny: pliki PDF nie zawierają gwarantowanych znaczników semantycznych, a jedynie wizualne instrukcje dotyczące tego, gdzie trafia atrament, więc nietypowy wybór czcionek przez projektanta może czasami oszukać porównanie rozmiaru, a tabele są wyraźnie poza zakresem — układy komórek nie ograniczają się w żaden niezawodny sposób do nagłówków, list ani akapitów, a to narzędzie nie udaje, że jest inaczej. Każda strona jest wyraźnie oznaczona w wynikach separatorem „Strona N”, zgodnie z konwencją stosowaną w narzędziu PDF do tekstu dostępnym w tej witrynie.

Zeskanowane strony są traktowane tak samo uczciwie, jak gdziekolwiek indziej w tej witrynie: strona, która w rzeczywistości jest tylko fotografią papieru, nie ma w ogóle warstwy tekstowej, więc zamiast po cichu tworzyć pustą sekcję, narzędzie dokładnie zaznacza, których stron nie mogło odczytać i wskazuje w tym przypadku narzędzie Obraz na tekst (OCR). Wszystko działa lokalnie w Twojej przeglądarce — nic nie jest przesyłane, nie ma żadnych limitów stron, a wynik trafia do pola tekstowego, które możesz skopiować lub zapisać jako plik .md, który otwiera się w dowolnym edytorze obsługującym Markdown.