0

Konwerter PDF na Markdown

Wyodrębniaj tekst z plików PDF jako ustrukturyzowany Markdown: wykrywanie nagłówków na podstawie rozmiaru czcionki, wykrywanie list na podstawie wypunktowań i wcięć — nie dostajesz jednolitej ściany tekstu.

🔒 Przetwarzane w całości w Twojej przeglądarce — nic, co tu wpiszesz, nie zostanie nigdy przesłane.

📑

Przeciągnij i upuść dokument PDF tutaj

lub kliknij, aby przeglądać pliki PDF

Przetwarzanie... 0%
Wczytywanie pliku PDF
Wyodrębnianie tekstu z pozycjami
Wykrywanie nagłówków i struktury
Gotowe

Wynik

Zwykłe zrzucenie „PDF na tekst” daje Ci każde słowo, ale bez żadnego kształtu: tytuł strony czyta się tak samo jak przypis, a wypunktowana lista zamienia się w jedno ciągłe zdanie. To narzędzie idzie o krok dalej, odczytując rzeczywisty rozmiar czcionki i położenie każdego elementu tekstowego z pliku PDF — za pomocą tego samego silnika pdf.js, którego używają inne narzędzia PDF na tej stronie — i wykorzystuje te dane wizualne do odtworzenia struktury: nagłówki, elementy list i akapity, zapisane jako Markdown.

Wykrywanie opiera się na rzeczywistych pomiarach, a nie na zgadywaniu udającym precyzję. Elementy tekstowe na stronie są grupowane w wiersze na podstawie bliskości ich położenia w pionie, rozmiar czcionki każdego wiersza jest obliczany na podstawie jego własnej macierzy renderowania tekstu, a następnie porównywany z medianą rozmiaru wiersza dla całego dokumentu — czyli rozmiarem, którego faktycznie używa większość wierszy, czyli zwykłego tekstu głównego. Wiersz wyraźnie większy od tej mediany staje się nagłówkiem Markdown (największe wiersze to #, umiarkowanie większe to ##); wiersz zaczynający się od znaku wypunktowania lub wcięty bardziej niż otaczające go wiersze staje się elementem listy `- `; cała reszta jest traktowana jako tekst główny i scalana w akapity.

Jest to, mówiąc szczerze, metoda heurystyczna, a nie parser strukturalny: pliki PDF nie zawierają gwarantowanych znaczników semantycznych, jedynie wizualne instrukcje rozmieszczenia tuszu, więc nietypowe wybory czcionek projektanta mogą czasem zmylić porównanie rozmiarów, a tabele są celowo pomijane — układy komórek nie dają się w żaden wiarygodny sposób sprowadzić do nagłówków, list czy akapitów i to narzędzie nie udaje, że jest inaczej. Każda strona jest wyraźnie oznaczona w wynikach separatorem „Strona N”, zgodnie z konwencją stosowaną przez narzędzie PDF na tekst z tej strony.

Zeskanowane strony są traktowane z taką samą uczciwością jak wszędzie na tej stronie: strona, która jest tak naprawdę tylko zdjęciem papieru, nie ma w ogóle warstwy tekstowej, więc zamiast po cichu generować pusty fragment, narzędzie odnotowuje dokładnie, których stron nie udało się odczytać, i wskazuje dla nich narzędzie Obraz na Tekst (OCR). Wszystko działa lokalnie w Twojej przeglądarce — nic nie jest wysyłane, nie ma limitów stron, a wynik trafia do pola tekstowego, które możesz skopiować lub zapisać jako plik .md otwierany w dowolnym edytorze obsługującym Markdown.