PDF'den Markdown'a Dönüştürücü
PDF metnini yapılandırılmış Markdown olarak çıkarın: yazı tipi boyutundan gerçek başlık tespiti, madde işaretlerinden ve girintiden liste tespiti - tek bir düz metin duvarı değil.
Sonuç
Sade bir "PDF'den metne" dökümü size her kelimeyi herhangi bir şekle sahip olmadan verir: bir sayfa başlığı tam olarak bir dipnot gibi okunur ve madde işaretli bir liste devam eden bir cümleye dönüşür. Bu araç, her metin öğesinin gerçek yazı tipi boyutunu ve konumunu PDF'den okuyarak (bu sitenin diğer PDF araçlarının kullandığı pdf.js motorunun aynısını kullanarak) ve bu görsel kanıtı yapıyı yeniden oluşturmak için kullanarak (Markdown olarak yazılan başlıklar, liste öğeleri ve paragraflar) bir adım daha ileri gider.
Tespit, gerçek anlamda ölçüme dayalıdır, tek bir tahmin gibi giyinmiş bir tahmin değildir. Bir sayfadaki metin öğeleri, dikey konumlarının yakınlığına göre satırlar halinde gruplandırılır; her satırın yazı tipi boyutu, kendi metin oluşturma matrisinden hesaplanır ve bu boyut, tüm belgenin ortalama satır boyutuyla (çoğu satırın gerçekte kullandığı boyut, yani sıradan gövde metni) karşılaştırılır. Bu medyandan gözle görülür derecede daha büyük bir çizgi Markdown başlığı haline gelir (en büyük çizgiler # olur, orta derecede daha büyük olanlar ## olur); madde işareti karakteriyle başlayan veya çevresindeki satırları geçecek şekilde girintili olarak oturan bir satır, bir `- ` liste öğesi haline gelir; geri kalan her şey ana metin olarak değerlendirilir ve paragraflar halinde birleştirilir.
Bu açıkçası bir yapısal ayrıştırıcı değil buluşsal bir yöntemdir: PDF dosyaları garantili bir anlamsal işaretleme içermez, yalnızca mürekkebin nereye gittiğine dair görsel talimatlar taşır, bu nedenle bir tasarımcının olağandışı yazı tipi seçimleri zaman zaman boyut karşılaştırmasını yanıltabilir ve tablolar açıkça kapsam dışındadır; hücre düzenleri güvenilir bir şekilde başlıklara, listelere veya paragraflara indirgenmez ve bu araç aksini iddia etmez. Her sayfa, çıktıda bu sitenin PDF'den metne dönüştürme aracı tarafından kullanılan kuralla eşleşen bir "Sayfa N" bölücüsüyle açıkça işaretlenmiştir.
Taranan sayfalar, bu sitenin diğer yerlerinde olduğu gibi aynı dürüst muameleye tabi tutulur: gerçekte yalnızca bir kağıt fotoğrafı olan bir sayfada hiçbir metin katmanı yoktur, bu nedenle, araç sessizce boş bir bölüm oluşturmak yerine tam olarak hangi sayfaları okuyamadığını not eder ve bunlar için Görüntüden Metne (OCR) aracını işaret eder. Her şey tarayıcınızda yerel olarak çalışır; hiçbir şey yüklenmez, sayfa sınırlaması yoktur ve sonuç, herhangi bir Markdown uyumlu düzenleyicide açılan, kopyalayabileceğiniz veya .md dosyası olarak kaydedebileceğiniz bir metin kutusuna ulaşır.