0

ממיר PDF ל-Markdown

חלץ טקסט של PDF כ-Markdown מובנה: זיהוי כותרות אמיתי מגודל גופן, זיהוי רשימה מכדורים וכניסה - לא קיר שטוח אחד של טקסט.

📑

גרור ושחרר מסמך PDF כאן

או לחץ כדי לעיין בקבצי PDF

Buy Me a Coffee at ko-fi.com
מעבד... 0%
טוען PDF
חילוץ טקסט עם מיקומים
איתור כותרות ומבנה
בוצע

תוצאה

dump רגיל של "PDF לטקסט" נותן לך כל מילה ללא שום צורה: כותרת עמוד נקראת בדיוק כמו הערת שוליים, ורשימת תבליטים הופכת למשפט רצוף. הכלי הזה הולך צעד אחד קדימה על ידי קריאת גודל הגופן והמיקום האמיתיים של כל פריט טקסט מתוך ה-PDF - באמצעות אותו מנוע pdf.js שכלי ה-PDF האחרים של אתר זה משתמשים בהם - ושימוש בראיות חזותיות כדי לשחזר מבנה: כותרות, פריטי רשימה ופסקאות, שנכתבו כ-Markdown.

הזיהוי הוא באמת מבוסס מדידה, לא ניחוש לבוש כאחד. פריטי טקסט בעמוד מקובצים לשורות לפי מידת הקירבה של המיקומים האנכיים שלהם, גודל הגופן של כל שורה מחושב ממטריצת עיבוד הטקסט שלה, והגודל הזה מושווה לגודל השורה החציונית עבור המסמך כולו - הגודל שרוב השורות משתמשות בהן בפועל, כלומר טקסט גוף רגיל. קו גדול במידה ניכרת מהחציון הזה הופך לכותרת Markdown (הקווים הגדולים ביותר הופכים ל-#, הגדולים במידה בינונית הופכים ל-#); שורה שמתחילה עם תו תבליט או מוזחה מעבר לשורות שמסביב הופכת לפריט רשימה של `-`; כל השאר מטופלים כטקסט גוף ומוזגים לפסקאות.

זה בכנות היוריסטיקה, לא מנתח מבני: קבצי PDF אינם נושאים סימון סמנטי מובטח, רק הוראות ויזואליות לאן הולך הדיו, כך שבחירות גופנים יוצאות דופן של מעצב עלולות להטעות מדי פעם את השוואת הגודל, וטבלאות הן בפירוש מחוץ לתחום - פריסות תאים אינן מצטמצמות לכותרות, רשימות או פסקאות בכלי לא מהימנים, או פסקאות. כל עמוד מסומן בבירור במחלק "עמוד N" בפלט, התואם את הקונבנציה המשמשת את הכלי PDF לטקסט של אתר זה.

דפים סרוקים זוכים לאותו יחס כנה כמו במקומות אחרים באתר זה: לדף שהוא בעצם רק צילום של נייר אין שכבת טקסט כלל, כך שבמקום לייצר קטע ריק בשקט, הכלי מציין בדיוק אילו עמודים הוא לא הצליח לקרוא ומצביע על הכלי Image to Text (OCR) עבור אלה. הכל פועל באופן מקומי בדפדפן שלך - שום דבר לא מועלה, אין מגבלות עמודים, והתוצאה נוחתת בתיבת טקסט שתוכל להעתיק או לשמור כקובץ .md שנפתח בכל עורך מודע ל-Markdown.