0

ממיר PDF ל-Markdown

חלץ טקסט מ-PDF כ-Markdown מובנה: זיהוי כותרות אמיתי לפי גודל גופן, זיהוי רשימות לפי תבליטים והזחה – לא קיר שטוח של טקסט.

🔒 מעובד כולו בדפדפן שלך - שום דבר שתזין כאן לא יועלה לעולם.

📑

גררו ושחררו מסמך PDF כאן

או לחצו לעיון בקבצי PDF

מעבד... 0%
טוען PDF
מחלץ טקסט עם מיקומים
מזהה כותרות ומבנה
סיום

תוצאה

פלט פשוט של "PDF לטקסט" נותן לך כל מילה בלי שום צורה: כותרת עמוד נראית בדיוק כמו הערת שוליים, ורשימת תבליטים הופכת למשפט רצוף. הכלי הזה הולך צעד קדימה על ידי קריאת גודל הגופן והמיקום האמיתיים של כל פריט טקסט מתוך ה-PDF – דרך מנוע ה-pdf.js שבו משתמשים כלי ה-PDF האחרים של האתר הזה – ושימוש בראיות החזותיות האלה כדי לשחזר מבנה: כותרות, פריטי רשימה ופסקאות, הכתובים כ-Markdown.

הזיהוי הוא באמת מבוסס מדידה, לא ניחוש שמתחפש לכזה. פריטי טקסט בעמוד מקובצים לשורות על פי קרבה אנכית של מיקומיהם, גודל הגופן של כל שורה מחושב מהמטריצה של עיבוד הטקסט שלה, וגודל זה מושווה לגודל השורה החציוני של המסמך כולו – הגודל שרוב השורות משתמשות בו בפועל, דהיינו טקסט גוף רגיל. שורה שגדולה באופן ניכר מאותו חציון הופכת לכותרת Markdown (השורות הגדולות ביותר הופכות ל-#, וגדולות באופן מתון יותר הופכות ל-##); שורה שמתחילה בתו תבליט או יושבת מוזחת פנימה ביחס לשורות שמסביבה הופכת לפריט רשימת `- `; כל השאר מטופל כטקסט גוף וממוזג לפסקאות.

בכנות, זוהי יוריסטיקה, לא מנתח מבני: קבצי PDF אינם נושאים סימון סמנטי מובטח, אלא רק הוראות חזותיות לאן הדיו אמור להגיע, כך שבחירות גופן חריגות של מעצב עלולות מדי פעם להטעות את השוואת הגדלים, וטבלאות הן במפורש מחוץ לתחום – פריסות תאים אינן מצטמצמות לכדי כותרות, רשימות או פסקאות בשום דרך אמינה, והכלי הזה לא מתיימר אחרת. כל עמוד מסומן בבירור באמצעות מפריד "עמוד N" בפלט, בהתאם למוסכמה שבה משתמש כלי ה-PDF לטקסט של האתר הזה.

עמודים סרוקים זוכים לאותו טיפול כן כמו בשאר האתר: לעמוד שהוא באמת רק תצלום של נייר אין שכבת טקסט כלל, כך שבמקום לייצר בשקט קטע ריק, הכלי מציין במדויק אילו עמודים הוא לא הצליח לקרוא ומפנה לכלי תמונה לטקסט (OCR) עבורם. הכל רץ באופן מקומי בדפדפן שלך – שום דבר לא מועלה, אין מגבלות עמודים, והתוצאה מגיעה לתיבת טקסט שאתה יכול להעתיק או לשמור כקובץ md. שנפתח בכל עורך שתומך ב-Markdown.