قوات الدفاع الشعبي لتحويل النص
قم باستخراج النص العادي من طبقة نص ملف PDF في المتصفح، صفحة بصفحة، جاهز للنسخ أو التنزيل.
النتيجة
من السهل قراءة ملف PDF ولكن من الصعب إعادة استخدامه: لا يمكنك دائمًا تحديد نصه بشكل واضح، كما أن نسخ صفحة تلو الأخرى يدويًا أمر شاق. تستخرج هذه الأداة النص العادي من طبقة النص في ملف PDF بتمريرة واحدة، داخل متصفحك بالكامل، وتعيده جاهزًا للنسخ أو التنزيل - بدون تحميل، أو حساب، أو علامة مائية.
يعمل الاستخراج صفحة بعد صفحة. يتم سحب نص كل صفحة من طبقة النص الخاصة بالمستند ويتم فصله بواسطة علامة "صفحة N" واضحة، بحيث يظل التقرير المؤلف من خمسين صفحة منظمًا بدلاً من طيه في جدار واحد من الكلمات غير المتمايزة. تصل النتيجة إلى مربع نص يمكنك قراءته أو تحديده أو نسخه إلى الحافظة أو حفظه كملف txt يمكن فتحه في أي مكان.
الصدق مهم هنا: العديد من ملفات PDF عبارة عن نسخ ممسوحة ضوئيًا - صور فوتوغرافية للورق بدون طبقة نص على الإطلاق. عندما يحدث ذلك، لن يجد أي قدر من الاستخراج كلمات، لذا بدلاً من إرجاع ملف فارغ بصمت، تكتشف الأداة النتيجة الفارغة وتخبرك أن المستند عبارة عن مسح ضوئي، وتوجهك إلى أداة تحويل الصورة إلى نص (OCR) التي يمكنها بالفعل قراءة وحدات البكسل. هذا هو مستخرج النص، وليس محرك التعرف الضوئي على الحروف، ولا يتظاهر بتحويل ملف PDF إلى مستند Word قابل للتحرير.
نظرًا لأن العملية برمتها تتم على جهازك الخاص من خلال محرك pdf.js، فإن العقود والبيانات والسجلات السرية لا تترك الجهاز أبدًا - لا توجد حدود للصفحات ولا يوجد خادم ذهابًا وإيابًا. إذا كنت تريد الصفحات كصور بدلاً من النص، فإن أداة تحويل PDF إلى JPG تعرض كل صفحة على شكل صورة بدلاً من ذلك.