استخراج النص من ملف PDF
احصل على النص الخام لمستند في ملف بسيط يمكنك البحث فيه أو لصقه أو مقارنته أو تمريره إلى برنامج آخر.
استخراج النص من ملف PDF عبر الإنترنت
استخراج النص هو ما تحتاجه حين يكون التنسيق عائقًا: تريد الكلمات نفسها، للبحث فيها، أو لصقها في سكربت، أو مقارنة نسختين، أو تمريرها إلى أداة لا تقرأ إلا النص العادي. يقرأ PDF Vision المستند على الخادم باستخدام Poppler — محرك pdftotext نفسه المستخدم على نطاق واسع في Linux — ويعيد نص كل صفحة على حدة إضافة إلى كتلة واحدة مجمّعة، قابلة للتنزيل كملف .txt. الشرط المهم أن يحتوي ملف PDF فعلًا على نص. الملف الذي أنتجه Word أو برنامج محاسبة أو تصدير من موقع ويب يحتوي على نص. أما المسح الضوئي فلا: إنه صورة لكلمات، ولن يجد أي مستخرِج حروفًا لم تُكتب في الملف أصلًا. حين تعود النتيجة فارغة أو شبه فارغة، فهذا هو السبب — وتخبرك الأداة بذلك وتوجّهك إلى OCR الذي يتعرّف أولًا على الحروف في الصورة. الملفات حتى 10 ميغابايت و100 صفحة، وتُعالَج على خوادمنا، لذا يلزم حساب.
كيف تعمل
ارفع ملف PDF
حتى 10 ميغابايت و100 صفحة. يجب أن يكون نص المستند قابلًا للتحديد — إن كنت تستطيع تظليل كلمة في قارئ PDF، فسيُستخرج نصه.
قراءة النص
يقرأ Poppler المستند على الخادم ويعيد نص كل صفحة منفصلًا، إضافة إلى كتلة واحدة مجمّعة.
نزّل ملف .txt
احفظ ملف النص العادي، أو انسخ ما تحتاجه مباشرة من الصفحة.
لماذا تستخدمها
نص عادي، لا إعادة تنسيق
التحويل إلى Word يحاول إعادة بناء التصميم وقد يغيّر ترتيب العناصر. أما الاستخراج فيعطيك الكلمات كما هي، وهذا ما يحتاجه فعلًا سكربت أو بحث أو مقارنة.
صفحة بصفحة وكاملًا أيضًا
تُعاد كل صفحة على حدة، فيمكنك الاقتباس من صفحة محددة أو معالجة المستند صفحة بصفحة بدل فكّ تشابك كتلة طويلة واحدة.
يخبرك حين يكون الملف ممسوحًا ضوئيًا
النتيجة الفارغة تُشخَّص بدل أن تبقى لغزًا: المستند الذي لا يحتوي على طبقة نص يُشار إليه، وتُوجَّه إلى OCR بدل تكرار المحاولة نفسها.