PDF إلى Markdown

تحويل ملف PDF إلى Markdown

احصل على ملف Markdown تبقى فيه العناوين عناوين والقوائم قوائم — لا كتلة نص واحدة مسطّحة.

تحويل ملف PDF إلى Markdown عبر الإنترنت

لا يحمل ملف PDF أي بنية، بل يحمل رموزًا مرسومة عند إحداثيات محددة: لا شيء في الملف يقول «هذا السطر عنوان» أو «هذه الأسطر الثلاثة قائمة». لهذا يمنحك استخراج النص من PDF جدارًا من الأسطر يُقرأ فيه العنوان تمامًا كما تُقرأ الفقرة — وهذا يكفي للبحث عن عبارة، لكنه لا ينفع في إعادة بناء مستند. تعيد هذه الأداة بناء البنية انطلاقًا مما تعرضه الصفحة فعلًا. السطر المكتوب بحجم أكبر بوضوح من متن النص يصبح عنوانًا، وكلما زاد الفرق ارتفع مستواه — ويُقاس ذلك نسبةً إلى الحجم السائد في المستند نفسه لا إلى عتبة ثابتة، بحيث يُقرأ نص مكتوب بحجم 9 نقاط وآخر بحجم 14 نقطة كلٌّ وفق مقاييسه الخاصة. الأسطر التي يفصل بينها تباعد عادي يُعاد وصلها في فقرات، لأن PDF يقطع كل جملة عند نهاية كل سطر. وتتحول النقاط والعناصر المرقّمة إلى قوائم Markdown. أما الخط العريض فيُكتشف من الخط نفسه ويُعلَّم في موضعه، فيبقى التأكيد في منتصف الجملة محفوظًا. والنتيجة ملف .md يمكنك لصقه في وثائق توثيق أو تطبيق ملاحظات أو سلسلة استرجاع معلومات — وهي الصيغة التي تحتاجها هذه الأدوات فعلًا.

كيف تعمل

  1. ارفع ملف PDF

    حتى 10 ميغابايت و100 صفحة. يجب أن يحتوي المستند على طبقة نص حقيقية — إن كنت تستطيع تحديد كلمة في قارئ PDF، فسيتم تحويله.

  2. إعادة بناء البنية

    العناوين حسب الحجم النسبي، والقوائم حسب علاماتها، والفقرات يُعاد وصلها، والخط العريض يُعلَّم في موضعه.

  3. انسخ ملف .md أو نزّله

    اقرأه على الشاشة، أو انسخه بنقرة واحدة، أو احفظ ملف Markdown.

لماذا تستخدمها

العناوين تبقى عناوين

تأتي المستويات من حجم النص السائد في المستند نفسه، فيبقى التسلسل الهرمي قائمًا بدل أن ينهار في كتلة واحدة مسطّحة.

الصيغة التي تطلبها أدوات الذكاء الاصطناعي

تستوعب سلاسل الاسترجاع وتطبيقات الملاحظات صيغة Markdown أفضل بكثير من النص الخام: فالبنية تخبرها بما هو مهم وأين يبدأ كل قسم.

يخبرك بما لم يستطع فعله

جدول ظهر على شكل أسطر، أو مستند ممسوح ضوئيًا بلا طبقة نص، أو مستند يتجاوز حد الصفحات — كل ذلك يُبلَّغ عنه بدل أن تكتشفه بنفسك داخل الملف.

الأسئلة الشائعة

ما الفرق بين هذا واستخراج النص؟
الاستخراج يعطيك الكلمات مجرّدة من أي سياق — كل الأسطر متشابهة، والعنوان يُقرأ كأنه جملة عادية. أما هنا فتُعاد بناء البنية: العناوين تصبح # و##، والنقاط تصبح قوائم، والأسطر التي تنتمي إلى فقرة واحدة يُعاد وصلها، والخط العريض يُعلَّم. استخدم الاستخراج للبحث عن عبارة، واستخدم Markdown لتحافظ على مستند مقروء أو لتقدّمه لأداة تقرأ Markdown.
كيف يتم التعرّف على العناوين؟
من خلال حجمها النسبي. تحدّد الأداة حجم النص السائد في المستند — الحجم الذي تستخدمه أغلب الحروف — وتعامل ما يتجاوزه بوضوح على أنه عنوان، ويرتفع المستوى كلما زاد الفرق. وهذا مهم: فالعتبة الثابتة كانت ستجعل كل سطر في مستند مكتوب بحجم 16 نقطة عنوانًا، ولن تجد أي عنوان في مستند مكتوب بحجم 9 نقاط.
هل تتحول الجداول إلى جداول Markdown؟
لا، وهذا مقصود. الجدول في PDF ليس سوى أعمدة مصفوفة بمحاذاة معيّنة؛ وإعادة بناء شبكته تعني التخمين، والتخمين الخاطئ ينتج جدولًا يبدو صحيحًا ويُقرأ خطأً. لذلك تخرج الصفوف على شكل أسطر نصية، وتخبرك الأداة بأنها وجدت أعمدة. وإن كنت تحتاج إلى خلايا حقيقية، فأداة تحويل PDF إلى Excel تعيد بناءها.
ماذا يحدث مع ملف PDF ممسوح ضوئيًا؟
المسح الضوئي صورة: لا توجد فيه طبقة نص، وبالتالي لا شيء يمكن هيكلته. وبدل أن تسلّمك الأداة ملفًا فارغًا، تخبرك بذلك وتوجّهك إلى أداة OCR التي تضيف طبقة نص. بعد ذلك يعمل التحويل بشكل طبيعي.
هل يُحافَظ على الخط العريض والمائل؟
الخط العريض نعم، ويُعلَّم حيث يظهر — في منتصف الجملة إن كان هناك، لا على السطر كله. ويُكتشف من الخط الذي يستخدمه المستند. أما الخط المائل فلا يُعلَّم في هذا الإصدار.
هل أحتاج إلى حساب؟
نعم — يعمل التحويل على خوادمنا، لذا يتطلب تسجيل الدخول. إنشاء الحساب مجاني.