PDFIntact

استخرج الجداول والنصوص من ملف PDF كما هي

تحديد ما إذا كان PDF يحتاج إلى OCR أو استعادة طبقة النص أو إعادة بناء التخطيط قبل استخراج المحتوى

OCR أم استخراج النص من PDF؟ 3 اختبارات قبل التحويل

استخدم اختبارات التحديد والنسخ والتخطيط لتعرف هل يحتاج PDF إلى OCR، أم استعادة طبقة النص، أم إعادة بناء الجداول وترتيب القراءة.

فريق تحرير PDFIntactنُشر

تعذّر استخراج النص لا يعني دائمًا أنك تحتاج إلى OCR

إذا لم يخرج النص من PDF بصورة صحيحة، فليس تشغيل OCR فورًا هو الحل في كل مرة. تقع معظم الملفات التي تعاني هذه المشكلة في واحدة من ثلاث حالات:

  1. الصفحة صورة فقط ولا تحتوي على بيانات نصية.
  2. بيانات النص موجودة، لكن الربط بين الحروف الظاهرة والحروف المنسوخة مفقود أو معطّل.
  3. يمكن استخراج الحروف، لكن بنية الجدول أو ترتيب الأعمدة يضيع.

تحتاج الحالة الأولى إلى OCR للتعرّف على الحروف داخل الصورة. وقد تتطلب الثانية إعادة بناء النص بالاستفادة من مظهره والمعلومات الموجودة. أما الثالثة فهي مشكلة في إعادة بناء التخطيط أكثر من كونها مشكلة تعرّف على الحروف. أجرِ الاختبارات التالية قبل اختيار طريقة التحويل.

الاختبار ١: هل يمكنك تحديد النص؟

افتح الملف في قارئ PDF واسحب المؤشر على جملة.

لا يمكن تحديد أي شيء

قد تكون الصفحة كلها صورة واحدة. وهذا شائع في المستندات الممسوحة ضوئيًا والملفات المصدّرة كصور، وهو استخدام مناسب لـOCR.

لكن أذونات المستند أو برنامج العرض نفسه قد يمنعان التحديد. جرّب الملف في قارئ PDF قياسي آخر قبل الجزم بعدم وجود طبقة نص.

يمكن تحديد مساحة على شكل النص

يحتوي PDF على طبقة نص من نوع ما. انسخ عينة قصيرة وافحصها قبل إضافة OCR. فقد يؤدي وضع طبقة OCR أخرى إلى تكرار الحروف وجعل البحث والنسخ أصعب.

الاختبار ٢: ماذا يحدث عند نسخ جملة واحدة؟

الصق مقطعًا قصيرًا في محرر نص عادي وصنّف النتيجة:

النتيجة الحالة المحتملة الخطوة التالية
تظهر الجملة صحيحة طبقة النص قابلة للاستخدام افحص الجداول والأعمدة والبنية فقط
تظهر حروف مختلفة الحروف المرئية لا ترتبط بالمحارف الصحيحة أعد بناء النص من مظهره المرئي
تظهر نتيجة فارغة طبقة النص ناقصة أو الصفحة صورة افحص صفحات أخرى
تظهر الكلمات بترتيب خاطئ مشكلة في الأعمدة أو ترتيب العناصر أعد بناء ترتيب القراءة
يظهر كل حرف مرتين قد تتداخل الصورة مع طبقة OCR أزل النص المكرر قبل الاستخراج

لا تحكم على PDF كله من صفحة واحدة. كرر الاختبار على صفحة متن عادية وصفحة فيها جدول وصفحة قرب نهاية المستند. قد يجمع الملف الواحد بين صفحات ممسوحة وأخرى منشأة رقميًا.

الاختبار ٣: هل الحروف صحيحة لكن البنية مختلة؟

نجاح نسخ المتن لا يضمن أن الاستخراج صالح للاستخدام. قد يُلصق الجدول في عمود واحد، أو يختلط عمودا البحث، أو تضيع العلاقات المكانية في المعادلة. هنا نجح التعرّف على الحروف، لكن المعلومات البنيوية مفقودة.

في الجداول

أعد بناء حدود الخلايا والعناوين المدمجة والعلاقة بين الصفوف والأعمدة. إضافة مزيد من النص عبر OCR لا تعيد بنية خلايا الجدول.

في الصفحات ذات العمودين

حدّد التسلسل المقصود بحسب لغة النص بدلًا من ترتيب كل حرف وفق إحداثيات الصفحة فقط. في النص العربي يكون غالبًا العمود الأيمن ثم الأيسر، والعكس في اللغات المكتوبة من اليسار إلى اليمين.

في المعادلات

ينبغي تمثيل الأسس والرموز السفلية والكسور والجذور كبنية رياضية، لا كسلسلة مسطحة من الحروف.

متى تستخدم OCR ومتى تستخرج النص الموجود؟

حالة PDF OCR طبقة النص الموجودة إعادة بناء البنية
صورة ممسوحة فقط مطلوب غير متاحة مطلوبة إذا احتوت الصفحة على جداول أو أعمدة
النص المنسوخ مشوّه مفيد أحيانًا للاستعادة المرئية قد تعطي دلائل على المواضع بحسب التخطيط
المتن يُنسخ صحيحًا غير ضروري عادةً استخدمها مطلوبة للجداول أو الأعمدة أو المعادلات
نص OCR يظهر مرتين لا تضف طبقة أخرى أزل التكرار أو وفّق بين النسخ عند الحاجة

وصف الملف بأنه «قابل للبحث» أو «عولج بـOCR» لا يضمن صلاحية طبقة النص. اختبر التحديد ودقة النسخ وترتيب القراءة وبنية الجداول كلًّا على حدة.

احتفظ بالأصل قبل تشغيل OCR مرة أخرى

لا تستبدل PDF الأصلي بنسخة ذات طبقة نص جديدة. احتفظ بالأصل والنسخة المعالجة والمخرجات المستخرجة في ملفات منفصلة حتى تتمكن من المقارنة بينها.

أدرج تاريخ المعالجة أو رقم الإصدار في اسم كل ملف، وحافظ على صلة كل مخرج بمصدره. يزداد ذلك أهمية عندما ستُستخدم القيم المستخرجة في التحليل.

تسلسل سريع لاتخاذ القرار

  1. هل يمكن تحديد النص؟
  2. هل تُنسخ جملة واحدة بدقة؟
  3. هل بنية الجداول والأعمدة والمعادلات سليمة؟
  4. هل تختلف الحالة بين الصفحات؟
  5. هل تحتاج إلى Excel أم Word أم Markdown أم JSON؟

تفصل هذه الأسئلة بين التعرّف على الصورة واستعادة طبقة النص وإعادة بناء التخطيط، وتساعدك على تجنب OCR غير الضروري.

يعرض فحص PDFIntact المجاني، داخل المتصفح ومن دون رفع الملف الأصلي، عدد الصفحات وحالة طبقة النص وعدد الجداول والأشكال المكتشفة. ولا يعرض معاينة للنص المستخرج أو يثبت صحة ترتيب القراءة وبنية الجداول. اختر طريقة التحويل ثم تحقّق من المخرجات بصورة مستقلة.

افحص الملف دون رفعه

اعرف أولًا ما يمكن استخراجه من ملف PDF هذا

يعمل الفحص المجاني داخل متصفحك. ولا يُرفع ملفك الأصلي.

افحص ملف PDF الذي لا يمكن نسخه مجانًا