مقالات · المستندات العربية

قراءة مستندات المناقصات العربية الممسوحة ضوئيًا: ما الذي يفشل وكيف تختبرونه

باختصار

المستندات العربية الممسوحة ضوئيًا من أصعب ما تقرؤه أنظمة الذكاء الاصطناعي، والاختبارات المعيارية العامة تؤكد ذلك. والأخطاء متوقعة المواضع: الأرقام، والجداول، والكلمات الممدودة، والأختام، والسطور التي تجمع العربية والإنجليزية. وقبل أن تثقوا بأي أداة، اختبروها على 20 إلى 30 صفحة من مستنداتكم أنتم، وقيّموا الحقول التي تحمل المبالغ والتواريخ، وحدّدوا ما يذهب دائمًا إلى شخص.

لماذا يهم هذا في المناقصات

كثير من كراسات الشروط في مصر والخليج ليست ملفات رقمية نظيفة. فالصفحات الموقّعة والمختومة تُمسح ضوئيًا، وجداول الكميات تُطبع ثم تُمسح من جديد، وتجتمع العربية والإنجليزية في الصفحة نفسها. والتعرف الضوئي على الحروف (OCR) هو الخطوة الأولى في أي نظام ذكاء اصطناعي يقرأ هذه المستندات، فإذا أخطأ في كمية أو تاريخ، ورث كل ما يُبنى فوقه الخطأ نفسه.

وللغة وزن قانوني أيضًا. فنظام المنافسات والمشتريات الحكومية في السعودية ينص على تحرير العقود والمستندات المرتبطة بها باللغة العربية، وعلى أن العربية هي المعتمدة إذا استُخدمت لغة أخرى معها (المادة 55 من نظام 2019). فالنص العربي كثيرًا ما يكون هو الذي يُعتدّ به.

ماذا تقول الأبحاث

يُعد KITAB-Bench، وهو اختبار معياري لقراءة المستندات العربية وفهمها قُدّم في مؤتمر ACL 2025، من أشمل الاختبارات العامة. وبحسب مؤلفيه:

  • يضم 8,809 عيّنات في 9 مجالات رئيسية و36 مجالًا فرعيًا، منها الخط اليدوي والجداول المنظمة و21 نوعًا من الرسوم البيانية.
  • تتفوق نماذج الرؤية واللغة الحديثة على أدوات التعرف الضوئي التقليدية (EasyOCR وPaddleOCR وSurya) بمتوسط 60% في معدل خطأ الحروف.
  • ومع ذلك، لم تتجاوز دقة أفضل نموذج 65% في تحويل ملفات PDF إلى صيغة Markdown.
  • والصعوبات التي يسمّونها: الخطوط المعقدة، وأخطاء قراءة الأرقام، ومدّ الكلمات، واكتشاف بنية الجداول.

وهنا تحفّظان. الاختبار المعياري ليس مستنداتكم، فقد تكون ملفاتكم أفضل أو أسوأ. ونتائج النماذج تتغير بسرعة، فاختبار تجرونه هذا الربع أنفع من أي رقم منقول من العام الماضي.

أين تفشل مستندات المناقصات

ما الذي يفشللماذا يهم في المناقصةما الذي تفحصونه
نظاما أرقامقد يستخدم النص العربي الأرقام الهندية (٠ إلى ٩، الرموز U+0660 إلى U+0669) أو الأرقام 0 إلى 9، وأحيانًا في الصفحة نفسها. والرقم المقروء خطأً يغيّر كمية أو سعرًا أو تاريخًا.كل كمية وتاريخ ورقم بند، رقمًا رقمًا
سطور تجمع العربية والإنجليزيةجملة عربية فيها DN150 أو رقم مواصفة قياسية أو بند مثل 3.1.2 قد يختل ترتيبها عند استخراج النص.ترتيب القراءة في السطور المختلطة
الكلمات الممدودةحرف التطويل (U+0640) يمد الكلمات في العناوين، وقد يفسد البحث ومطابقة الكلمات.ابحثوا عن مصطلحات معروفة في العناوين
الجداولفي جداول الكميات خلايا مدمجة وأعمدة من اليمين إلى اليسار ومجاميع فرعية، وأي عمود منزاح يضع الكمية أمام بند خطأ.محاذاة الصفوف والأعمدة خلية خلية في صفحتين أو ثلاث
الأختام والتواقيع والخط اليدويالأختام تغطي النص، والملاحظات اليدوية تضيف شروطًا.هل تُحال الصفحات المختومة إلى شخص؟
المسح الرديءالصفحات المائلة أو الباهتة أو المصوّرة تفقد حروفًا.هل تُعلَّم الصفحات الرديئة بدل قراءتها بصمت؟

اختبار تجرونه على ملفاتكم

  1. اختاروا 20 إلى 30 صفحة من مناقصات سابقة: ملفات PDF نصية نظيفة، وصفحات ممسوحة، وجداول كميات، وصفحات مختومة، وصفحات مختلطة اللغة.
  2. اكتبوا مفتاح الإجابات يدويًا للحقول المهمة: الكميات والوحدات والتواريخ وأرقام البنود والمتطلبات الأساسية.
  3. شغّلوا الأداة وقيّموا الحقول لا الصفحات. الرقم صحيح فقط إذا صحّت كل خاناته. وكمية واحدة خاطئة أخطر من مئة كلمة صحيحة، لذلك يخفي رقم «الدقة الإجمالية» الوحيد حجم الخطر.
  4. افحصوا المصادر. هل يشير كل عنصر مستخرج إلى الصفحة التي جاء منها؟ افتحوا بعضها وتأكدوا.
  5. افحصوا سلوكها عند الشك. هل تعلّم الصفحات التي لم تقرأها جيدًا، أم تُخرج نصًا واثقًا رغم ذلك؟
  6. اكتبوا القاعدة. حدّدوا مسبقًا ما يذهب دائمًا إلى شخص، مثل كل رقم مقروء من صفحة ممسوحة.
نوع الصفحة في العيّنةما الذي تقيّمونه
ملف PDF نصي نظيفالمتطلبات المستخرجة، بالصفحة والبند الصحيحين
صفحة عربية ممسوحةالأرقام والتواريخ بدقة تامة، وترتيب القراءة
جدول كمياتالبند والوحدة والكمية في الصف نفسه
صفحة مختومة أو موقّعةهل أُحيلت للمراجعة: نعم أو لا
صفحة مختلطة اللغةبقاء الرموز وأرقام المواصفات سليمة وبالترتيب الصحيح

ما يبقى بيد فريقكم

  • قراءة الملاحظات اليدوية وكل ما تحت الأختام.
  • الكميات النهائية في جدول الكميات المسعّر.
  • كل بند تعلّمه الأداة بأنه غير مؤكد.
  • قرار مستوى الدقة المقبول لشركتكم.

أخطاء القراءة ليست سببًا لتجنب الذكاء الاصطناعي في المستندات العربية، بل سبب لقياسه على ملفاتكم، وإظهار مصدر كل سطر، وإحالة ما فيه شك إلى الناس.

أسئلة

هل قراءة المستندات العربية آليًا جيدة بما يكفي للمناقصات؟

للصفحات النظيفة غالبًا نعم. أما الممسوحة والمختومة والجداول فيعتمد الأمر على المستندات، وأفضل نموذج في KITAB-Bench لم يتجاوز 65% في تحويل PDF إلى Markdown. اختبروها على ملفاتكم قبل الاعتماد عليها.

هل تُحوَّل الأرقام الهندية إلى أرقام 0 إلى 9؟

في الحسابات تحتاج الأرقام إلى صيغة واحدة ثابتة. احتفظوا بالأصل ظاهرًا بجانب القيمة المحوّلة، ليتحقق المراجع من الاثنين.

لماذا لا نكتفي برقم دقة واحد؟

لأن الأخطاء ليست متساوية. قيّموا الحقول التي تحمل المبالغ والتواريخ والكميات منفصلة عن النص العام.

المصادر

  1. Heakl et al., KITAB-Bench: A Comprehensive Multi-Domain Benchmark for Arabic OCR and Document Understanding, ACL 2025 (arXiv 2502.14949), abstract. Accessed 5 October 2026.
  2. The Unicode Consortium, Arabic code chart (U+0600 to U+06FF). Character names U+0660, U+0669 and U+0640 confirmed against the Unicode Character Database 15.1 on 5 October 2026.
  3. وزارة المالية السعودية، نظام المنافسات والمشتريات الحكومية (الترجمة الإنجليزية المنشورة على موقع الوزارة)، المادة 55. اطُّلع عليه في 5 أكتوبر 2026.

كُتب هذا المقال بمساعدة الذكاء الاصطناعي وراجعه فريقنا.

نيوراكتور · ذكاء اصطناعي وأنظمة

القراءة علينا، والقرار لكم.

ابدأوا بمسار عمل واحد.

أخبرونا أي مسار عمل لديكم بطيء ويدوي ومثقل بالمستندات. سنردّ برأينا: هل يساعد الذكاء الاصطناعي، وما الذي سيدرسه التشخيص. بلا التزام وبلا قوائم بريدية.

info@neuractor.com