باختصار
المستندات العربية الممسوحة ضوئيًا من أصعب ما تقرؤه أنظمة الذكاء الاصطناعي، والاختبارات المعيارية العامة تؤكد ذلك. والأخطاء متوقعة المواضع: الأرقام، والجداول، والكلمات الممدودة، والأختام، والسطور التي تجمع العربية والإنجليزية. وقبل أن تثقوا بأي أداة، اختبروها على 20 إلى 30 صفحة من مستنداتكم أنتم، وقيّموا الحقول التي تحمل المبالغ والتواريخ، وحدّدوا ما يذهب دائمًا إلى شخص.
لماذا يهم هذا في المناقصات
كثير من كراسات الشروط في مصر والخليج ليست ملفات رقمية نظيفة. فالصفحات الموقّعة والمختومة تُمسح ضوئيًا، وجداول الكميات تُطبع ثم تُمسح من جديد، وتجتمع العربية والإنجليزية في الصفحة نفسها. والتعرف الضوئي على الحروف (OCR) هو الخطوة الأولى في أي نظام ذكاء اصطناعي يقرأ هذه المستندات، فإذا أخطأ في كمية أو تاريخ، ورث كل ما يُبنى فوقه الخطأ نفسه.
وللغة وزن قانوني أيضًا. فنظام المنافسات والمشتريات الحكومية في السعودية ينص على تحرير العقود والمستندات المرتبطة بها باللغة العربية، وعلى أن العربية هي المعتمدة إذا استُخدمت لغة أخرى معها (المادة 55 من نظام 2019). فالنص العربي كثيرًا ما يكون هو الذي يُعتدّ به.
ماذا تقول الأبحاث
يُعد KITAB-Bench، وهو اختبار معياري لقراءة المستندات العربية وفهمها قُدّم في مؤتمر ACL 2025، من أشمل الاختبارات العامة. وبحسب مؤلفيه:
- يضم 8,809 عيّنات في 9 مجالات رئيسية و36 مجالًا فرعيًا، منها الخط اليدوي والجداول المنظمة و21 نوعًا من الرسوم البيانية.
- تتفوق نماذج الرؤية واللغة الحديثة على أدوات التعرف الضوئي التقليدية (EasyOCR وPaddleOCR وSurya) بمتوسط 60% في معدل خطأ الحروف.
- ومع ذلك، لم تتجاوز دقة أفضل نموذج 65% في تحويل ملفات PDF إلى صيغة Markdown.
- والصعوبات التي يسمّونها: الخطوط المعقدة، وأخطاء قراءة الأرقام، ومدّ الكلمات، واكتشاف بنية الجداول.
وهنا تحفّظان. الاختبار المعياري ليس مستنداتكم، فقد تكون ملفاتكم أفضل أو أسوأ. ونتائج النماذج تتغير بسرعة، فاختبار تجرونه هذا الربع أنفع من أي رقم منقول من العام الماضي.
أين تفشل مستندات المناقصات
| ما الذي يفشل | لماذا يهم في المناقصة | ما الذي تفحصونه |
|---|---|---|
| نظاما أرقام | قد يستخدم النص العربي الأرقام الهندية (٠ إلى ٩، الرموز U+0660 إلى U+0669) أو الأرقام 0 إلى 9، وأحيانًا في الصفحة نفسها. والرقم المقروء خطأً يغيّر كمية أو سعرًا أو تاريخًا. | كل كمية وتاريخ ورقم بند، رقمًا رقمًا |
| سطور تجمع العربية والإنجليزية | جملة عربية فيها DN150 أو رقم مواصفة قياسية أو بند مثل 3.1.2 قد يختل ترتيبها عند استخراج النص. | ترتيب القراءة في السطور المختلطة |
| الكلمات الممدودة | حرف التطويل (U+0640) يمد الكلمات في العناوين، وقد يفسد البحث ومطابقة الكلمات. | ابحثوا عن مصطلحات معروفة في العناوين |
| الجداول | في جداول الكميات خلايا مدمجة وأعمدة من اليمين إلى اليسار ومجاميع فرعية، وأي عمود منزاح يضع الكمية أمام بند خطأ. | محاذاة الصفوف والأعمدة خلية خلية في صفحتين أو ثلاث |
| الأختام والتواقيع والخط اليدوي | الأختام تغطي النص، والملاحظات اليدوية تضيف شروطًا. | هل تُحال الصفحات المختومة إلى شخص؟ |
| المسح الرديء | الصفحات المائلة أو الباهتة أو المصوّرة تفقد حروفًا. | هل تُعلَّم الصفحات الرديئة بدل قراءتها بصمت؟ |
اختبار تجرونه على ملفاتكم
- اختاروا 20 إلى 30 صفحة من مناقصات سابقة: ملفات PDF نصية نظيفة، وصفحات ممسوحة، وجداول كميات، وصفحات مختومة، وصفحات مختلطة اللغة.
- اكتبوا مفتاح الإجابات يدويًا للحقول المهمة: الكميات والوحدات والتواريخ وأرقام البنود والمتطلبات الأساسية.
- شغّلوا الأداة وقيّموا الحقول لا الصفحات. الرقم صحيح فقط إذا صحّت كل خاناته. وكمية واحدة خاطئة أخطر من مئة كلمة صحيحة، لذلك يخفي رقم «الدقة الإجمالية» الوحيد حجم الخطر.
- افحصوا المصادر. هل يشير كل عنصر مستخرج إلى الصفحة التي جاء منها؟ افتحوا بعضها وتأكدوا.
- افحصوا سلوكها عند الشك. هل تعلّم الصفحات التي لم تقرأها جيدًا، أم تُخرج نصًا واثقًا رغم ذلك؟
- اكتبوا القاعدة. حدّدوا مسبقًا ما يذهب دائمًا إلى شخص، مثل كل رقم مقروء من صفحة ممسوحة.
| نوع الصفحة في العيّنة | ما الذي تقيّمونه |
|---|---|
| ملف PDF نصي نظيف | المتطلبات المستخرجة، بالصفحة والبند الصحيحين |
| صفحة عربية ممسوحة | الأرقام والتواريخ بدقة تامة، وترتيب القراءة |
| جدول كميات | البند والوحدة والكمية في الصف نفسه |
| صفحة مختومة أو موقّعة | هل أُحيلت للمراجعة: نعم أو لا |
| صفحة مختلطة اللغة | بقاء الرموز وأرقام المواصفات سليمة وبالترتيب الصحيح |
ما يبقى بيد فريقكم
- قراءة الملاحظات اليدوية وكل ما تحت الأختام.
- الكميات النهائية في جدول الكميات المسعّر.
- كل بند تعلّمه الأداة بأنه غير مؤكد.
- قرار مستوى الدقة المقبول لشركتكم.
أخطاء القراءة ليست سببًا لتجنب الذكاء الاصطناعي في المستندات العربية، بل سبب لقياسه على ملفاتكم، وإظهار مصدر كل سطر، وإحالة ما فيه شك إلى الناس.
أسئلة
هل قراءة المستندات العربية آليًا جيدة بما يكفي للمناقصات؟
للصفحات النظيفة غالبًا نعم. أما الممسوحة والمختومة والجداول فيعتمد الأمر على المستندات، وأفضل نموذج في KITAB-Bench لم يتجاوز 65% في تحويل PDF إلى Markdown. اختبروها على ملفاتكم قبل الاعتماد عليها.
هل تُحوَّل الأرقام الهندية إلى أرقام 0 إلى 9؟
في الحسابات تحتاج الأرقام إلى صيغة واحدة ثابتة. احتفظوا بالأصل ظاهرًا بجانب القيمة المحوّلة، ليتحقق المراجع من الاثنين.
لماذا لا نكتفي برقم دقة واحد؟
لأن الأخطاء ليست متساوية. قيّموا الحقول التي تحمل المبالغ والتواريخ والكميات منفصلة عن النص العام.
المصادر
- Heakl et al., KITAB-Bench: A Comprehensive Multi-Domain Benchmark for Arabic OCR and Document Understanding, ACL 2025 (arXiv 2502.14949), abstract. Accessed 5 October 2026.
- The Unicode Consortium, Arabic code chart (U+0600 to U+06FF). Character names U+0660, U+0669 and U+0640 confirmed against the Unicode Character Database 15.1 on 5 October 2026.
- وزارة المالية السعودية، نظام المنافسات والمشتريات الحكومية (الترجمة الإنجليزية المنشورة على موقع الوزارة)، المادة 55. اطُّلع عليه في 5 أكتوبر 2026.
كُتب هذا المقال بمساعدة الذكاء الاصطناعي وراجعه فريقنا.