Baseer: A Vision-Language Model for Arabic Document-to-Markdown OCR
المساهمة
يقدّم نموذج رؤية ولغة عربيًا متخصصًا في التعرّف الضوئي على المستندات، إلى جانب Misraj-DocOCR، محققًا أفضل أداء في فهم المستندات العربية.
الملخص
لا يزال التعرّف الضوئي على المستندات العربية مهمة صعبة بسبب الخط المتصل وتنوّع الخطوط والتشكيل واتجاه الكتابة من اليمين إلى اليسار. ومع أن النماذج اللغوية الكبيرة متعددة الوسائط الحديثة طوّرت فهم المستندات في اللغات وفيرة الموارد، يبقى أداؤها في العربية محدودًا. نقدّم في هذا العمل بصير، وهو نموذج رؤية ولغة مُهيَّأ خصيصًا للتعرّف الضوئي على المستندات العربية. ويُدرَّب بصير، اعتمادًا على مجموعة بيانات واسعة تجمع بين مستندات اصطناعية وواقعية، باستخدام استراتيجية ضبط من نوع فك الترميز فقط، تُكيّف نموذجًا متعدد الوسائط مُدرَّبًا مسبقًا مع الحفاظ على سماته البصرية العامة. كما نقدّم Misraj-DocOCR، وهو معيار عالي الجودة تحقّق منه خبراء، صُمِّم لتقييم أنظمة التعرّف الضوئي العربية تقييمًا دقيقًا. وتُظهر تجاربنا أن بصير يتفوّق بفارق كبير على الحلول مفتوحة المصدر والتجارية القائمة، محققًا معدل خطأ في الكلمات قدره 0.25 ومرسّخًا مستوى جديدًا هو الأفضل في مجال التعرّف الضوئي على المستندات العربية. وتُبرز نتائجنا فائدة تكييف النماذج متعددة الوسائط العامة على مجال محدد، وترسي أساسًا متينًا للتعرّف الضوئي عالي الدقة في لغات غنية صرفيًا كالعربية.
استشهد بهذه الورقة
@misc{hennara2025baseer,
title = {Baseer: A Vision-Language Model for Arabic Document-to-Markdown OCR},
author = {Khalil Hennara and Muhammad Hreden and Mohamed Motasim Hamed and Ahmad Bastati and Zeina Aldallal and Sara Chrouf and Safwan AlModhayan},
year = {2025},
eprint = {2509.18174},
archivePrefix = {arXiv},
primaryClass = {cs.CV},
url = {https://arxiv.org/abs/2509.18174}
}