Wasm: A Pipeline for Constructing Structured Arabic Interleaved Multimodal Corpora
المساهمة
يقدّم مسارًا مفتوحًا لبناء مجموعات بيانات عربية متعددة الوسائط ومنظمة وواسعة النطاق من Common Crawl، مع الحفاظ على بنية المستند بصيغة Markdown.
الملخص
يعتمد أداء النماذج اللغوية الكبيرة والنماذج الكبيرة متعددة الوسائط اعتمادًا كبيرًا على جودة مجموعات بيانات التدريب المسبق وحجمها. وتُظهر أبحاث حديثة أن النماذج متعددة الوسائط المدرَّبة على مستندات طبيعية تتداخل فيها الصور والنصوص تتفوّق على تلك المدرَّبة على أزواج صورة ونص فقط عبر طيف واسع من المعايير، مستفيدةً من نماذج مدرَّبة مسبقًا متقدمة لفرض الاتساق الدلالي وتناسق تسلسل الصور وترابط النص. أما في العربية، فقد حدّ نقص مجموعات البيانات متعددة الوسائط عالية الجودة التي تحافظ على بنية المستند من التقدّم. نعرض في هذه الورقة مسارنا Wasm لمعالجة بيانات Common Crawl وإنشاء مجموعة بيانات عربية متعددة الوسائط تقدّم مخرجات بصيغة Markdown على نحو فريد. وخلافًا للمدوّنات العربية القائمة التي تقتصر على استخراج النص، يحافظ منهجنا على سلامة بنية محتوى الويب مع إبقاء المرونة لسيناريوهات التدريب المسبق النصية ومتعددة الوسائط معًا. ونقدّم تحليلًا مقارنًا شاملًا لمسار معالجة البيانات لدينا مقابل المسارات المستخدمة في مجموعات البيانات الكبرى القائمة، مع إبراز أوجه التقارب في استراتيجيات التصفية وتسويغ خياراتنا التصميمية المحددة. ودعمًا للأبحاث المستقبلية، أتحنا للعموم نسخة تمثيلية من مجموعة البيانات إلى جانب مسار المعالجة متعدد الوسائط للعربية.
استشهد بهذه الورقة
@misc{hennara2025wasm,
title = {Wasm: A Pipeline for Constructing Structured Arabic Interleaved Multimodal Corpora},
author = {Khalil Hennara and Ahmad Bastati and Muhammad Hreden and Mohamed Motasim Hamed and Zeina Aldallal and Sara Chrouf and Safwan AlModhayan},
year = {2025},
eprint = {2511.07080},
archivePrefix = {arXiv},
primaryClass = {cs.CL},
url = {https://arxiv.org/abs/2511.07080}
}