مختبر كَون
نبني النماذج ومجموعات البيانات والمعايير وطرق التدريب التي يحتاجها الذكاء الاصطناعي العربي ليوجد أصلًا.
الأوراق البحثية
Misraj AI at AR-MS NAKBA-NLP 2026: A State-of-the-Art VLM in Arabic Handwritten Text Recognition
يقدّم نموذج رؤية ولغة متخصصًا في التعرّف على النص العربي المكتوب بخط اليد، حصل على المركز الأول وأرسى مستوى جديدًا هو الأفضل على معيار Nakba للتعرّف الضوئي.
Linguistic Specialization of Arabic in Text Embedding Models via Multi-Teacher Knowledge Distillation
يقترح إطارًا لتقطير المعرفة متعدد المعلّمين لنماذج التضمين المتجهي العربية، ويقدّم Kawn-Embed-Light، محققًا أفضل أداء بين نماذج التضمين المتجهي العربية التي تقل عن مليار معامل.
Kuwain 1.5B: An Arabic SLM via Language Injection
يقدّم طريقة جديدة لحقن اللغة لبناء نماذج لغوية عربية صغيرة، تتيح التخصص في العربية مع الحفاظ على قدرات النموذج الأصلي.
Lahjawi: Arabic Cross-Dialect Translator
يقدّم أول عائلة نماذج للترجمة بين اللهجات العربية ومن اللهجة إلى الفصحى عبر 15 لهجة عربية.
Mutarjim: Advancing Bidirectional Arabic-English Translation with a Small Language Model
يقدّم نموذج ترجمة عربي إنجليزي صغير الحجم، إلى جانب Tarjama-25، وهو معيار شامل للترجمة الآلية بين العربية والإنجليزية.
Sadeed: Advancing Arabic Diacritization Through Small Language Models
يقدّم نموذجًا للتشكيل العربي إلى جانب SadeedDiac-25، وهو معيار جديد لتقييم متين عبر أنواع نصية عربية متنوعة.
Baseer: A Vision-Language Model for Arabic Document-to-Markdown OCR
يقدّم نموذج رؤية ولغة عربيًا متخصصًا في التعرّف الضوئي على المستندات، إلى جانب Misraj-DocOCR، محققًا أفضل أداء في فهم المستندات العربية.
Wasm: A Pipeline for Constructing Structured Arabic Interleaved Multimodal Corpora
يقدّم مسارًا مفتوحًا لبناء مجموعات بيانات عربية متعددة الوسائط ومنظمة وواسعة النطاق من Common Crawl، مع الحفاظ على بنية المستند بصيغة Markdown.
Annotating Real-World Quranic Recitations for Mispronunciation Detection and Diagnosis
يقدّم منهجية وسمٍ واسعة النطاق واعية بأحكام التجويد ومدوّنة لكشف أخطاء النطق في التلاوة القرآنية وتشخيصها، بما يمهّد لأنظمة تعرّف آلي على التلاوة واعية بالنطق.
ARISQU: A Dataset for Quotation Extraction and Attribution in Islamic Jurisprudential Issues
يقدّم ARISQU، أول مجموعة بيانات موسومة يدويًا لاستخراج الاقتباسات الإسلامية ونسبتها، تضم 8,800 اقتباس مستخرَجة من 856,000 كلمة وفق مخطط وسمٍ دقيق من 14 وسمًا.
لنتحدث عمّا تحاول بناءه.
أخبرنا بالمشكلة، وسنخبرك بصراحة إن كان الذكاء الاصطناعي هو الحل الصحيح.